本页目录3 个章节
FastVLM 1.5B Stage3 中,“1.5B”表示模型大小,“Stage3”表示后期指令训练阶段。要成功运行,仍需根据使用的框架选择正确的权重格式。Stage3 压缩包不是可以直接双击安装的应用。
Stage3 · 与第二阶段的区别
Stage2 在视觉指令数据上训练,Stage3 进一步加入高质量指令和推理示例。两个阶段对应不同的检查点;如果你要复现论文中的某个结果,必须记录所用阶段、模型大小和评测条件。细节请参阅论文及官方模型目录 。
| 运行方式 | 文件来源 | 关键区别 |
|---|---|---|
| 原始 PyTorch 实现 | Stage3 1.5B PyTorch 压缩包 | 解压后按 Apple 代码库的推理命令加载。 |
| Apple 原生 Mac/iPhone 应用 | Stage3 1.5B Apple Silicon 导出包 | 按官方应用脚本将文件放入预期目录。 |
| Hugging Face 集成 | Apple 1.5B 模型卡 | 依照模型卡选择兼容的库和调用方式。 |
文件名中的 llm.int8 只描述语言模型权重的导出精度,不代表整套应用的峰值内存。图像分辨率、临时缓存、生成长度和运行时都会改变资源需求。
Apple 原生应用路径
安装兼容版本的 Xcode,并检查官方应用说明中的系统要求 。下载代码库后,可使用其 app/get_pretrained_mlx_model.sh --model 1.5b --dest app/FastVLM/model 脚本放置应用所需文件,再打开 app/FastVLM/FastVLM.xcodeproj。请以官方当前说明为准,不要把原始 PyTorch ZIP 直接放入应用目录。
原始 PyTorch 路径
按照官方安装说明建立环境 ,解压 PyTorch 权重,然后在预测脚本中指向解压后的模型目录。若要使用 Transformers 的完整图片问答示例,请转到Python 指南;该示例使用不同的兼容转换权重,不能随意替换为 Apple Silicon 导出文件。
如果出现文件找不到、形状不匹配或内存不足,先核对下载是否完整、模型阶段及格式是否与代码一致,再缩小图片和生成长度。需要浏览器方案时,参阅WebGPU 指南。
继续阅读
更多围绕相同主题、协议或工具的文章。
引用的工具
浏览与本文主题相关的目录条目。









