目次3 セクション
FastVLM 有 0.5B、1.5B 和 7B 三种模型大小。选择时先确定运行环境,再挑选对应的权重和精度。模型参数量、训练阶段(Stage2/Stage3)、权重格式是不同的概念,不能只看文件名中的一个数字。
如何选择
| 模型 | 适合的起点 | 需要确认的事项 |
|---|---|---|
| 0.5B | 浏览器体验、轻量实验 | 浏览器演示使用社区 ONNX 转换版,而不是 Apple 原始 PyTorch 权重。 |
| 1.5B | 本地应用与 Stage3 实验 | 根据 PyTorch、Transformers 或 Apple 原生应用选择对应文件。 |
| 7B | 需要比较更高公布分数的研究 | 在目标设备上验证显存、延迟与实际回答质量。 |
Apple 的官方代码库与模型目录列出原始权重及运行方式 。0.5B 、1.5B和7B模型卡提供各自的下载说明 。此站的浏览器演示运行 onnx-community/FastVLM-0.5B-ONNX,属于社区转换版;它不能直接替代 Apple 的原始权重。完整 Python 示例使用另一个经过验证的 Transformers 转换版本,详见Python 指南。
下载前的检查
- 确认你要使用浏览器、Transformers、原始 PyTorch 实现还是 Apple 原生应用。
- 阅读该权重自己的模型卡与许可说明。不要把 Apple Silicon 导出文件当作通用 PyTorch 检查点。
- 预留模型加载时的临时内存;仅凭参数量无法确定峰值内存。
- 用自己的图片、提示词和设备测试质量、首次加载和后续推理的耗时。
1.5B 的 Stage3 文件与设置见专项指南;浏览器开发可下载WebGPU 示例。
Published benchmarks · 公布的基准结果
以下为 Apple 模型卡公布的分数 ,并非本站重新测得的结果。同一行可比较三个模型;不同数据集采用不同的评分方法,不能混成一个综合排名。
| 基准测试 | 0.5B | 1.5B | 7B |
|---|---|---|---|
| AI2D | 68.0 | 77.4 | 83.6 |
| ScienceQA | 85.2 | 94.4 | 96.7 |
| MMMU | 33.9 | 37.8 | 45.4 |
| VQAv2 | 76.3 | 79.1 | 80.8 |
| ChartQA | 76.0 | 80.1 | 85.0 |
| TextVQA | 64.5 | 70.4 | 74.9 |
| InfoVQA | 46.4 | 59.7 | 75.8 |
| DocVQA | 82.5 | 88.3 | 93.2 |
| OCRBench | 63.9 | 70.2 | 73.1 |
| RealWorldQA | 56.1 | 61.2 | 67.2 |
| SeedBench-Img | 71.0 | 74.2 | 75.4 |
原论文讨论了视觉编码、首 token 延迟和图像分辨率对结果的影响:FastVLM 论文 。这些公布分数不能保证浏览器转换版或你的设备会达到相同质量与速度。旧站的24 张图片评测采用另一套方法 ,不应与上表混算。
比较模型时建议同时记录模型版本、权重格式、图像大小、设备、推理库和生成长度。先在在线演示用几张真实图片验证任务是否适合,再决定是否下载更大的权重。本站是独立开发者资源,并非 Apple 官方网站。
続きを読む
同じテーマやツールに関連する記事。
関連ツール
この記事のテーマに近いディレクトリ項目を確認できます。









