本页目录3 个章节
FastVLM には 0.5B、1.5B、7B の 3 つの規模があります。まず実行環境を決め、その環境に対応する重みと精度を選んでください。パラメータ数、学習ステージ(Stage2 / Stage3)、重みの形式は別の概念です。ファイル名の数字だけでは互換性を判断できません。
0.5B をオンラインで試す · FastVLM の概要に戻る
モデルを選ぶ
| モデル | 主な用途 | 確認事項 |
|---|---|---|
| 0.5B | ブラウザでの試用、小規模な実験 | このサイトのデモはコミュニティによる ONNX 変換版であり、Apple の元の PyTorch 重みとは異なります。 |
| 1.5B | ローカルアプリ、Stage3 の検証 | PyTorch、Transformers、Apple のネイティブアプリでは必要なファイルが違います。 |
| 7B | 公開ベンチマークで高いスコアを検討 | 実機でメモリ、遅延、回答品質を測定してください。 |
Apple の公式リポジトリとモデル一覧には元の重みと実行手順があります 。0.5B 、1.5B 、7B のモデルカードも個別に確認してください。このサイトのブラウザデモは onnx-community/FastVLM-0.5B-ONNX を使います。Python の完全なサンプルは、互換性を確認した別の Transformers 変換モデルを使用します。Python ガイドに違いを記載しています。
ダウンロード前の確認
- ブラウザ、Transformers、元の PyTorch 実装、Apple のネイティブアプリのどれを使うか決めます。
- 対象のモデルカードとライセンスを読みます。Apple Silicon 向けの出力を一般的な PyTorch チェックポイントとして扱わないでください。
- 読み込み時の一時メモリを確保します。パラメータ数だけではピーク使用量は分かりません。
- 実際に使う画像、プロンプト、端末で精度と所要時間を試します。
1.5B のファイル選択はStage3 ガイド、ブラウザアプリの作成はWebGPU ガイドをご覧ください。
Published benchmarks · 公開ベンチマークの読み方
次の数値は Apple のモデルカードに掲載されたスコアで 、このサイトが再測定した結果ではありません。同じ行で 3 つの規模を比較できますが、異なるデータセットの数値を一つの順位にまとめることはできません。
| ベンチマーク | 0.5B | 1.5B | 7B |
|---|---|---|---|
| AI2D | 68.0 | 77.4 | 83.6 |
| ScienceQA | 85.2 | 94.4 | 96.7 |
| MMMU | 33.9 | 37.8 | 45.4 |
| VQAv2 | 76.3 | 79.1 | 80.8 |
| ChartQA | 76.0 | 80.1 | 85.0 |
| TextVQA | 64.5 | 70.4 | 74.9 |
| InfoVQA | 46.4 | 59.7 | 75.8 |
| DocVQA | 82.5 | 88.3 | 93.2 |
| OCRBench | 63.9 | 70.2 | 73.1 |
| RealWorldQA | 56.1 | 61.2 | 67.2 |
| SeedBench-Img | 71.0 | 74.2 | 75.4 |
FastVLM の論文には視覚エンコーダ 、最初のトークンまでの時間、画像解像度の条件が記載されています。公開値はブラウザ変換版や手元の端末で同じ品質と速度が出ることを保証しません。旧サイトの24 枚の画像による評価は別の方法を使っており 、この表の値と混ぜてはいけません。
比較するときはモデルの版、重みの形式、画像サイズ、端末、推論ライブラリ、生成長を一緒に記録してください。まずオンラインデモで実際の画像を試してから、大きなモデルの導入を判断するのが安全です。このサイトは独立した開発者向け資料で、Apple の公式サービスではありません。
继续阅读
更多围绕相同主题、协议或工具的文章。
引用的工具
浏览与本文主题相关的目录条目。









