目次3 セクション
FastVLM 1.5B Stage3 の「1.5B」はモデルの規模、「Stage3」は後期の指示チューニング段階を表します。動かすには、使うフレームワークに合った重みの形式を選ぶ必要があります。Stage3 の ZIP は、そのまま起動できるアプリではありません。
Stage3 · 第二段階との違い
Stage2 は視覚指示データによる学習、Stage3 はさらに質の高い指示や推論例を取り入れた段階です。両者は異なるチェックポイントです。論文の結果を再現する場合は、学習段階、モデル規模、評価条件を必ず記録してください。詳しくは論文と公式モデル一覧を参照してください 。
| 実行方法 | 入手先 | 注意点 |
|---|---|---|
| 元の PyTorch 実装 | Stage3 1.5B PyTorch ZIP | 展開し、Apple の推論スクリプトから読み込みます。 |
| Mac / iPhone 向けネイティブアプリ | Stage3 1.5B Apple Silicon 用 ZIP | 公式アプリの手順に従って指定の場所に配置します。 |
| Hugging Face との連携 | Apple の 1.5B モデルカード | そのチェックポイントに対応したライブラリと呼び出し方を使います。 |
ファイル名の llm.int8 は言語モデルの出力形式を示すもので、アプリ全体のピークメモリを示しません。画像の解像度、一時バッファ、生成長、実行環境によって必要な資源が変わります。
Apple のネイティブアプリ
対応する Xcode を導入し、公式アプリの説明で OS とビルド要件を確認します。リポジトリの app/get_pretrained_mlx_model.sh --model 1.5b --dest app/FastVLM/model を使って必要なファイルを配置し、app/FastVLM/FastVLM.xcodeproj を開きます。現行の要件は公式説明を優先してください。PyTorch の ZIP をそのままアプリのフォルダへ入れないでください。
元の PyTorch 実装
公式のセットアップ手順に従って環境を作り 、PyTorch の重みを展開して、推論スクリプトにそのディレクトリを指定します。Transformers で画像に質問する完全な例はPython ガイドを参照してください。その例は互換性を確認した別の変換重みを使うため、Apple Silicon 用の出力とは交換できません。
ファイルが見つからない、テンソル形状が合わない、メモリが不足するといった場合は、ダウンロードの完了、学習段階、重みの形式を先に確認してください。ブラウザで使う場合はWebGPU ガイドもあります。
続きを読む
同じテーマやツールに関連する記事。
関連ツール
この記事のテーマに近いディレクトリ項目を確認できます。









