FastVLM 0.5B
ブラウザと小規模な実験
手元の画像で説明、文字の読み取り、グラフへの質問を試せます。
0.5B を試すApple の視覚言語モデル
画像について質問し、ブラウザで試してから、Python または WebGPU でアプリを構築できます。
FastVLM は FastViTHD の視覚エンコーダと大規模言語モデルを組み合わせます。用途と端末に合わせてモデルの規模を選び、重みの形式、実行環境、メモリ要件を確認してください。
ブラウザデモにはコミュニティによる FastVLM-0.5B の ONNX 変換を使用します。初回のダウンロードは約 1.1 GB です。

モデル規模、学習ステージ、実行環境は別々の選択です。このサイトのブラウザデモは 0.5B を実行します。大きなモデルには対応するローカル環境が必要です。
ブラウザと小規模な実験
手元の画像で説明、文字の読み取り、グラフへの質問を試せます。
0.5B を試すローカル開発
Stage3 の重みを確認し、PyTorch、Transformers、Apple のネイティブアプリで必要なファイルを区別します。
Stage3 ガイドを読む公開ベンチマークで高いスコア
公式の結果を比較し、実際に使う端末で遅延とメモリ使用量を測定してください。
モデルを比較公開スコアは特定のデータセットと条件による結果です。ブラウザ用の変換モデルが手元の端末で同じ性能を出すとは限りません。同じ評価項目の中で比較し、自分の画像でも確認してください。
スコアと評価条件を見る