AI IDE List

Apple の視覚言語モデル

FastVLM

画像について質問し、ブラウザで試してから、Python または WebGPU でアプリを構築できます。

FastVLM は FastViTHD の視覚エンコーダと大規模言語モデルを組み合わせます。用途と端末に合わせてモデルの規模を選び、重みの形式、実行環境、メモリ要件を確認してください。

ブラウザデモにはコミュニティによる FastVLM-0.5B の ONNX 変換を使用します。初回のダウンロードは約 1.1 GB です。

Concept illustration of a laptop examining a photo of a tangerine and cup, with an image card and blue question bubble

適切なモデルから始める

モデル規模、学習ステージ、実行環境は別々の選択です。このサイトのブラウザデモは 0.5B を実行します。大きなモデルには対応するローカル環境が必要です。

FastVLM 0.5B

ブラウザと小規模な実験

手元の画像で説明、文字の読み取り、グラフへの質問を試せます。

0.5B を試す

FastVLM 1.5B

ローカル開発

Stage3 の重みを確認し、PyTorch、Transformers、Apple のネイティブアプリで必要なファイルを区別します。

Stage3 ガイドを読む

FastVLM 7B

公開ベンチマークで高いスコア

公式の結果を比較し、実際に使う端末で遅延とメモリ使用量を測定してください。

モデルを比較

最初の回答から自分のアプリまで

ベンチマークを正しく読む

公開スコアは特定のデータセットと条件による結果です。ブラウザ用の変換モデルが手元の端末で同じ性能を出すとは限りません。同じ評価項目の中で比較し、自分の画像でも確認してください。

スコアと評価条件を見る

公式資料

関連モデルとブラウザツール