目次7 セクション
FASTVLM VS GEMMA 4 / GEMMA 3N
Gemma 4(2026年4月)と Gemma 3n(2025年)は Google のスマートフォン・ノート PC 向け汎用マルチモーダルモデルで、FastVLM は視覚優先のモデルです。スコアよりも範囲の違いが重要で、Gemma は音声、長いコンテキスト、エージェントツールに対応し、FastVLM は高速な高解像度画像理解に集中しています。
| 項目 | FastVLM | Gemma 4 (E2B / E4B) | Gemma 3n (E2B / E4B) |
|---|---|---|---|
| 開発元 · 公開 | Apple · 2025年 | Google · 2026年4月2日 | Google · 2025年 |
| オンデバイスサイズ | 0.5B · 1.5B · 7B | E2B · E4B(ワークステーション向けに 12B、26B-A4B、31B) | E2B · E4B(実効パラメータ) |
| モダリティ | 画像 + テキスト | 画像、フレームとしての動画、テキスト。E2B/E4B は音声も | 画像、音声、テキスト |
| コンテキスト長 | 短いプロンプト向け。長文脈モデルではない | 128K トークン(E2B/E4B、Google) | 32K トークン(Google) |
| ブラウザ | 0.5B は Transformers.js(本サイト) | ランタイム依存(LiteRT / MediaPipe 系の導入) | ランタイム依存(Google AI Edge) |
| MLX / Apple Silicon | 公式 MLX アプリ | コミュニティの mlx-vlm 変換 | コミュニティの mlx-vlm 変換 |
| ライセンス | Apple ML Research ライセンス | Gemma 利用規約 | Gemma 利用規約 |
確認日 2026-09-17
選択の要約
- 音声、長い文書、動画を画像と併用するアシスタントには Gemma。
- 仕事全体が「この高解像度画像を見て素早く答える」なら、特に Apple アプリ内では FastVLM。
- どちらのベンダーも相互比較を公開していないため、モダリティとランタイム適合を決め手にしてください。
FastVLM を選ぶ場合
- 高解像度の画像のみの入力
- ベンダーランタイム不要のブラウザデモ
- Apple 優先の導入
Gemma を選ぶ場合
- 音声や動画の入力
- 長いコンテキストとツールを使うエージェント
- Google AI Edge の Android・クロスプラットフォームランタイム
表の読み方
Gemma のサイズは「実効」パラメータ数(E2B は密な 2.3B 相当のメモリ)で、マルチモーダルベンチマークは Google の環境、FastVLM の数値は Apple の環境によるものです。表は文書化された機能を記録しており、計測した品質ではありません。
よくある質問
Gemma 4 は Transformers.js で動きますか?
現行の Transformers.js モデル一覧を確認してください。Google のブラウザ・スマートフォン向け参照経路は独自の AI Edge ランタイムです。FastVLM-0.5B はここで試せる ONNX ビルドがあります。
出典
続きを読む
続きを読む
同じテーマやツールに関連する記事。
関連ツール
この記事のテーマに近いディレクトリ項目を確認できます。








