目次7 セクション
APPLE STARFLOW · NORMALIZING-FLOW GENERATION
画像生成は拡散モデルが主流ですが、Apple の STARFlow 系列は自己回帰正規化フロー(TARFlow)が高解像度画像、次に動画、最終的に画像とテキストを理解し生成する単一モデルへスケールできることを示しています。フローは厳密な尤度とキャッシュに優しい自己回帰サンプリングを提供します。
STARFlow2 研究ページGitHub :apple/ml-starflow
STARFlow と拡散・フローマッチングの違い
拡散モデルとフローマッチングは多段階でノイズ除去やノイズからデータへの輸送を学習します。正規化フローは厳密な最尤で学習する可逆ネットワークで、サンプリングは逆変換の1回の決定的パスです。STARFlow は潜在空間で動作し自己回帰 Transformer フローブロックを積むことでスケールします。トレードオフはサンプリング回数ではなくモデル設計の複雑さです。
STARFlow2 と統合マルチモーダルモデル
STARFlow2 は凍結した事前学習 VLM ストリームと TARFlow ストリームを、単一の因果マスクの下で残差スキップ接続により交互に組み合わせます。言語側は理解能力を保ち、フロー側が画像を生成します。両者が KV キャッシュを共有するため、交互のテキスト・画像生成で以前の出力を再エンコードする必要がありません。
オンデバイスに導入すべき?
まだ早いです。これらは研究規模の生成モデルであり、このページは導入ガイドではなく論文、コード、用語のリファレンスとして扱ってください。現在オンデバイスで動く視覚モデルには FastVLM、MobileCLIP2、Depth Pro を使用してください。
よくある質問
STARFlow のデモはありますか?
本サイトにはありません。この規模の画像生成にはサーバー GPU が必要で、FastVLM.net のオンデバイス方針と合いません。公式サンプルとチェックポイントは GitHub リポジトリを参照してください。
概要
STARFlow
2025年 · 高解像度画像合成のための潜在正規化フロー
STARFlow-V
2026年4月 · 正規化フローによるエンドツーエンド動画生成
STARFlow2
2026年8月 · 統合マルチモーダル理解と交互テキスト・画像生成(「Pretzel」アーキテクチャ)
中核となる考え
自己回帰フローは Transformer LLM の因果マスクと KV キャッシュ機構を共有
コード
GitHub の apple/ml-starflow。公開チェックポイントはリポジトリを確認
確認日 2026-09-17
公式ソース
関連
続きを読む
同じテーマやツールに関連する記事。
関連ツール
この記事のテーマに近いディレクトリ項目を確認できます。









