目次7 セクション
APPLE STARFLOW · NORMALIZING-FLOW GENERATION
扩散模型主导着图像生成,但 Apple 的 STARFlow 路线表明自回归 normalizing flow(TARFlow)可以扩展到高分辨率图像、视频,最终成为一个既能理解也能生成图像与文本的单一模型。Flow 提供精确似然与便于缓存的自回归采样。
STARFlow2 研究页面GitHub :apple/ml-starflow
STARFlow 与扩散、flow matching 的区别
扩散与 flow matching 模型通过多步学习去噪或把噪声搬运到数据。normalizing flow 是用精确最大似然训练的可逆网络;采样只需一次确定性的逆向前传。STARFlow 通过在潜空间工作并堆叠自回归 Transformer flow 块实现规模化,代价是模型设计更复杂,而不是采样步数更多。
STARFlow2 与统一多模态模型
STARFlow2 在同一因果掩码下,通过残差跳连把冻结的预训练 VLM 流与 TARFlow 流交错。语言侧保留理解能力,flow 侧负责生成图像;由于两者共享 KV 缓存,交错生成文字和图片时不需要重新编码之前的输出。
应该部署到端侧吗?
暂时不必。它们仍是研究规模的生成模型;请把本页当作论文、代码与术语的参考,而不是部署指南。目前可在端侧运行的视觉模型请使用 FastVLM、MobileCLIP2 或 Depth Pro。
常见问题
有 STARFlow 的在线 Demo 吗?
本站没有。这种规模的图像生成需要服务器 GPU,与 FastVLM.net 的端侧定位不符。官方样例与 checkpoint 请关注 GitHub 仓库。
速览
STARFlow
2025 · 面向高分辨率图像合成的潜空间 normalizing flow
STARFlow-V
2026 年 4 月 · 用 normalizing flow 进行端到端视频生成
STARFlow2
2026 年 8 月 · 统一的多模态理解与交错图文生成(“Pretzel” 架构)
核心思想
自回归 flow 与 Transformer LLM 共享因果掩码与 KV 缓存机制
代码
GitHub 上的 apple/ml-starflow;已发布的 checkpoint 以仓库为准
核对于 2026-09-17
官方来源
相关页面
続きを読む
同じテーマやツールに関連する記事。
関連ツール
この記事のテーマに近いディレクトリ項目を確認できます。







