# STARFlow：Apple 以 normalizing flow 替代扩散模型的路线

STARFlow 系列把自回归 normalizing flow 扩展到高分辨率图像（STARFlow）、视频（STARFlow-V，2026）以及统一的多模态理解与生成（STARFlow2，2026 年 8 月）。架构、论文与代码链接。

Canonical URL: https://aiidelist.com/zh/blog/starflow-zh

Language: zh

Published: 2026-09-24

Updated: 2026-09-24

APPLE STARFLOW · NORMALIZING-FLOW GENERATION

扩散模型主导着图像生成，但 Apple 的 STARFlow 路线表明自回归 normalizing flow（TARFlow）可以扩展到高分辨率图像、视频，最终成为一个既能理解也能生成图像与文本的单一模型。Flow 提供精确似然与便于缓存的自回归采样。

[STARFlow2 研究页面](https://machinelearning.apple.com/research/starflow2-multimodal-generation)[GitHub：apple/ml-starflow](https://github.com/apple/ml-starflow)

## STARFlow 与扩散、flow matching 的区别

扩散与 flow matching 模型通过多步学习去噪或把噪声搬运到数据。normalizing flow 是用精确最大似然训练的可逆网络；采样只需一次确定性的逆向前传。STARFlow 通过在潜空间工作并堆叠自回归 Transformer flow 块实现规模化，代价是模型设计更复杂，而不是采样步数更多。

## STARFlow2 与统一多模态模型

STARFlow2 在同一因果掩码下，通过残差跳连把冻结的预训练 VLM 流与 TARFlow 流交错。语言侧保留理解能力，flow 侧负责生成图像；由于两者共享 KV 缓存，交错生成文字和图片时不需要重新编码之前的输出。

## 应该部署到端侧吗？

暂时不必。它们仍是研究规模的生成模型；请把本页当作论文、代码与术语的参考，而不是部署指南。目前可在端侧运行的视觉模型请使用 FastVLM、MobileCLIP2 或 Depth Pro。

## 常见问题

**有 STARFlow 的在线 Demo 吗？**

本站没有。这种规模的图像生成需要服务器 GPU，与 FastVLM.net 的端侧定位不符。官方样例与 checkpoint 请关注 GitHub 仓库。

## 速览

**STARFlow**

2025 · 面向高分辨率图像合成的潜空间 normalizing flow

**STARFlow-V**

2026 年 4 月 · 用 normalizing flow 进行端到端视频生成

**STARFlow2**

2026 年 8 月 · 统一的多模态理解与交错图文生成（“Pretzel” 架构）

**核心思想**

自回归 flow 与 Transformer LLM 共享因果掩码与 KV 缓存机制

**代码**

GitHub 上的 apple/ml-starflow；已发布的 checkpoint 以仓库为准

核对于 2026-09-17

## 官方来源

- [STARFlow (Apple Research)](https://machinelearning.apple.com/research/starflow)
- [STARFlow-V (Apple Research)](https://machinelearning.apple.com/research/starflow-v-video-modeling)
- [STARFlow2 paper (arXiv 2605.08029)](https://arxiv.org/abs/2605.08029)

## 相关页面

- [Apple Foundation Models](/zh/blog/apple-foundation-models-zh)
- [全部 Apple 模型](/zh/blog/apple-ai-models-zh)
- [全部 Apple 模型](/zh/blog/apple-ai-models-zh)
