AI资讯 / 研究

研究 / 官方

苹果提出统一多模态生成新架构,让语言模型与归一化流无缝融合

Apple Machine Learning

苹果机器学习研究团队发布论文,介绍新一代统一多模态生成模型STARFlow2。现有多模态模型普遍存在结构性缺陷:离散化分词牺牲视觉保真度,扩散模型与自回归文本生成的结合造成结构不对称,而直接将视觉语言模型适配为生成模型则会损害预训练理解能力。STARFlow2的核心洞察在于,自回归归一化流与大语言模型共享相同的因果掩码、KV缓存机制和从左到右的生成结构,天然适合作为统一多模态生成的基础范式。该模型基于Pretzel架构,通过残差跳跃连接将冻结的预训练视觉语言模型流与TARFlow流垂直交织,两者共用同一因果掩码。结合深浅流设计与统一FAE潜在空间,STARFlow2支持缓存友好的交错生成,文本与视觉输出均可直接进入KV缓存而无需重新编码。实验结果在图像生成与多模态理解基准上均表现出色。

当前多模态大模型领域面临一个长期未解决的结构性矛盾:如何在同一框架内同时实现高质量的文本理解与高保真的图像生成。离散视觉分词方案虽然便于与语言模型对接,但会不可避免地损失图像细节;而将扩散模型与自回归语言模型拼接的方案,则在生成机制上存在本质的不对称性,导致系统复杂度上升、推理效率下降。苹果研究团队认为,这一问题的根源在于缺乏一种真正统一的生成范式。

STARFlow2的关键突破来自一个重要观察:自回归归一化流本质上就是自回归Transformer,与大语言模型共享因果掩码、KV缓存机制以及从左到右的序列生成结构。这意味着归一化流可以与语言模型在同一套计算框架下协同运作,而无需引入额外的解码机制或结构适配层。这一发现为构建真正意义上的统一多模态模型提供了理论基础,使连续、单次、纯因果的多模态生成成为可能。

在架构设计上,STARFlow2采用名为Pretzel的核心结构,通过残差跳跃连接将一个冻结的预训练视觉语言模型流与TARFlow流进行垂直交织,两个流共用同一因果掩码运行。冻结预训练模型的设计确保了原有多模态理解能力得以完整保留,而TARFlow流则专注于高保真连续图像的生成任务。这种垂直交织而非简单拼接的方式,使两个模块能够在每一层都进行深度特征交互,显著提升了生成质量。

为进一步提升推理效率,STARFlow2引入了深浅流设计与统一FAE潜在空间。深浅流设计根据生成任务的复杂程度动态分配计算资源,而统一FAE潜在空间则允许文本输出与视觉输出以相同的表示形式直接写入KV缓存,无需在生成后对视觉内容进行重新编码。这一设计使得交错式文本-图像序列的生成更加高效,在长序列多模态内容生成场景下优势尤为明显。

在实验评估方面,STARFlow2在图像生成基准与多模态理解基准上均取得了有竞争力的成绩,验证了自回归归一化流作为统一多模态建模基础的可行性。该研究是苹果STARFlow系列的延续,此前团队已发布面向视频生成的STARFlow-V,并在CVPR 2026上展示了归一化流在视频领域的应用潜力。STARFlow2的发布进一步表明,归一化流有望成为下一代多模态基础模型的重要技术路线之一。

要点

  • 自回归归一化流与大语言模型共享因果掩码和KV缓存机制,天然适合作为统一多模态生成的基础范式,无需引入扩散模型等异构解码机制。
  • Pretzel架构通过残差跳跃连接将冻结预训练视觉语言模型与TARFlow流垂直交织,在保留原有理解能力的同时实现高保真连续图像生成。
  • 统一FAE潜在空间使文本与视觉输出均可直接进入KV缓存,显著提升了交错式多模态序列生成的推理效率。
  • STARFlow2在图像生成与多模态理解双类基准上均表现出色,验证了该架构路线的实用价值。
  • 该研究是苹果STARFlow系列的重要进展,与STARFlow-V共同构成归一化流在图像和视频多模态生成领域的完整布局。
查看原始来源

原始标题:STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。