研究 / 官方
苹果研究院提出T2SV框架,让AI同步生成视频与音频
苹果机器学习研究院联合中国人民大学团队在ECCV 2026发表论文,聚焦文本到有声视频(T2SV)生成任务——即从一段文字同时生成画面与同步音频,且两种模态均与文本描述高度对齐。研究指出,当前联合音视频训练面临两大核心瓶颈:其一,共享字幕会导致视频与音频模态之间产生相互干扰,且训练时使用的密集描述与用户推理时输入的简短提示之间存在明显落差;其二,跨模态特征融合的最优机制尚不明确。为此,团队提出跨参照重写器(CRR)字幕框架,通过语义检查器提取语义锚点,再由跨模态重写器生成解耦的视频字幕与音频字幕,从根本上消除模态干扰并弥合训练与推理之间的分布差距,为T2SV生成提供了系统性解决方案。
文本到有声视频生成(T2SV)是多模态生成领域的前沿方向,目标是让模型仅凭一段文字描述,便能同时输出内容连贯的视频画面与时间对齐的音频轨道。这一任务的难度远超单独的文本生成视频或文本生成音频,因为模型需要在视觉与听觉两个维度上同时满足文本语义的约束,稍有偏差便会导致画面与声音脱节,严重影响用户体验。
研究团队识别出制约T2SV发展的两个关键问题。第一个问题在于文本条件的设计:现有方法通常让视频与音频共享同一套字幕描述,但视觉内容与听觉内容对语言的侧重点截然不同,强行共享会造成模态间的语义干扰。与此同时,训练阶段使用的字幕往往细节丰富、结构复杂,而用户在实际推理时输入的提示则简短随意,两者之间的分布差距导致模型泛化能力受限。
针对上述问题,论文核心贡献是提出跨参照重写器(Cross-Referential Rewriter,CRR)字幕框架。该框架采用双智能体流水线设计:首先由语义检查器(Semantic Checker)从原始描述中提取具有跨模态共识的语义锚点,确保视频与音频在核心语义上保持一致;随后由跨模态重写器(Cross-Modal Rewriter)基于这些锚点分别生成专属于视频模态和音频模态的独立字幕对,实现模态解耦。
CRR框架的设计逻辑在于,视频字幕应着重描述场景构图、动作轨迹与视觉细节,而音频字幕则需聚焦于声音类型、音调变化与环境音效。通过将两者显式分离,模型在训练时不再需要从同一段文字中同时学习两种截然不同的生成目标,从而有效降低了模态间的梯度冲突,提升了各自模态的生成质量。
在训练与推理的分布对齐方面,CRR框架通过语义锚点机制将简短的用户提示扩展为结构化的模态专属描述,使模型在推理阶段也能接收到与训练分布相近的输入格式。这一设计无需用户提供专业的长篇描述,即可获得高质量的有声视频输出,显著降低了T2SV技术的使用门槛,具有较强的实用价值。
该研究由中国人民大学与苹果公司联合完成,将在ECCV 2026正式发表。T2SV技术的成熟有望在影视内容创作、游戏场景生成、虚拟现实体验及无障碍媒体制作等领域带来广泛应用。随着多模态生成模型持续演进,如何精细化控制各模态的条件输入,将成为提升生成质量的关键研究方向。
要点
- T2SV任务要求模型从文本同时生成视频与同步音频,视觉与听觉双重对齐是核心难点
- 共享字幕导致视频与音频模态相互干扰,训练与推理的描述分布差距进一步削弱模型泛化能力
- CRR框架通过语义锚点提取与跨模态重写,生成解耦的视频字幕与音频字幕,从根本上解决模态干扰问题
- 语义锚点机制同时弥合了训练密集描述与用户简短提示之间的分布落差,提升推理阶段的实用性
- 该成果将在ECCV 2026发表,为影视创作、游戏生成等多媒体应用场景提供技术支撑
原始标题:Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。