研究 / 官方
通过校准稀疏注意力加速文本到视频生成
苹果机器学习研究团队在ECCV 2026上发表论文,提出CalibAtt方法,用于加速文本到视频生成。该方法基于一个关键发现:在扩散模型的时空注意力计算中,大量token之间的连接分数始终可忽略,且模式重复。CalibAtt通过离线校准识别这些稀疏模式,并在推理时跳过冗余计算。实验表明,在Wan 2.1 14B、Mochi 1等模型上,CalibAtt实现了最高1.58倍加速,且不牺牲视频质量和文本对齐效果。
苹果机器学习研究团队近日在ECCV 2026上发表了一项新研究,旨在解决文本到视频生成模型运行速度慢的问题。当前基于扩散模型的视频生成技术虽然能产出高质量视频,但其庞大的Transformer骨干网络在时空注意力计算上存在严重瓶颈,导致推理时间过长。
研究团队发现,在注意力计算中,大量token之间的连接分数始终非常低,且这些低分连接的模式在不同输入和查询之间高度重复。这一现象同样适用于局部token块之间的连接。基于此,团队提出了一种名为CalibAtt的训练无关加速方法。
CalibAtt通过一个离线校准过程,识别出各层、各注意力头以及各扩散时间步中稳定的块级稀疏性和重复模式,并将其编译为优化的注意力操作。在推理时,模型仅密集计算被选中的输入相关连接,而跳过未选中的部分,且这种跳过在硬件上高效实现。
研究团队在Wan 2.1 14B、Mochi 1以及多步蒸馏模型上进行了广泛实验,覆盖不同分辨率。结果显示,CalibAtt实现了最高1.58倍的端到端加速,超越了现有的训练无关加速方法,同时保持了视频生成质量和文本-视频对齐效果。
该方法的优势在于无需额外训练,可直接应用于现有模型,降低了部署成本。研究团队来自苹果和特拉维夫大学,相关工作已在GitHub上公开。
要点
- CalibAtt是一种训练无关的加速方法,通过离线校准识别注意力中的稀疏模式。
- 该方法在Wan 2.1 14B等模型上实现最高1.58倍端到端加速。
- 加速过程不牺牲视频生成质量和文本-视频对齐效果。
- CalibAtt可应用于不同分辨率和多步蒸馏模型。
原始标题:Accelerating Text-to-Video Generation with Calibrated Sparse Attention
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。