AI资讯 / 研究

研究 / 官方

让视频推理模型在训练中内化视觉思维

Apple Machine Learning

苹果机器学习研究团队发布论文,提出「内化视觉思维」(Internalized Visual Thinking,IVT)框架,旨在解决多模态大语言模型在主动视频推理中面临的效率瓶颈。现有的视觉思维链(Visual CoT)方法通过在推理阶段生成中间图像来辅助模型进行视觉预判,虽然直观有效,但带来了显著的推理开销。IVT采用后训练范式,在训练阶段同时优化文本预测与下一帧嵌入预测,使模型在面对部分观测视频时能够在潜在空间中预测未来帧的表示,从而捕捉运动、物体变化、交互关系与隐含意图。推理阶段无需合成或重新编码未来帧,可直接输出答案。实验表明,IVT在六项评估设置中均优于纯文本后训练基线,与Visual CoT相比性能相当甚至更优,同时端到端延迟降低超过5倍。

多模态大语言模型在处理空间、时序与具身环境推理任务时,越来越依赖视觉思维链(Visual CoT)技术。该方法通过在推理过程中生成中间推理图像,为模型提供一种直观的视觉预判机制。然而,这种像素级的显式生成在主动视频推理场景下会带来大量额外计算开销,严重制约了实际部署效率。

苹果研究团队提出的IVT框架从根本上重新思考了这一问题:模型是否可以在训练阶段学会「视觉思考」,而在推理阶段直接给出答案?IVT是一种后训练框架,核心思路是联合优化文本预测目标与下一帧嵌入预测目标,训练数据为无标注视频。给定部分观测的视频片段,模型需同时预测未来帧的潜在表示与目标文本答案,从而将视觉预测能力内化到模型参数中。

在技术细节上,研究团队对目标表示形式、解码器设计、预测时间跨度、数据混合策略、训练课程安排以及预测目标函数等多个维度进行了系统性的对照实验。这些受控研究帮助团队厘清了各因素对模型性能的影响,并最终确定了IVT的最优配置。实验覆盖六项评估设置,IVT在所有设置中均超越了仅使用文本后训练的基线方法。

与Visual CoT相比,IVT在性能上达到相当甚至更优的水平,同时将端到端推理延迟降低超过5倍。这一效率提升源于IVT在推理阶段无需生成或重新编码任何图像帧,模型直接从内化的视觉表示中输出答案,保留了与纯文本模型相同的高效推理路径。

该研究的核心发现对多模态推理领域具有重要启示:在推理时进行显式像素空间生成,并非主动视频推理的必要条件。预测性世界建模能力可以在训练阶段被内化到模型中,从而产生既更准确又更高效的多模态推理器。这一结论挑战了当前Visual CoT方法的主流范式,为未来视频理解模型的设计提供了新的方向。

要点

  • IVT通过在训练阶段联合优化文本预测与未来帧嵌入预测,将视觉预判能力内化到模型参数,推理时无需生成中间图像
  • 与Visual CoT相比,IVT在六项评估设置中性能相当或更优,端到端推理延迟降低超过5倍
  • 研究表明,推理阶段的显式像素级图像生成并非视频推理任务的必要条件,预测性世界建模可在训练中完成内化
  • IVT采用无标注视频进行后训练,具备较强的数据可扩展性,降低了对标注资源的依赖
查看原始来源

原始标题:Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。