研究 / 官方
苹果研究团队提出TGPO算法,让多模态大模型真正理解视频时序
多模态大语言模型(MLLM)在视觉理解任务上表现亮眼,但在需要判断事件先后顺序的第一人称视角视频场景中,往往暴露出明显的时序感知缺陷。根本原因在于现有训练目标未能显式奖励时序推理,模型倾向于依赖单帧空间特征走捷径。苹果机器学习研究团队联合弗吉尼亚理工、哈佛、伊利诺伊大学香槟分校及加州大学戴维斯分校的研究人员,提出了「时序全局策略优化」算法TGPO。该算法基于可验证奖励的强化学习框架,通过对比模型在正序帧与随机打乱帧上的输出,生成经过全局归一化的校准奖励信号,明确引导模型形成时序连贯的推理路径。在五个第一人称视角视频基准测试上的实验表明,TGPO在时序定位与因果连贯性方面均优于此前基于强化学习的视频推理方法,为构建时序鲁棒的多模态大模型提供了简洁且可扩展的路径。
多模态大语言模型近年来在图文理解、视觉问答等任务上取得了显著进展,但视频理解仍是一块难啃的硬骨头。尤其是第一人称视角(egocentric)视频——由可穿戴摄像头拍摄、记录佩戴者日常行为的连续画面——对模型的时序推理能力提出了更高要求。理解「先拿起杯子,再倒水,最后喝下」这样的因果链条,远比识别单张图片中的物体复杂得多。
现有MLLM的时序感知缺陷,很大程度上源于训练机制的设计缺陷。主流训练目标并不区分模型是真正理解了事件顺序,还是仅凭单帧的空间线索猜对了答案。这种「空间捷径」行为让模型在静态场景下表现良好,却在需要跨帧推理的动态视频任务中频频失手。研究团队将这一问题定性为训练信号的缺失,而非模型架构本身的局限。
为此,研究团队提出了TGPO(Temporal Global Policy Optimization)算法。其核心思路是:将同一段视频的正序帧与随机打乱帧分别输入模型,对比两种条件下的输出差异,并以此为基础构建奖励信号。若模型在正序帧上的回答明显优于乱序帧,说明它确实捕捉到了时序信息,应获得更高奖励;反之则受到抑制。这一对比机制使奖励信号能够直接反映时序推理质量,而非仅仅衡量答案的表面正确性。
在算法实现层面,TGPO与GRPO和GSPO两种主流强化学习框架兼容,并支持冷启动训练,无需预先收集大量人工标注的时序推理数据。全局归一化处理则确保了奖励信号在不同视频片段和任务难度之间的可比性,避免模型因奖励尺度不一致而产生训练不稳定的问题。研究人员表示,这一设计使TGPO具备良好的可扩展性,适用于不同规模的模型和数据集。
实验在EgoSchema、Ego4D-NLQ等五个主流第一人称视角视频基准上展开,涵盖时序定位、动作识别、因果推理等多类任务。结果显示,集成TGPO的模型在所有基准上均优于此前基于强化学习的视频推理方法,时序定位准确率和因果连贯性得分均有显著提升。消融实验进一步证实,对比奖励机制和全局归一化是性能提升的关键因素,缺少任一组件均会导致效果下降。
这项研究的意义不仅在于提升了第一人称视角视频理解的性能指标,更在于它为多模态大模型的时序推理能力提供了一种通用的强化学习解决思路。随着AR眼镜、运动相机等可穿戴设备的普及,第一人称视角视频数据将呈爆发式增长,具备真正时序感知能力的AI模型在辅助生活记录、技能学习、医疗监护等场景中将发挥重要作用。TGPO的提出,为这一方向的后续研究奠定了方法论基础。
要点
- TGPO通过对比正序帧与乱序帧的模型输出来构建奖励信号,显式激励多模态大模型形成时序连贯的推理路径,从根本上抑制空间捷径行为。
- 该算法与GRPO、GSPO兼容并支持冷启动训练,无需大量人工标注的时序数据,具备较强的实用性和可扩展性。
- 在五个第一人称视角视频基准测试上,TGPO全面超越此前基于强化学习的视频推理方法,在时序定位和因果连贯性两个维度均有显著提升。
- 研究揭示了现有MLLM时序感知缺陷的根本原因在于训练目标设计,而非模型架构,为后续改进指明了方向。
- 随着可穿戴设备普及带动第一人称视角视频数据增长,具备时序推理能力的AI模型在辅助生活、医疗监护等场景中具有广泛应用前景。
原始标题:Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。