AI资讯 / 研究

研究 / 官方

面向多视图注意力的投影射线位置编码

Apple Machine Learning

苹果机器学习研究院联合卡内基梅隆大学的研究人员提出了 RayRoPE,一种专为多视图 Transformer 设计的位置编码机制,相关论文已被 ECCV 2026 收录。多视图 Transformer 需要同时处理来自多张已知位姿图像的图块令牌,理想的位置编码应满足三个条件:对图块的唯一编码、支持 SE(3) 不变的多频率注意力相似度计算,以及对场景几何的自适应能力。研究团队发现,现有的绝对或相对位置编码方案均无法同时满足上述要求。RayRoPE 以图块对应的射线为基础,通过预测射线上的三维点而非仅使用射线方向来实现几何感知编码,并引入查询帧投影坐标计算多频率相似度以达成 SE(3) 不变性。针对预测三维点存在不确定性的问题,该方法还提供了一种解析计算期望位置编码的机制。实验表明,RayRoPE 在 CO3D 数据集的 LPIPS 指标上相对提升约 15%,并可无缝融合 RGB-D 输入以获得更大增益。

多视图三维理解是计算机视觉的核心任务之一,Transformer 架构因其强大的全局建模能力而被广泛应用于该领域。然而,如何为来自不同视角、不同位姿图像的图块令牌设计合适的位置编码,始终是一个未被充分解决的问题。现有方案要么依赖绝对坐标,要么采用相对编码,均难以同时满足唯一性、SE(3) 不变性与几何自适应性三项核心需求。

RayRoPE 的核心思路是将图块位置与其对应的三维射线关联起来。与仅使用射线方向的传统做法不同,RayRoPE 沿射线预测一个三维点,以此作为位置编码的几何锚点。这一设计使编码能够感知场景的实际深度分布,而不仅仅依赖相机的投影方向,从而在不同视角之间建立更具判别力的位置表示。

为实现 SE(3) 不变性,RayRoPE 在查询帧的投影坐标系下计算多频率相似度。这意味着无论场景或相机的绝对姿态如何变化,注意力计算的结果仅取决于视图之间的相对几何关系,有效避免了绝对坐标编码在不同场景间泛化能力不足的问题。多频率设计则进一步丰富了模型捕捉不同尺度几何结构的能力。

预测射线上的三维点不可避免地引入不确定性,尤其在遮挡或纹理缺失区域。为此,RayRoPE 提出了一种解析方法,在给定点位置的概率分布下直接计算期望位置编码,而无需依赖蒙特卡洛采样等近似手段。这一机制使模型在深度预测不准确时仍能保持稳定的位置表示,增强了方法的鲁棒性。

研究团队在新视图合成与立体深度估计两项任务上对 RayRoPE 进行了系统评估。在 CO3D 数据集上,RayRoPE 相较于其他位置编码方案在 LPIPS 指标上实现了约 15% 的相对提升。此外,RayRoPE 能够无缝接入 RGB-D 输入,将深度信息直接编码进位置表示,而现有替代方案无法利用这一额外信息,因此 RayRoPE 在 RGB-D 场景下的优势更为显著。

RayRoPE 的提出为多视图 Transformer 的位置编码设计提供了新的思路,将几何先验与不确定性建模融入编码机制本身,而非依赖额外的后处理模块。该工作由苹果机器学习研究院与卡内基梅隆大学合作完成,已被计算机视觉顶级会议 ECCV 2026 收录,有望推动三维重建、自动驾驶感知及增强现实等应用场景的进一步发展。

要点

  • RayRoPE 通过预测射线上的三维点而非仅用射线方向来构建位置编码,实现了对场景几何的自适应感知。
  • 查询帧投影坐标系下的多频率相似度计算赋予 RayRoPE SE(3) 不变性,使其在不同场景和相机姿态下均能稳定工作。
  • 针对深度预测的不确定性,RayRoPE 提供解析期望编码机制,无需近似采样即可保持位置表示的鲁棒性。
  • 在 CO3D 数据集上,RayRoPE 的 LPIPS 指标相对现有方案提升约 15%,并可无缝融合 RGB-D 输入获得更大增益。
查看原始来源

原始标题:RayRoPE: Projective Ray Positional Encoding for Multi-View Attention

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。