模型 / 官方
无需专用记忆模块,让机器人读懂时序视频历史
OpenBMB 团队推出 SimpleMemVLA,一种面向视觉-语言-动作模型的原生视频记忆方案。与依赖检索库、学习压缩器或循环状态的传统记忆机制不同,SimpleMemVLA 不设置专用记忆模块,而是将带时间戳的历史帧直接以视频格式输入 Qwen3.5-4B 骨干网络,由自注意力机制在决策时自主筛选关键证据。60 秒历史仅占用约 5600 个 token,远低于 262k 的上下文窗口上限。该方法在 RMBench、RoboMME、MIKASA-Robo、RoboMemArena 四项记忆基准上均取得当前最优,同时在通用控制基准 LIBERO 上保持 97.5 的高分。真实双臂机器人部署实验中,Cover Blocks 任务成功率达 58.3%,Put Back Block 任务达 70.0%,验证了方案的实用性。
长时域机器人操作面临部分可观测性难题:执行当前动作所需的关键信息,可能只出现在数分钟前的观测帧中。现有记忆机制——无论是检索库、学习压缩器还是循环状态——都需要在写入时就决定保留哪些历史信息,而此时尚不知道未来决策究竟需要什么。这种「写入时承诺」的设计缺陷,导致关键帧可能被检索跳过、视觉细节在压缩中丢失、早期证据被循环更新覆盖。
SimpleMemVLA 的核心思路是彻底放弃专用记忆模块。它将历史帧以带时间戳的视频格式完整保留,直接送入骨干网络的视频通道,由原生自注意力机制在决策时完成证据筛选。处理器为每两帧时序补丁自动添加明文时间戳,与视频预训练格式完全一致。腕部相机仅贡献当前帧,通过图像通道输入,输入格式本身即区分了历史与当前。60 秒历史仅消耗约 5600 个 token,262k 的上下文窗口理论上可容纳约 45 分钟的操作历史。
在记忆接口之外,SimpleMemVLA 还设计了一条从历史到动作的窄文本通道。骨干网络通过 token 级交叉熵监督,以普通助手回答的形式输出当前子任务描述,最多 64 个 token,不使用思维链。该文本跨度的隐藏状态与 token 嵌入,加上一个归一化的本体感知 token,共同作为约 9 亿参数的 DiT 流匹配动作头的唯一条件输入。这一设计将历史信息的传递路径压缩至最窄,同时保留了足够的语义表达能力。
为降低决策延迟,SimpleMemVLA 引入精确流式推理机制。共享历史前缀在机器人执行当前动作块期间提前完成预填充,决策延迟从 1.02 秒降至 0.68 秒,且输出结果与非流式版本逐字节一致。训练数据集与每个推理策略使用完全相同的历史帧裁剪与填充规则,确保训练与部署的一致性。这一设计使 SimpleMemVLA 在保持高精度的同时,具备了实时控制的可行性。
基准测试结果显示,SimpleMemVLA 在四项记忆基准上全面领先:RMBench 达 94.0(超越逐任务专家模型 11.0 分),RoboMME 达 88.3(超越使用真实感知信息的 oracle 基线 43.7 分),MIKASA-Robo 达 74.0(超越最优先前 VLA 29.6 分),RoboMemArena 任务成功率达 63.6(超越基准自带参考线 17.4 分)。消融实验表明,增益来自记忆接口本身而非骨干网络:在相同骨干、数据和训练器上重建检索、token 压缩和循环状态,RoboMME 得分仅为 31.5、22.6 和 20.6,远低于原生上下文的 88.3。
在真实机器人部署方面,SimpleMemVLA 基于 180 条和 308 条真实机器人演示数据分别微调后,部署于真实双臂机器人。Cover Blocks 任务要求按红-绿-蓝顺序取下外观完全相同的三个盖子,10 次自主试验中成功 35 次(58.3%);Put Back Block 任务要求在按下按钮后将方块放回初始垫子,4 个初始位置共 40 次试验中成功 28 次(70.0%)。两项任务均需依赖历史记忆才能完成,验证了原生视频记忆方案在真实场景中的有效性。
要点
- SimpleMemVLA 以带时间戳的原生视频上下文替代专用记忆模块,由自注意力在决策时完成历史证据筛选,从根本上规避了写入时承诺的设计缺陷
- 60 秒历史仅占用约 5600 个 token,262k 上下文窗口可容纳约 45 分钟操作历史,记忆容量大幅提升且无需额外压缩
- 精确流式推理通过共享前缀预填充将决策延迟从 1.02 秒降至 0.68 秒,输出逐字节一致,满足实时控制需求
- 在 RMBench、RoboMME、MIKASA-Robo、RoboMemArena 四项记忆基准上均刷新最优,同时在通用控制基准 LIBERO 上保持 97.5 高分,无性能损失
- 消融实验证明增益来自记忆接口设计而非骨干网络,相同骨干下传统记忆机制得分仅为原生上下文的三分之一左右
原始标题:OpenBMB/SimpleMemVLA — Native-video memory for vision-language-action models, using timestamped visual history and exact streaming inference for long-horizon robot manipulation.
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。