产业 / 媒体
未见过动作标签,机器人操控依然对齐专项系统
北京智源人工智能研究院发布世界基础模型Orca。它不再预测下一个token、下一帧画面或下一个动作,而是在抽象表征中预测世界的下一状态。模型以Qwen3.5为冻结主干,配合可替换的小型输出头,将内部状态转化为文本、图像与机器人动作三类输出。训练采用“无意识学习”与“有意识学习”两种路径,使用12.5万小时视频、1.6亿条事件描述与1150万问答对,其中仅十分之一进入当前版本。Orca-4B在四项视频理解基准的平均成绩达到51.8%,超过多个参数量更大的世界模型;在自建图像预测基准PRICE-V0.1上达到59.8%,超越FLUX系列与OmniGen2;在五项双臂人形机器人操控任务中,其表现与专项系统π0.5持平,即便预训练阶段从未接触动作标签。
Orca的核心思路是把世界状态作为统一的预测目标。研究团队认为,智能不应被定义为针对语言、视频或机器人等单一任务的预测模型,而应是模型对世界变化规律的通用理解,并以此支撑多种下游任务。在这一框架下,Orca先从图像与语言信号中建立对世界的内部表征,再通过可插拔的小型模块将这种表征映射为不同形式的输出。
['模型采用两种相互补充的学习方式。一种被称为无意识学习,模型仅依赖无字幕的原始视频,在抽象空间中预测下一帧画面,由此捕捉运动模式、遮挡关系与场景演化的统计规律。另一种被称为有意识学习,将视频切分为片段并配上状态变化的文字描述,让模型学会特定动作如何引发特定变化,同时辅以视频问答任务以保持自然语言交互能力。', '在架构上,Orca以预训练的语言-图像模型Qwen3.5为冻结主干,针对不同输出分别接入小型模块:文本沿用Qwen3.5原有的语言头;图像通过在Stable Diffusion 3.5上游训练的轻量适配器接入;机器人动作则由从零训练的Action Expert模块负责。这种冻结核心加可换输出头的设计,意在证明一个高质量的世界内部状态可以同时支持差异极大的任务。', '训练数据规模可观,共计12.5万小时视频、1.6亿条事件描述以及1150万条视频问答对。其中视频来自四种视角,涵盖第一人称日常交互、第三方物体操作、机器人无动作标签录制以及自然场景;当前公开的版本只使用了十分之一的数据。训练在H100集群上借助自研FlagScale库运行,每GPU每秒可处理2.91个样本,速度约为常用机器人代码库StarVLA的4.4倍。', 'Orca共训练了两个版本,参数量分别为0.8B与4B,二者均呈现稳定的扩展规律。在文本相关基准的综合平均成绩上,Orca-4B取得51.8%,超过Qwen3.5-4B、Gemma 4-4B、DeepSeek-VL2-3B等基线,平均表现也优于参数量更大的世界模型Emu3与Emu3.5。自建图像预测基准PRICE-V0.1更贴近机器人与第一人称场景,Orca-4B取得59.8%,领先FLUX.2 small、FLUX.1-context与OmniGen2等专用图像生成模型。']
最引人关注的结果出现在机器人操控领域。在五项使用双臂轮式人形机器人完成的任务中,包括整理书架、叠放碗具、舀取白糖等,Orca的表现与专门基于机器人数据训练的π0.5基本持平。预训练阶段Orca从未见过图像与运动之间的对应关系,后续仅用每个任务200条真实演示数据微调控制模块。V-JEPA 2.1与Qwen3.5在搭配相同控制模块时则明显落后。同时,Orca在抓取失败后能够重新尝试并继续完成任务,而π0.5往往陷入重复失败。作者认为,这一思路有望缓解机器人领域长期存在的有标签动作数据匮乏问题。
仍待解决的问题包括:模型目前只从图像与文本中学习,缺乏声音、力觉与触觉;视觉预测受限于预训练图像编码器的空间,未能从零学习独立的世界表征;0.8B与4B两个版本规模仍偏小,尚未达到真正的世界级体量,团队未来或将继续扩展参数量与数据量。
要点
- 北京智源发布世界模型Orca,预测目标抽象化为世界状态而非token、像素或动作,路径与主流大模型明显不同。
- 模型以Qwen3.5为冻结主干,搭配可替换的小型输出头,将同一内部状态转换为文本、图像与机器人动作,验证了通用世界表征的可行性。
- 12.5万小时视频、1.6亿条事件描述与1150万问答对共同支撑训练,当前版本仅使用十分之一数据,扩展潜力可观。
- Orca-4B在视频理解、图像预测与机器人操控多任务上均优于多个参数量更大的世界模型与专用图像生成器。
- 在五项双臂机器人任务中,Orca在不依赖预训练阶段动作标签的情况下追平π0.5,为缓解机器人标签数据短缺提供了新思路。
原始标题:China's Orca world model matches specialized robotics systems without ever seeing a single action label
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。