产业 / 媒体
数据、世界模型与动作模型的一体化路径
大语言模型为AI提供了一套可复制的成功路径:在海量数据上预训练大模型,通用能力随之涌现。但机器人领域至今没有等价的范式——感知、规划与控制模块长期割裂,难以跨任务、跨机型迁移。中国具身AI公司X Square Robot正押注于一套开源集成技术栈,将机器人学习数据、用于预测物理世界变化的世界模型,以及融合感知、规划、推理与决策的动作模型整合为一体。该公司认为,数据质量而非模型规模才是通用机器人的真正瓶颈,并通过物理回放验证数据有效性,将有效率提升至约85%。其世界模型WALL-WM以语义事件而非固定时间窗口为建模单元,动作模型Wall-OSS-0.5则要求预训练后无需微调即可在真实机器人上运行。目前公司估值已超200亿元人民币,相关代码正陆续开源,等待更广泛的社区验证。
机器人领域长期面临一个核心困境:感知、规划与控制模块各自为政,组合在一起却难以产生可跨任务、跨机型迁移的智能。X Square Robot认为,解决这一问题的关键在于构建一套集成技术栈,涵盖机器人学习所需的数据层、预测物理世界变化的世界模型层,以及生成可执行行为的动作模型层。该公司将这一架构命名为World Unified Model,旨在将视觉、语言、动作与物理预测统一在同一训练框架下,并选择以开源方式推进。
在数据层面,X Square Robot认为制约通用机器人的核心瓶颈不是模型参数量,而是交互数据的成本与质量。为此,公司开发了QUANXTA Zero Series数据采集系统,让人类佩戴双夹爪装置进行操作示范,而非远程操控机器人。最关键的创新在于质量控制环节:系统会将采集到的轨迹样本在真实机器人上物理回放,只有实际完成任务的轨迹才被计为有效数据。这使得数据有效率成为可测量的指标,而非假设前提。公司报告称,该流程的数据有效率约为85%,且采集成本约为全机器人数据集的二十分之一。
世界模型WALL-WM的设计出发点是避免丢弃大型视频模型已有的视觉先验知识。与主流动作模型以固定时长的动作块为单位不同,WALL-WM以语义事件为建模单元——即抓取、放置、接触等具有完整语义的行为片段,这些片段可以用语言描述、在视频中观察、并作为运动指令执行。模型同时支持两种运行模式:事件模式以可变长度片段运行,适合长时域推理;固定长度模式则输出稳定的实时控制信号,与现有控制系统兼容。这一设计使WALL-WM介于纯视频世界模型与传统动作块模型之间。
动作层的核心模型Wall-OSS-0.5设定了一个严格的自我要求:预训练完成后,模型应在无需任何任务特定微调的情况下即可在真实机器人上运行。这一标准背后的逻辑是,若模型只有经过大量微调才能发挥作用,则真正的智能仍存在于下游监督信号中,而非基础模型本身。该模型同时训练离散动作令牌、语言接地与连续动作生成三个目标,并保持梯度在全网络中流通。配套的X-Tokenizer将动作令牌化重新定义为语义接口学习,使顶层编码代表动作意图,底层编码携带精细细节,从而实现跨机型复用而无需重新调优。
X Square Robot目前估值已超200亿元人民币(约合29亿美元),反映出投资者对数据基础设施、基础模型与可扩展训练系统作为具身AI长期差异化竞争力的信心。公司指出,家庭场景对机器人的要求不是更高的单次成功率,而是鲁棒的失败恢复能力——机器人需要知道何时不确定、何时寻求帮助,以及如何在出错后将环境恢复到安全状态。随着世界模型代码陆续开源,当前主要来自公司自有基准测试的实验结果,将接受更广泛社区在更多机器人、任务与场景下的独立验证。
要点
- X Square Robot将具身AI技术栈分为数据、世界模型、动作模型三层,并以开源方式推进,核心主张是数据质量而非模型规模才是通用机器人的真正瓶颈。
- 其数据采集系统通过物理回放验证轨迹有效性,有效率约85%,采集成本约为全机器人数据集的二十分之一,但目前最强结果仍来自公司自有机器人与流水线。
- 世界模型WALL-WM以语义事件而非固定时间窗口为建模单元,同时支持长时域推理的事件模式与适合实时控制的固定长度模式。
- 动作模型Wall-OSS-0.5要求预训练后无需微调即可在真实机器人上运行,配套的X-Tokenizer将动作令牌化设计为语义接口,支持跨机型复用。
- 公司估值已超200亿元人民币,世界模型代码正陆续开源,独立社区验证将是检验其技术主张能否跨机型、跨任务泛化的关键下一步。
原始标题:Building a Foundation Stack for General-Purpose Robots
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。