产业 / 媒体
更多数据胜过更大模型
小米推出Xiaomi-Robotics-1机器人AI模型,采用超过10万小时的手持夹爪运动数据进行训练,这些数据由人类使用配备摄像头的便携式夹爪在厨房、办公室、商店等1700多种环境中采集。研究表明,增加训练数据量对性能的提升远大于扩大模型规模,且性能尚未达到平台期。在标准机器人AI基准测试中,该模型取得了最佳成绩,在陌生环境中的成功率从约25%提升至75%。模型能适应新任务,仅需不到10小时的训练数据即可达到75%的平均成功率,远超竞争对手。
小米发布了名为Xiaomi-Robotics-1的机器人AI模型,该模型遵循与大型语言模型相似的扩展规律,即性能随训练数据增加而提升。为构建数据集,小米主要未使用实体机器人,而是采用便携式手持夹爪,配备摄像头,由人类直接操作。这种方法在厨房、办公室、商店、工厂车间和户外空间等1700多种环境中记录了超过10万小时的运动数据,解决了机器人AI领域数据稀缺的问题。
数据标注是另一大挑战,小米使用另一个AI模型为每个运动片段生成文本描述,仅用约两周时间完成了整个数据集的标注。随后,小米将训练迁移至实体机器人,包括轮式模型和双臂系统,并考虑了手持夹爪与机器人臂之间的差异。后训练阶段结合了真实公寓记录、开源机器人数据集和标注的UMI数据。
测试结果显示,增加训练数据量比扩大模型规模带来更大的性能提升。在陌生环境中,随着训练数据增加,模型成功率从约25%升至75%,且尚未达到平台期。这一发现与早期视觉数据研究结果一致,表明在机器人AI中,数据收集的规模和多样性是关键。在标准基准测试中,Xiaomi-Robotics-1取得了最佳成绩,例如机器人能在无人协助下完成打包行李箱等复杂任务。
模型在适应新任务方面表现出色,在包装手机、装载衣物、喂纸和装箱等四项任务中,仅需不到10小时的训练数据即可达到75%的平均成功率,远超Physical Intelligence的40%。在RoboCasa365排行榜上,Xiaomi-Robotics-1领先幅度显著,尤其在未见过的复合任务上表现突出。
机器人数据仍是研究重点,不同团队采取不同方案。小米的手持夹爪旨在解决遥操作数据昂贵且场景有限的问题。Nvidia等机构通过AI编码代理自主训练机器人,而BAAI的Orca模型则从无标签视频中学习。小米的发现——更多数据比更多计算更重要——使数据标注问题更加关键。小米计划在GitHub和Hugging Face上发布模型和代码。
要点
- Xiaomi-Robotics-1使用超过10万小时的手持夹爪运动数据训练,证明数据量比模型规模更关键。
- 模型在陌生环境中的成功率从25%提升至75%,且性能尚未达到平台期。
- 仅需不到10小时的新任务训练数据,模型即可达到75%的平均成功率。
- 小米通过AI模型自动标注数据,大幅降低人工成本。
- 模型在标准基准测试中领先,但绝对成功率仍较低。
原始标题:Xiaomi-Robotics-1 shows that more data beats bigger models when training robots to move
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。