产业 / 媒体
脑电波能成为机器人AI训练的下一个突破口吗
在加利福尼亚州圣利安德罗的一座仓库里,数据工具公司Encord正在尝试一种前所未有的机器人训练数据采集方式:让操作员佩戴能够读取脑电波的头戴设备,在执行积木拆解等任务时同步记录大脑活动。这套设备由德国神经科学初创公司Zander Labs研发,旨在捕捉操作者在任务中的意图、错误感知和惊讶反应等心理状态,从而为机器人模型提供更丰富的训练信号。Encord的机器人学习负责人Vineeth Velmurugan曾任职于OpenAI机器人实验室,他指出物理AI面临的核心困境在于:训练数据根本不存在。他估计,要实现突破,所需数据集的规模将是YouTube视频库的五倍。为此,Encord不仅采集工厂工人的第一视角视频,还在探索肌肉电信号传感器等新型数据模态,并为每段视频配以密集的文字标注,以提升模型对物理操作的理解能力。
物理AI的前沿阵地,是加州圣利安德罗一座仓库里摇摇欲坠的积木塔。数据工具公司Encord的操作员Andrew Ceja头戴一顶特殊头盔,一边小心翼翼地抽取木块,一边让头盔上的传感器实时记录他的脑电波。这套设备由德国神经科学初创公司Zander Labs研发,能够推断操作者在任务执行过程中的意图、错误感知和惊讶程度,为机器人模型提供超越普通视频的心理状态维度数据。Encord目前将此视为试验性项目,计划先构建初步的脑电波标注数据集,再评估其对客户机器人模型性能的实际提升效果。
Encord最初是一家帮助企业标注机器视觉数据的工具公司,但随着客户开始将端到端学习应用于机器人操作任务,公司管理层意识到仅仅管理数据已经不够,必须亲自生产数据。机器人学习负责人Velmurugan一针见血地指出:所需的训练数据根本不存在。生成式AI让聊天机器人突飞猛进,但同样的逻辑在物理世界遭遇了根本性障碍——大语言模型依赖整个互联网的文本语料,而教会神经网络理解物理操作所需的等量原始素材,目前几乎无处可寻。
为了填补这一空白,机器人公司正转向两类主要数据来源:工人佩戴摄像头采集的第一视角视频,以及通过远程操控机器人收集的操作数据。Encord在全球多个工厂采集第一视角数据,同时在圣利安德罗设施中使用主从机械臂装置,让人类操作员控制一只机械臂,另一只同步模仿其动作,由此生成倒咖啡、叠扑克筹码等日常任务的训练数据。Velmurugan表示,几乎每家人形机器人公司都向他们索取过这类数据集。
除脑电波外,Encord还在开发另一种新型数据模态:将传感器绑在操作员前臂,通过检测肌肉电信号来推断手部的三维空间位置。由于拍摄人手操作物体的视频往往无法完整捕捉手部形态,这套基于肌电信号的方案有望为模型构建更完整的手部运动理解。与此同时,Encord还为每段视频配以密集的文字标注,例如标注右手拧紧螺栓等动作描述,以帮助基于大语言模型的系统理解视频内容。Velmurugan估计,这种密集标注的价值是低质量第一视角数据的100倍,而成本仅高出约20倍。
然而,物理训练数据的经济逻辑与互联网文本截然不同。大语言模型的训练语料几乎是免费从网络抓取的,而物理训练数据必须被制造出来,而非简单采集,这从根本上改变了构建此类模型的成本结构。Velmurugan估计,突破物理AI的数据瓶颈所需的数据集规模,将是YouTube全部视频库的五倍,这一数字足以解释为何数据生产本身已经成为一门独立的生意,而不仅仅是研究课题。
Encord同时服务于多家机器人公司的独特位置,也赋予了它一种行业级视野:它能在任何单一客户察觉之前,率先发现哪些数据技术正在获得行业认可。仓库里的十余名操作员,包括曾在Scale等AI数据标注公司工作过的Ceja和Sofia Infante,正在成为一支新兴劳动力队伍,为神经网络的物理智能打下基础。当积木塔轰然倒塌,Ceja说他享受为机器人解决训练任务的挑战——这或许正是物理AI时代最真实的人机协作图景。
要点
- 物理AI面临的核心瓶颈不是模型架构,而是真实世界物理操作训练数据的极度匮乏,所需数据规模估计是YouTube视频库的五倍。
- Encord正在探索脑电波和肌肉电信号等新型数据模态,试图为机器人模型提供超越普通视频的操作者意图与心理状态信息。
- 密集文字标注的训练数据价值是低质量第一视角数据的100倍,但成本仅高出约20倍,这一比例在经济上具有可行性。
- 物理训练数据必须被主动制造而非简单采集,其成本结构与依赖免费互联网文本的大语言模型训练存在根本差异。
- 同时服务多家机器人公司的数据平台,能够比任何单一客户更早发现行业级数据技术趋势,这本身构成一种竞争优势。
原始标题:Are brain waves the next unlock for physical AI?
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。