工程 / 官方
让机器人学会想象、评估与自我改进
LeRobot v0.6.0 围绕“闭环机器人学习”全面升级:策略层新增 VLA-JEPA、LingBot-VA、FastWAM 三种世界模型,让机器人在潜空间或视频中预测未来动作;模型库纳入 GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1 等视觉-语言-动作模型,参数规模覆盖 0.77B 到 5B。框架首次提供统一的奖励模型 API lerobot.rewards,收录 Robometer、TOPReward、HIL-SERL、SARM 四种成功度与进度评估方式;并通过 lerobot-eval 把六项仿真基准整合到同一命令行工具中。部署侧推出 lerobot-rollout CLI,支持 DAgger 式人在回路纠错,FSDP 训练与 Hugging Face Jobs 云端训练同步上线。数据侧补齐深度通道与视频语言自动标注,加载速度最高提升 2 倍,安装体积也明显减小。
在策略层,LeRobot v0.6.0 把“世界模型是否能帮助机器人决策”变成了可落地的实验。VLA-JEPA 基于 Qwen3-VL-2B,让策略在训练时由 JEPA 世界模型预测未来帧,推理时则丢弃世界模型,从而以零额外开销换取想象式监督;LingBot-VA 进一步以自回归方式同步预测未来视频与动作片段,推理可在单卡 24–32GB GPU 上完成;FastWAM 把约 5B 参数的视频生成专家与紧凑动作专家合一,推理时跳过“做梦”直接去噪动作块。
视觉-语言-动作模型库继续扩容。GR00T N1.7 用 Cosmos-Reason2-2B 取代旧版 VLM,并接入流匹配动作头,与 NVIDIA 官方实现保持输入输出一致;MolmoAct2 由 Allen Institute for AI 推出,覆盖微调、评估到真机部署全流程,预置校准使其在 SO-100/101 上可零样本运行;EO-1 由论文作者亲自贡献,基于 Qwen2.5-VL-3B;Multitask DiT 把 TRI 大行为模型配方迁移进来,一个约 4.5 亿参数的扩散 Transformer 可通过自然语言切换多任务;EVO1 仅 0.77B 参数,主打在中等显卡上实时微调与推理。
奖励模型首次拥有统一入口 lerobot.rewards,接口风格与策略层保持一致。Robometer 是一个预训练通用奖励模型,接收视频与语言指令后即可给出任务进度与成功度分数;TOPReward 提供互补的成功检测能力,配合既有的 HIL-SERL 分类器与 SARM,覆盖成功判定与进度估计两类核心需求,为后续强化学习与偏好微调提供了直接可用的奖励信号。
评估与部署被统一到命令行工具 lerobot-eval 与 lerobot-rollout 中:六项新增仿真基准在同一个 CLI 下完成比较,rollout 工具支持 DAgger 风格的“人在回路纠错”,把每一次部署失败即时转化为训练样本。训练层面同步引入 FSDP,可训练超过单卡显存的模型,并支持 Hugging Face Jobs 云端训练,把本地 GPU 与云端算力放进同一条工作流。
数据集与工程基础也得到加强。新版本支持深度通道端到端贯通,并加入基于 VLM 的自动语言标注流水线,可自定义视频编码格式,数据加载速度最高提升 2 倍;安装包进一步瘦身,依赖更少、环境更干净,整体朝着“即装即用”的方向演进。
要点
- LeRobot v0.6.0 引入世界模型策略 VLA-JEPA、LingBot-VA、FastWAM,分别在潜空间、视频与动作专家三种路径上实现“想象未来”。
- 视觉-语言-动作模型库新增 GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1,参数规模覆盖 0.77B 到 5B,并补齐微调、评估、真机部署全流程。
- 全新 lerobot.rewards API 统一封装 Robometer、TOPReward、HIL-SERL、SARM 四种奖励模型,让成功判定与进度估计首次拥有标准接口。
- lerobot-eval 把六项仿真基准纳入同一 CLI,lerobot-rollout 支持 DAgger 式人在回路纠错,使部署失败即时回灌为训练数据。
- FSDP 与 Hugging Face Jobs 云端训练同步上线;数据集新增深度通道、VLM 自动语言标注与自定义视频编码,加载速度最高提升 2 倍。
原始标题:LeRobot v0.6.0: Imagine, Evaluate, Improve
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。