LeRobot v0.6.0 发布:想象、评估、改进
摘要
Hugging Face 发布了 LeRobot v0.6.0 版本,该版本专注于机器人学习,引入了“想象、评估、改进”的新功能,旨在提升机器人模型的性能和泛化能力。
背景解释
LeRobot 是 Hugging Face 推出的开源机器人学习框架,旨在降低机器人研究的门槛。v0.6.0 版本的新功能有助于开发者更高效地训练和优化机器人模型,推动机器人技术的普及。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
LeRobot v0.6.0:想象、评估、改进
发布时间:2026年7月7日
- 
- 
- 
- 
- 
- 
- +18

Steven Palma\ imstevenpmwork\ \ 关注

Pepijn Kooijmans\ pepijn223\ \ 关注

Caroline Pascal\ CarolinePascal\ \ 关注


Maxime Ellerbach\ maximellerbach\ \ 关注


Nikodem Bartnik\ nikodembartnik\ \ 关注

Nicolas Rabault\ Nico-robot\ \ 关注

这个新版本旨在闭环机器人学习:在行动前想象未来的策略、告诉你机器人何时成功的奖励模型、将失败转化为训练数据的部署 CLI,以及六个新的模拟基准来评估这一切。它还带来了深度感知、VLM 驱动的数据集标注、自定义视频编码、基于 HF Jobs 的云端训练,以及更精简的安装。
TL;DR
LeRobot v0.6.0 引入了学习想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),一批新的 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及新的奖励模型 API(Robometer、TOPReward)。它提供了六个新的模拟基准,统一在 lerobot-eval 下,lerobot-rollout CLI 支持 DAgger 风格的人机交互修正,FSDP 训练,以及基于 HF Jobs 的云端训练。数据集增加了深度支持、自动语言标注流程、自定义视频编码,以及高达 2 倍的数据加载速度提升,所有这些都基于更精简的安装。

目录
- LeRobot v0.6.0:想象、评估、改进
- TL;DR
- 目录
- 世界模型:会想象的策略
- VLA-JEPA
- LingBot-VA
- FastWAM
- VLA:不断壮大的模型动物园
- GR00T N1.7
- MolmoAct2
- EO-1
- Multitask DiT
- EVO1
- 奖励模型:知道机器人何时成功
- Robometer
- TOPReward
- 数据集:更快加载,更丰富数据
- 你的编解码器,你的规则
- 深度支持,端到端
- 大规模语言标注
- 高达 2 倍的数据加载速度
- 基准测试:一个 CLI 评估所有
- 训练与推理
- lerobot-rollout:部署有了自己的 CLI
- FSDP:训练比 GPU 更大的模型
- 基于 HF Jobs 的云端训练
- 代码库:更精简、更干净
- 社区与生态系统
- 最后思考
世界模型:会想象的策略
机器人领域正在提出一个大问题:世界模型真的有助于机器人策略吗?v0.6.0 为 LeRobot 带来了三种策略来帮助回答这个问题。每种策略都在训练过程中学习想象未来,并且各自采用不同的路径来保持这种想象的可负担性。
VLA-JEPA
VLA-JEPA 训练一个紧凑的 VLA(基于 Qwen3-VL-2B)在学习行动的同时在潜在空间中预测未来:在训练过程中,JEPA 世界模型必须根据模型自身的动作预测后续帧。关键在于,世界模型在推理时消失,因此你可以在零额外推理成本下获得世界模型的监督。Hub 上有三个即用型检查点,包括一个基于 DROID 预训练的基座,可用于微调:
lerobot-train \
--policy.path=lerobot/VLA-JEPA-Pretrain \
--dataset.repo_id=${HF_USER}/my_dataset \
--policy.repo_id=${HF_USER}/my_finetuned_policy查看VLA-JEPA 文档和论文了解更多。
LingBot-VA
LingBot-VA 更进一步:一个自回归视频-动作模型,逐块联合预测未来视频和动作,并反馈真实观测以保持其想象力的 grounded。你甚至可以保存机器人想象的内容(--policy.save_predicted_video=true),并与实际发生的情况进行比较。推理在单张 24–32 GB GPU 上运行。查看文档和论文了解技术细节。

FastWAM
FastWAM 在其论文标题中提出了一个问题:世界动作模型是否需要测试时的未来想象?它将一个约 5B 的视频生成专家与一个紧凑的动作专家配对在单个网络中,因此模型实际上学会了梦想自己的 rollout。在推理时,它完全跳过梦想过程,直接去噪动作块。从lerobot/fastwam_base微调,并在文档中了解更多。
VLA:模型动物园持续壮大
GR00T N1.7
我们将 NVIDIA GR00T 集成升级到 GR00T N1.7,这是 NVIDIA 跨具身基础模型的最新开放版本。N1.7 将之前的 VLM 替换为 Cosmos-Reason2-2B(基于 Qwen3-VL),并连接一个流匹配动作头,我们的集成已通过 NVIDIA 原始 Isaac-GR00T 实现的同等测试:相同的输入,相同的输出。Flash-attention 现在是可选的,因此 pip install 'lerobot[groot]' 即可正常工作,你可以直接加载NVIDIA 发布的检查点。
GR00T N1.7 取代了 LeRobot 中的 N1.5。如果你需要 N1.5,请固定 lerobot==0.5.1。
MolmoAct2
MolmoAct2,艾伦人工智能研究所的视觉-语言-动作模型,现已移植到 LeRobot,涵盖完整生命周期:微调(全量或 LoRA)、评估和真实机器人部署。内置校准校正的现成检查点意味着你可以在 SO-100/101 上零样本运行:
lerobot-rollout \
--policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \
--task="pick up the red cube" --duration=30推理在 bf16 下约需 12 GB,LoRA 微调可在单张 24 GB GPU 上运行。查看MolmoAct2 文档获取完整部署指南。

EO-1
EO-1,一个在交错视觉-文本-动作数据上预训练的 VLA,加入了 LeRobot:一个 Qwen2.5-VL-3B 骨干网络,带有流匹配动作头,由论文作者之一贡献。使用标准 lerobot-train 工作流,--policy.type=eo1 进行训练。详情见文档和论文。
Multitask DiT
Multitask Diffusion Transformer 策略将 TRI Large Behavior Models 方案引入 LeRobot:一个约 450M 参数的扩散 transformer,以 CLIP 视觉和语言嵌入为条件,因此一个模型可以学习通过自然语言选择的多个任务。它支持扩散和流匹配目标,并且足够小,可以自行训练。查看文档。
EVO1
VLA 不必庞大。EVO1 将其策略压缩到 0.77B 参数,一个 InternVL3-1B 骨干网络,带有流匹配动作头,足够小,可以在中等 GPU 上微调和实时运行。它附带两阶段微调和实时分块支持。查看EVO1 文档和论文。
奖励模型:了解机器人何时成功
成功检测和进度估计是机器人学习循环中缺失的部分,v0.6.0 为它们提供了归宿。LeRobot 现在有一个统一的奖励模型 API(lerobot.rewards),镜像策略 API,四个奖励模型共享一个接口——HIL-SERL 奖励分类器、SARM,以及两个新成员:
Robometer
Robometer 是一个预训练的通用奖励模型:将lerobot/Robometer-4B指向任何 LeRobot 数据集,它就能根据原始视频和语言指令评分任务进度和成功,无需特定任务训练。它基于 Qwen3-VL-4B,并通过超过一百万条机器人轨迹的数据集上的轨迹比较进行训练(RSS 2026 论文)。

TOPReward
TOPReward 完全零样本:完全没有奖励权重。它包装了一个现成的 VLM(Qwen3-VL),并读取给定轨迹视频和任务指令下 token "True" 的对数概率。任何有能力的 VLM 都变成了奖励函数。
两者都附带标注脚本,将逐帧进度曲线写入你的数据集,为奖励感知行为克隆(RA-BC)、数据集质量检查和进度叠加视频做好准备。查看Robometer和TOPReward文档。
数据集:更快的加载,更丰富的数据
你的编解码器,你的规则
录制不再局限于一个硬编码的编解码器。新的 --dataset.rgb_encoder.* 选项暴露了完整的编码表面(编解码器、质量、像素格式、GOP、预设),vcodec=auto 会探测硬件编码器如 NVENC、VideoToolbox、VAAPI 和 QSV,然后回退到默认的软件 AV1 编码器。对于现有数据集,一条命令即可重新编码所有内容:
lerobot-edit-dataset \
--repo_id ${HF_USER}/my_dataset \
--operation.type reencode_videos \
--operation.rgb_encoder.vcodec h264 \
--operation.rgb_encoder.crf 23完整细节见视频编码文档。
深度支持,端到端
插入 Intel RealSense,设置 use_depth: true,LeRobot 端到端记录深度图:以毫米为单位捕获,压缩为紧凑的 12 位深度视频流,与 RGB 摄像头一起,并在训练时解码回物理单位。深度在录制期间和 lerobot-dataset-viz 中实时渲染,并适用于 SO-100/101、Koch、OpenArm、reBot、Unitree G1 等。

大规模语言标注
你的数据集不再局限于每个 episode 一个任务字符串。LeRobot 数据集现在原生存储丰富的语言标注(带时间戳的子任务、计划、记忆、修正、语音和每摄像头 VQA 对),新的 lerobot-annotate CLI 使用 VLM 自动填充它们,该 VLM 观看你的 episodes:
lerobot-annotate \
--repo_id=${HF_USER}/my_dataset \
--new_repo_id=${HF_USER}/my_dataset_annotated \
--vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \
--push_to_hub=true然后,一个 YAML 配方层在采样时将这些标注渲染为聊天风格的训练消息:正是未来长时域、会说话的机器人策略将训练的数据。使用 HF Jobs 扩展,并阅读标注流水线文档了解更多。
数据加载速度提升高达 2 倍
视频数据集训练现在开箱即用速度提升约 2 倍:多摄像头帧并行解码,数据加载器工作进程传输紧凑的 uint8 帧(进程间内存减少 4 倍),持久工作进程在 epoch 间保持解码器缓存。加载大数据集的子集(episodes=[...])从几分钟缩短到毫秒级(在我们的基准测试中从 275 秒降至 0.06 秒)。采样现在也是确定性和可恢复的,因此中断的训练可以精确恢复样本。
基准测试:一个 CLI 评估所有
v0.5.0 在 LeRobot 上树立了 VLA 评估中心的旗帜;v0.6.0 通过六个新的模拟基准测试使其名副其实,所有基准测试都可通过相同的 lerobot-eval CLI 运行,每个都有文档页面、Docker 镜像和经过 CI 冒烟测试的 SmolVLA 基线检查点:
- LIBERO-plus使用约 10,000 个 LIBERO 的扰动变体,从光照、相机视角到重写指令等七个维度对 VLA 进行压力测试。它能告诉你策略何时失效。
- RoboTwin 2.0在 SAPIEN 上涵盖 50 个双臂操作任务,具有强领域随机化,并在 Hub 上提供了超过 10 万条可训练轨迹。
- RoboCasa365在 2,500 个程序生成的厨房中,使用移动操作器完成 365 个厨房任务,是我们系列中任务覆盖面最广的。
- RoboCerebra评估长时域行为,其情节在语言引导的中间指令下串联 3 到 6 个子目标,并附带 6,660 条情节的数据集。
- RoboMME是一项记忆测试:你的策略能否计数重复、追踪隐藏物体并模仿演示流程?涵盖 4 个记忆套件的 16 个任务。
- VLABench测试操作中的知识和推理能力,从物理问题到端到端冲泡咖啡等复合任务。
lerobot-eval \
--policy.path=lerobot/smolvla_robotwin \
--env.type=robotwin \
--env.task=beat_block_hammer \
--eval.n_episodes=100 --eval.batch_size=1模拟器后端需要特定的系统依赖,并有各自的安装步骤;每个文档页面都提供了精确的配方,每个基准测试都附带了现成的 Docker 镜像,如果你想跳过设置步骤。
与 LIBERO、Meta-World 和 NVIDIA IsaacLab-Arena 一起,这构成了一个屋檐下的九个基准测试家族,新的添加新基准测试指南详细记录了如何接入你自己的基准测试。评估也更快了:并行评估现在默认使用异步向量化环境,基准测试速度提升高达 2 倍。

训练与推理
lerobot-rollout:部署有了自己的 CLI
部署策略过去是在 lerobot-record 之上的 hack。新的 lerobot-rollout CLI 将部署变成了自己的工作流,具有可插拔策略和推理后端(包括用于慢速兼容 VLA 的实时分块)。base 策略仅运行策略。sentry 持续记录,循环保存情节并上传到 Hub。highlight 保持一个环形缓冲区,在你按下按键时保存最后 N 秒,因此不会错过有趣的时刻。episodic 镜像了经典的情节/重置记录工作流。而 dagger 将部署变成了数据收集。
使用 DAgger 策略,你观察策略运行,在出错时按下按键(或 USB 脚踏板),用主臂接管记录修正,然后交还控制权。在你接管之前,驱动式主臂会被驱动到从臂的姿态,因此切换过程无抖动。每个修正帧都标记有 intervention 标志,生成的数据集可直接用于下一次微调:
lerobot-rollout \
--strategy.type=dagger \
--policy.path=${HF_USER}/my_policy \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--teleop.type=so101_leader \
--teleop.port=/dev/ttyACM1 \
--dataset.repo_id=${HF_USER}/dagger_corrections \
--dataset.single_task="Grasp the block"部署、收集修正、微调、重复:机器人学习飞轮现在只是一个 CLI 标志。阅读部署文档。
FSDP:训练比 GPU 更大的模型
机器人基础模型正在超越单 GPU。LeRobot 训练现在通过 Accelerate 支持 FSDP(全分片数据并行):参数、梯度和优化器状态在 GPU 间分片,检查点被合并回一个普通的单文件 model.safetensors,像加载任何其他策略一样。你甚至可以在不同数量的 GPU 上恢复 FSDP 运行。参见多 GPU 训练文档。
使用 HF Jobs 进行云端训练
没有 GPU?没问题。完全相同的 lerobot-train 命令现在只需添加一个标志即可在云端运行:
lerobot-train \
--dataset.repo_id=${HF_USER}/so101_test \
--policy.type=act \
--policy.repo_id=${HF_USER}/my_policy \
--job.target=a10g-smallLeRobot 会在需要时将你的本地数据集推送到私有 Hub 仓库,提交作业,将日志流式传输到你的终端,并在最后将训练好的策略推送到 Hub。使用 --job.target 选择从 T4 到 8x H200 的任何配置(计算按使用量付费)。查看文档
代码库:更精简、更干净
- pip install lerobot 现在真正轻量,基础依赖减少了约 40%。功能范围的 extras([training]、[core_scripts]、[evaluation] 等)覆盖其余部分,缺失依赖错误会明确告诉你需要添加哪个 extra。如果只使用 LeRobot 数据集,不再需要安装硬件相关依赖 ;)
- 支持的 PyTorch 升级到 2.7–2.11,CUDA 12.8 wheels 为 Linux uv 安装预先固定。--policy.dtype=bfloat16 现在通过 Accelerate 驱动真正的混合精度训练。
- 提交的 uv.lock 是 CI、Docker 和开发的权威依赖规范,文档中每一步都包含 uv 安装路径,甚至可以通过单个标志选择 CUDA wheel。
- --display_mode=foxglove 将遥操作、记录和 rollout 流式传输到Foxglove,这是机器人领域广泛使用的可视化工具。它支持远程设置,并且 lerobot-dataset-viz 提供可拖动的数据集回放。
- 可通过 pip 安装的 lerobot_env_* 包现在自动注册其环境。插件系统涵盖所有五种组件类型:机器人、相机、遥操作器、策略和环境。
- 记录期间的键盘控制现在可在 Wayland、SSH、无头设备以及 macOS 上无需辅助功能权限即可工作。
查看发布说明获取完整列表和破坏性变更的迁移指南。

社区与生态系统
- LeLab 将整个 LeRobot 工作流(标定、遥操作、记录、在本地或 HF Jobs 上训练、部署)置于浏览器 UI 中,无需 CLI。目前支持 SO-ARM101。试试看!
- Isaac Teleop 允许你通过NVIDIA 的 Isaac Teleop 堆栈使用 VR 控制器通过 CloudXR/OpenXR 遥操作 SO-101,这是与 NVIDIA 团队合作的结果。参见文档。
- 新的计算硬件指南回答了每个新手都会问的两个问题:我需要什么 GPU,训练需要多长时间?它提供了每个策略家族的实测 VRAM 范围以及从 RTX 4090 到 4x H100 的参考训练时间。
- 重写的添加策略指南展示了如何发布你自己的策略,可以在树内或作为无需 PR 的插件包。
最后感想
除了这些主要功能,v0.6.0 还包括数百个错误修复、文档改进和代码库的质量提升,从更智能的默认设置到更可靠的 CI。
我们想向社区中的每个人表示衷心的感谢。此版本包含了来自学术界、工业界和爱好者团队的工作,他们选择 LeRobot 作为其模型和基准测试的家园。每个 PR 和错误报告都推动了开源机器人技术的发展。
敬请期待更多内容 🤗 从这里开始! – LeRobot 团队 ❤️
本文提到的模型 3
本文提到的数据集 1
更多博客文章
\
- \
- \
- \
- +6\
\ 45\ \ 2026年3月8日\ \ imstevenpmwork 等](https://huggingface.co/blog/lerobot-release-v050)
\
- \
\ 32\ \ 2025年10月28日\ \ imstevenpmwork 等](https://huggingface.co/blog/lerobotxnvidia-healthcare)
社区
编辑预览
通过拖拽、粘贴或点击此处上传图片、音频和视频。
点击或粘贴此处上传图片
评论
- 
- 
- 
- 
- 
- 
- 
- 
- 
- 
- 
- 
- +12
本文提及的模型 3
本文提及的数据集 1
StripeM-Inner
来源地区
Global
热度分
68
分类
开源模型
语言
en
