全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

7月7日 00:00

启用来源

17

抓取状态

真实抓取

开源模型Hugging Face Blog

LeRobot v0.6.0 发布:想象、评估、改进

摘要

Hugging Face 发布了 LeRobot v0.6.0 版本,该版本专注于机器人学习,引入了“想象、评估、改进”的新功能,旨在提升机器人模型的性能和泛化能力。

背景解释

LeRobot 是 Hugging Face 推出的开源机器人学习框架,旨在降低机器人研究的门槛。v0.6.0 版本的新功能有助于开发者更高效地训练和优化机器人模型,推动机器人技术的普及。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文

返回文章列表

LeRobot v0.6.0:想象、评估、改进

发布时间:2026年7月7日

在 GitHub 上更新

点赞 \ \ 24

  • ![](https://huggingface.co/sayakpaul "sayakpaul")
  • ![](https://huggingface.co/pcuenq "pcuenq")
  • ![](https://huggingface.co/echarlaix "echarlaix")
  • ![](https://huggingface.co/lilkm "lilkm")
  • ![](https://huggingface.co/vissu27 "vissu27")
  • ![](https://huggingface.co/ArturD "ArturD")
  • +18

![Steven Palma 的头像](https://huggingface.co/imstevenpmwork)

Steven Palma\ imstevenpmwork\ \ 关注

![Pepijn Kooijmans 的头像](https://huggingface.co/pepijn223)

Pepijn Kooijmans\ pepijn223\ \ 关注

![Caroline Pascal 的头像](https://huggingface.co/CarolinePascal)

Caroline Pascal\ CarolinePascal\ \ 关注

![Khalil Meftah 的头像](https://huggingface.co/lilkm)

Khalil Meftah\ lilkm\ \ 关注

![Maxime Ellerbach 的头像](https://huggingface.co/maximellerbach)

Maxime Ellerbach\ maximellerbach\ \ 关注

![Martino Russi 的头像](https://huggingface.co/nepyope)

Martino Russi\ nepyope\ \ 关注

![Nikodem Bartnik 的头像](https://huggingface.co/nikodembartnik)

Nikodem Bartnik\ nikodembartnik\ \ 关注

![Nicolas Rabault 的头像](https://huggingface.co/Nico-robot)

Nicolas Rabault\ Nico-robot\ \ 关注

![Thomas Wolf 的头像](https://huggingface.co/thomwolf)

Thomas Wolf\ thomwolf\ \ 关注

这个新版本旨在闭环机器人学习:在行动前想象未来的策略、告诉你机器人何时成功的奖励模型、将失败转化为训练数据的部署 CLI,以及六个新的模拟基准来评估这一切。它还带来了深度感知、VLM 驱动的数据集标注、自定义视频编码、基于 HF Jobs 的云端训练,以及更精简的安装。

TL;DR

LeRobot v0.6.0 引入了学习想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),一批新的 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及新的奖励模型 API(Robometer、TOPReward)。它提供了六个新的模拟基准,统一在 lerobot-eval 下,lerobot-rollout CLI 支持 DAgger 风格的人机交互修正,FSDP 训练,以及基于 HF Jobs 的云端训练。数据集增加了深度支持、自动语言标注流程、自定义视频编码,以及高达 2 倍的数据加载速度提升,所有这些都基于更精简的安装。

LeRobot 0.6.0

目录

世界模型:会想象的策略

机器人领域正在提出一个大问题:世界模型真的有助于机器人策略吗?v0.6.0 为 LeRobot 带来了三种策略来帮助回答这个问题。每种策略都在训练过程中学习想象未来,并且各自采用不同的路径来保持这种想象的可负担性。

VLA-JEPA

VLA-JEPA 训练一个紧凑的 VLA(基于 Qwen3-VL-2B)在学习行动的同时在潜在空间中预测未来:在训练过程中,JEPA 世界模型必须根据模型自身的动作预测后续帧。关键在于,世界模型在推理时消失,因此你可以在零额外推理成本下获得世界模型的监督。Hub 上有三个即用型检查点,包括一个基于 DROID 预训练的基座,可用于微调:

lerobot-train \
  --policy.path=lerobot/VLA-JEPA-Pretrain \
  --dataset.repo_id=${HF_USER}/my_dataset \
  --policy.repo_id=${HF_USER}/my_finetuned_policy

查看VLA-JEPA 文档论文了解更多。

LingBot-VA

LingBot-VA 更进一步:一个自回归视频-动作模型,逐块联合预测未来视频和动作,并反馈真实观测以保持其想象力的 grounded。你甚至可以保存机器人想象的内容(--policy.save_predicted_video=true),并与实际发生的情况进行比较。推理在单张 24–32 GB GPU 上运行。查看文档论文了解技术细节。

LingBot-VA 想象 rollout 与真实 rollout 对比

FastWAM

FastWAM 在其论文标题中提出了一个问题:世界动作模型是否需要测试时的未来想象?它将一个约 5B 的视频生成专家与一个紧凑的动作专家配对在单个网络中,因此模型实际上学会了梦想自己的 rollout。在推理时,它完全跳过梦想过程,直接去噪动作块。从lerobot/fastwam_base微调,并在文档中了解更多。

VLA:模型动物园持续壮大

GR00T N1.7

我们将 NVIDIA GR00T 集成升级到 GR00T N1.7,这是 NVIDIA 跨具身基础模型的最新开放版本。N1.7 将之前的 VLM 替换为 Cosmos-Reason2-2B(基于 Qwen3-VL),并连接一个流匹配动作头,我们的集成已通过 NVIDIA 原始 Isaac-GR00T 实现的同等测试:相同的输入,相同的输出。Flash-attention 现在是可选的,因此 pip install 'lerobot[groot]' 即可正常工作,你可以直接加载NVIDIA 发布的检查点

GR00T N1.7 取代了 LeRobot 中的 N1.5。如果你需要 N1.5,请固定 lerobot==0.5.1。

MolmoAct2

MolmoAct2,艾伦人工智能研究所的视觉-语言-动作模型,现已移植到 LeRobot,涵盖完整生命周期:微调(全量或 LoRA)、评估和真实机器人部署。内置校准校正的现成检查点意味着你可以在 SO-100/101 上零样本运行:

lerobot-rollout \
  --policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \
  --task="pick up the red cube" --duration=30

推理在 bf16 下约需 12 GB,LoRA 微调可在单张 24 GB GPU 上运行。查看MolmoAct2 文档获取完整部署指南。

LeRobot 中的 MolmoAct2 零样本

EO-1

EO-1,一个在交错视觉-文本-动作数据上预训练的 VLA,加入了 LeRobot:一个 Qwen2.5-VL-3B 骨干网络,带有流匹配动作头,由论文作者之一贡献。使用标准 lerobot-train 工作流,--policy.type=eo1 进行训练。详情见文档论文

Multitask DiT

Multitask Diffusion Transformer 策略将 TRI Large Behavior Models 方案引入 LeRobot:一个约 450M 参数的扩散 transformer,以 CLIP 视觉和语言嵌入为条件,因此一个模型可以学习通过自然语言选择的多个任务。它支持扩散和流匹配目标,并且足够小,可以自行训练。查看文档

EVO1

VLA 不必庞大。EVO1 将其策略压缩到 0.77B 参数,一个 InternVL3-1B 骨干网络,带有流匹配动作头,足够小,可以在中等 GPU 上微调和实时运行。它附带两阶段微调和实时分块支持。查看EVO1 文档论文

奖励模型:了解机器人何时成功

成功检测和进度估计是机器人学习循环中缺失的部分,v0.6.0 为它们提供了归宿。LeRobot 现在有一个统一的奖励模型 API(lerobot.rewards),镜像策略 API,四个奖励模型共享一个接口——HIL-SERL 奖励分类器、SARM,以及两个新成员:

Robometer

Robometer 是一个预训练的通用奖励模型:将lerobot/Robometer-4B指向任何 LeRobot 数据集,它就能根据原始视频和语言指令评分任务进度和成功,无需特定任务训练。它基于 Qwen3-VL-4B,并通过超过一百万条机器人轨迹的数据集上的轨迹比较进行训练(RSS 2026 论文)。

LeRobot Robometer

TOPReward

TOPReward 完全零样本:完全没有奖励权重。它包装了一个现成的 VLM(Qwen3-VL),并读取给定轨迹视频和任务指令下 token "True" 的对数概率。任何有能力的 VLM 都变成了奖励函数。

两者都附带标注脚本,将逐帧进度曲线写入你的数据集,为奖励感知行为克隆(RA-BC)、数据集质量检查和进度叠加视频做好准备。查看RobometerTOPReward文档。

数据集:更快的加载,更丰富的数据

你的编解码器,你的规则

录制不再局限于一个硬编码的编解码器。新的 --dataset.rgb_encoder.* 选项暴露了完整的编码表面(编解码器、质量、像素格式、GOP、预设),vcodec=auto 会探测硬件编码器如 NVENC、VideoToolbox、VAAPI 和 QSV,然后回退到默认的软件 AV1 编码器。对于现有数据集,一条命令即可重新编码所有内容:

lerobot-edit-dataset \
    --repo_id ${HF_USER}/my_dataset \
    --operation.type reencode_videos \
    --operation.rgb_encoder.vcodec h264 \
    --operation.rgb_encoder.crf 23

完整细节见视频编码文档

深度支持,端到端

插入 Intel RealSense,设置 use_depth: true,LeRobot 端到端记录深度图:以毫米为单位捕获,压缩为紧凑的 12 位深度视频流,与 RGB 摄像头一起,并在训练时解码回物理单位。深度在录制期间和 lerobot-dataset-viz 中实时渲染,并适用于 SO-100/101、Koch、OpenArm、reBot、Unitree G1 等。

LeRobot 深度摄像头

大规模语言标注

你的数据集不再局限于每个 episode 一个任务字符串。LeRobot 数据集现在原生存储丰富的语言标注(带时间戳的子任务、计划、记忆、修正、语音和每摄像头 VQA 对),新的 lerobot-annotate CLI 使用 VLM 自动填充它们,该 VLM 观看你的 episodes:

lerobot-annotate \
    --repo_id=${HF_USER}/my_dataset \
    --new_repo_id=${HF_USER}/my_dataset_annotated \
    --vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \
    --push_to_hub=true

然后,一个 YAML 配方层在采样时将这些标注渲染为聊天风格的训练消息:正是未来长时域、会说话的机器人策略将训练的数据。使用 HF Jobs 扩展,并阅读标注流水线文档了解更多。

数据加载速度提升高达 2 倍

视频数据集训练现在开箱即用速度提升约 2 倍:多摄像头帧并行解码,数据加载器工作进程传输紧凑的 uint8 帧(进程间内存减少 4 倍),持久工作进程在 epoch 间保持解码器缓存。加载大数据集的子集(episodes=[...])从几分钟缩短到毫秒级(在我们的基准测试中从 275 秒降至 0.06 秒)。采样现在也是确定性和可恢复的,因此中断的训练可以精确恢复样本。

基准测试:一个 CLI 评估所有

v0.5.0 在 LeRobot 上树立了 VLA 评估中心的旗帜;v0.6.0 通过六个新的模拟基准测试使其名副其实,所有基准测试都可通过相同的 lerobot-eval CLI 运行,每个都有文档页面、Docker 镜像和经过 CI 冒烟测试的 SmolVLA 基线检查点:

  • LIBERO-plus使用约 10,000 个 LIBERO 的扰动变体,从光照、相机视角到重写指令等七个维度对 VLA 进行压力测试。它能告诉你策略何时失效。
  • RoboTwin 2.0在 SAPIEN 上涵盖 50 个双臂操作任务,具有强领域随机化,并在 Hub 上提供了超过 10 万条可训练轨迹
  • RoboCasa365在 2,500 个程序生成的厨房中,使用移动操作器完成 365 个厨房任务,是我们系列中任务覆盖面最广的。
  • RoboCerebra评估长时域行为,其情节在语言引导的中间指令下串联 3 到 6 个子目标,并附带 6,660 条情节的数据集。
  • RoboMME是一项记忆测试:你的策略能否计数重复、追踪隐藏物体并模仿演示流程?涵盖 4 个记忆套件的 16 个任务。
  • VLABench测试操作中的知识和推理能力,从物理问题到端到端冲泡咖啡等复合任务。
lerobot-eval \
  --policy.path=lerobot/smolvla_robotwin \
  --env.type=robotwin \
  --env.task=beat_block_hammer \
  --eval.n_episodes=100 --eval.batch_size=1

模拟器后端需要特定的系统依赖,并有各自的安装步骤;每个文档页面都提供了精确的配方,每个基准测试都附带了现成的 Docker 镜像,如果你想跳过设置步骤。

与 LIBERO、Meta-World 和 NVIDIA IsaacLab-Arena 一起,这构成了一个屋檐下的九个基准测试家族,新的添加新基准测试指南详细记录了如何接入你自己的基准测试。评估也更快了:并行评估现在默认使用异步向量化环境,基准测试速度提升高达 2 倍。

LeRobot benchmarks

训练与推理

lerobot-rollout:部署有了自己的 CLI

部署策略过去是在 lerobot-record 之上的 hack。新的 lerobot-rollout CLI 将部署变成了自己的工作流,具有可插拔策略和推理后端(包括用于慢速兼容 VLA 的实时分块)。base 策略仅运行策略。sentry 持续记录,循环保存情节并上传到 Hub。highlight 保持一个环形缓冲区,在你按下按键时保存最后 N 秒,因此不会错过有趣的时刻。episodic 镜像了经典的情节/重置记录工作流。而 dagger 将部署变成了数据收集。

使用 DAgger 策略,你观察策略运行,在出错时按下按键(或 USB 脚踏板),用主臂接管记录修正,然后交还控制权。在你接管之前,驱动式主臂会被驱动到从臂的姿态,因此切换过程无抖动。每个修正帧都标记有 intervention 标志,生成的数据集可直接用于下一次微调:

lerobot-rollout \
    --strategy.type=dagger \
    --policy.path=${HF_USER}/my_policy \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM0 \
    --teleop.type=so101_leader \
    --teleop.port=/dev/ttyACM1 \
    --dataset.repo_id=${HF_USER}/dagger_corrections \
    --dataset.single_task="Grasp the block"

部署、收集修正、微调、重复:机器人学习飞轮现在只是一个 CLI 标志。阅读部署文档

FSDP:训练比 GPU 更大的模型

机器人基础模型正在超越单 GPU。LeRobot 训练现在通过 Accelerate 支持 FSDP(全分片数据并行):参数、梯度和优化器状态在 GPU 间分片,检查点被合并回一个普通的单文件 model.safetensors,像加载任何其他策略一样。你甚至可以在不同数量的 GPU 上恢复 FSDP 运行。参见多 GPU 训练文档

使用 HF Jobs 进行云端训练

没有 GPU?没问题。完全相同的 lerobot-train 命令现在只需添加一个标志即可在云端运行:

lerobot-train \
  --dataset.repo_id=${HF_USER}/so101_test \
  --policy.type=act \
  --policy.repo_id=${HF_USER}/my_policy \
  --job.target=a10g-small

LeRobot 会在需要时将你的本地数据集推送到私有 Hub 仓库,提交作业,将日志流式传输到你的终端,并在最后将训练好的策略推送到 Hub。使用 --job.target 选择从 T4 到 8x H200 的任何配置(计算按使用量付费)。查看文档

代码库:更精简、更干净

  • pip install lerobot 现在真正轻量,基础依赖减少了约 40%。功能范围的 extras([training]、[core_scripts]、[evaluation] 等)覆盖其余部分,缺失依赖错误会明确告诉你需要添加哪个 extra。如果只使用 LeRobot 数据集,不再需要安装硬件相关依赖 ;)
  • 支持的 PyTorch 升级到 2.7–2.11,CUDA 12.8 wheels 为 Linux uv 安装预先固定。--policy.dtype=bfloat16 现在通过 Accelerate 驱动真正的混合精度训练。
  • 提交的 uv.lock 是 CI、Docker 和开发的权威依赖规范,文档中每一步都包含 uv 安装路径,甚至可以通过单个标志选择 CUDA wheel。
  • --display_mode=foxglove 将遥操作、记录和 rollout 流式传输到Foxglove,这是机器人领域广泛使用的可视化工具。它支持远程设置,并且 lerobot-dataset-viz 提供可拖动的数据集回放。
  • 可通过 pip 安装的 lerobot_env_* 包现在自动注册其环境。插件系统涵盖所有五种组件类型:机器人、相机、遥操作器、策略和环境。
  • 记录期间的键盘控制现在可在 Wayland、SSH、无头设备以及 macOS 上无需辅助功能权限即可工作。
查看发布说明获取完整列表和破坏性变更的迁移指南。
LeLab a graphical user interface for LeRobot

社区与生态系统

  • LeLab 将整个 LeRobot 工作流(标定、遥操作、记录、在本地或 HF Jobs 上训练、部署)置于浏览器 UI 中,无需 CLI。目前支持 SO-ARM101。试试看!
  • Isaac Teleop 允许你通过NVIDIA 的 Isaac Teleop 堆栈使用 VR 控制器通过 CloudXR/OpenXR 遥操作 SO-101,这是与 NVIDIA 团队合作的结果。参见文档
  • 新的计算硬件指南回答了每个新手都会问的两个问题:我需要什么 GPU,训练需要多长时间?它提供了每个策略家族的实测 VRAM 范围以及从 RTX 4090 到 4x H100 的参考训练时间。
  • 重写的添加策略指南展示了如何发布你自己的策略,可以在树内或作为无需 PR 的插件包。

最后感想

除了这些主要功能,v0.6.0 还包括数百个错误修复、文档改进和代码库的质量提升,从更智能的默认设置到更可靠的 CI。

我们想向社区中的每个人表示衷心的感谢。此版本包含了来自学术界、工业界和爱好者团队的工作,他们选择 LeRobot 作为其模型和基准测试的家园。每个 PR 和错误报告都推动了开源机器人技术的发展。

敬请期待更多内容 🤗 从这里开始! – LeRobot 团队 ❤️

本文提到的模型 3

本文提到的数据集 1

更多博客文章

![\ \ lerobotrobotics\ \ LeRobot v0.5.0:全方位扩展\ \

  • ![](https://cdn-avatars.huggingface.co/v1/production/uploads/67b124b081d4eae18b957606/QdQMOTzsHBkJIuXjk8O_h.png)\
  • ![](https://cdn-avatars.huggingface.co/v1/production/uploads/65f9d37113336392bad1e49c/B0Fxwconnu7lvtjBz4Ruq.jpeg)\
  • ![](https://cdn-avatars.huggingface.co/v1/production/uploads/65eab3c432efd8afebc5aee9/7kIg3Dpd2Sdwv-tgFOvtn.jpeg)\
  • ![](https://cdn-avatars.huggingface.co/v1/production/uploads/67d7dea1786ddcb3af5a44b3/gEgXTH4oO91GIzjHR-yrb.png)\
  • +6\

\ 45\ \ 2026年3月8日\ \ imstevenpmwork 等](https://huggingface.co/blog/lerobot-release-v050)

![\ \ lerobotrobotics\ \ 使用 NVIDIA Isaac 从仿真到部署构建医疗机器人\ \

  • ![](https://cdn-avatars.huggingface.co/v1/production/uploads/67b124b081d4eae18b957606/QdQMOTzsHBkJIuXjk8O_h.png)\
  • ![](https://cdn-avatars.huggingface.co/v1/production/uploads/653d557fb16f657d28cc3484/q7Mc6CgUMWjnE6iE20puv.jpeg)\

\ 32\ \ 2025年10月28日\ \ imstevenpmwork 等](https://huggingface.co/blog/lerobotxnvidia-healthcare)

社区

编辑预览

通过拖拽、粘贴或点击此处上传图片、音频和视频。

点击或粘贴此处上传图片

评论

·注册登录以发表评论

点赞 \ \ 24

  • ![](https://huggingface.co/sayakpaul "sayakpaul")
  • ![](https://huggingface.co/pcuenq "pcuenq")
  • ![](https://huggingface.co/echarlaix "echarlaix")
  • ![](https://huggingface.co/lilkm "lilkm")
  • ![](https://huggingface.co/vissu27 "vissu27")
  • ![](https://huggingface.co/ArturD "ArturD")
  • ![](https://huggingface.co/sehun "sehun")
  • ![](https://huggingface.co/midhun "midhun")
  • ![](https://huggingface.co/GaggiX "GaggiX")
  • ![](https://huggingface.co/burtenshaw "burtenshaw")
  • ![](https://huggingface.co/BasitMustafa "BasitMustafa")
  • ![](https://huggingface.co/tomaarsen "tomaarsen")
  • +12

本文提及的模型 3

本文提及的数据集 1

StripeM-Inner

来源地区

Global

热度分

68

分类

开源模型

语言

en