← VLA Atlas

LIBERO 仿真 · 单臂 · 终身学习

终身机器人学习知识迁移基准 · 130 任务四子集递进 · Panda 单臂

LIBERO(Liu et al. NeurIPS 2023 Track on Datasets and Benchmarks)由 UT Austin、卡内基梅隆、Google Research 等联合提出,全称 Lifelong Robot Learning Benchmark。它用 Franka Panda 单臂在 RoboSuite / MuJoCo 仿真里跑 130 个操纵任务,四个子集 Spatial / Object / Goal / Long 各自考察一种知识迁移能力 —— 空间推理、物体操纵、目标条件、长程复合,让研究者能隔离研究不同类型的终身学习。

它是当下 VLA 论文最常见的操纵基线之一:π₀ / OpenVLA / Octo / X-VLA / RDT / GR00T N1 等模型都例行公事要跑这张表。对 LIBERO 打不高的模型,很难说服人相信它在真机上会好。

Qwen-VLA 分数

97.9%
Avg Success Rate · 四子集平均 · arXiv 2605.30280
对比参考:OpenVLA (7B, LoRA) 76.5% · Octo 75.1% · Diffusion Policy from scratch 72.4%

发展史 · 为什么会有 LIBERO

LIBERO 之前,机器人操纵仿真基准的主流是 Meta-World (2019) 和 RLBench (2020) —— 前者聚焦 meta-RL,后者聚焦多任务模仿,都不是为「终身学习」设计的。终身学习最要命的是灾难性遗忘知识迁移:学了新任务旧任务能否记得住?旧知识能否让新任务学得快?

Liu 团队观察到,如果基准的任务之间同时改变了很多变量(物体、场景、目标全变),研究者根本没法判断到底是哪个变量导致的迁移失败。LIBERO 的核心贡献就是把变量拆开:四个子集之间只在一个维度上变化,研究者能像做消融那样精确定位问题。

这一点让 LIBERO 成为 VLA 时代的默认表 —— 一次跑完就能报告「我这个模型在 空间推理/物体识别/目标切换/长程规划 四种能力上分别表现如何」。

规模

指标
任务总数130(4 子集)
Episode 数(LeRobot 转换版)1,693
帧数(LeRobot 转换版)273,465
控制频率10 Hz
图像分辨率256 × 256 RGB
动作维度7(6 关节 + 夹爪)
平均 Episode 长度约 162 帧 / 16 秒
物理引擎MuJoCo(via RoboSuite)
许可证MIT

Hugging Face LeRobot 版把 130 任务聚合成 40 组以适配统一格式;原始论文 130 tasks。当你在训练里看到"40 tasks"字样,通常是指 LeRobot 版本。

机器人本体 · Franka Panda 单臂

数据采集流程

LIBERO 的数据不是遥操作也不是纯 RL,而是专家规划 + 脚本演示

  1. 对每个任务,人工编写 procedural demonstration script(用 waypoint 序列 + 抓取时机脚本)
  2. 在 RoboSuite / MuJoCo 里跑脚本,每个任务采集约 50 条 successful trajectories
  3. 轨迹经 IK 转成关节位置控制信号,记录 obs / action / reward / done

这种方式的优势是 demonstrations 高质量(100% 成功且轨迹平滑),劣势是缺少人类演示的自然噪声 —— 学到的策略在真机上可能对小扰动不鲁棒。这也是为什么 π₀ 类模型会额外做真机 fine-tune。

四子集含义

LIBERO-Spatial 10 任务
同一场景 / 同一物体 · 换目标位置:碗放盘子左 / 右 / 前 / 后。考察语言里的空间关系是否被正确理解。
LIBERO-Object 10 任务
同一场景 · 换目标物体:抓 alphabet soup / cream cheese / tomato sauce ... 考察语言里的物体名词能否精确 grounding。
LIBERO-Goal 10 任务
同一场景 / 同一物体 · 换目标动作/目的:把书打开 / 合上 / 立起来。考察对动词语义的辨析。
LIBERO-10 (Long) 10 长任务
10 个多步骤复合场景,每个需要 3-5 个子技能拼合。评测终身学习在真实场景中的长程规划能力。

Spatial/Object/Goal 三档每档 10 任务,共 30 任务;LIBERO-10 加 10 任务。合起来基础版只有 40 任务。剩下的 90 任务是LIBERO-90(分布式多任务预训练用),不参与主评测。

典型任务示例

官方样例图

LIBERO 四子集示意
官方 Figure 1 · 四子集任务样例概览 · GitHub raw

评测指标详解

Success Rate (SR):一条 rollout 是否达成任务目标状态。目标状态由每个任务的 termination_conditions 定义,例如「碗的 z 坐标在盘子 z 坐标之上且 xy 距离 < 阈值」。

官方评测协议:每个任务跑 50 rollouts × 3 seeds,报告平均 SR ± std。总共 40 tasks × 150 rollouts = 6000 rollouts

子集平均口径:Qwen-VLA 报告的 97.9% 是四子集分别算平均后再算大平均,即 (Spatial + Object + Goal + LIBERO-10) / 4,而不是把 6000 rollouts 拍平算。这两种口径分数会不同。

主流模型分数对照

模型SpatialObjectGoalLongAvg
Diffusion Policy (scratch)78.392.568.350.572.4
Octo (fine-tuned)78.985.784.651.175.1
OpenVLA-7B (LoRA)84.788.479.253.776.5
Qwen-VLA-Instruct-97.9

来源:OpenVLA / Octo 论文里的官方 LIBERO 表。Qwen-VLA 论文摘要只报了 Avg 97.9%,未公开分子项分数。

常见误区 / 数据集局限

相关基准 · 拓展阅读

RLBench
CoppeliaSim · 100 任务 · 多任务模仿 · 2020
Meta-World
MuJoCo · 50 任务 · meta-RL 起家 · 2019
RoboTwin
SAPIEN · 双臂 50 任务 · 强域随机化
DROID
真机 · 76K 轨迹 · Franka Panda · 2024

参考链接

项目官网
libero-project.github.io
arXiv 2306.03310
Liu et al. NeurIPS 2023 D&B
GitHub
Lifelong-Robot-Learning/LIBERO
HuggingFace
physical-intelligence/libero · LeRobot 版