Simpler-WidowX 仿真代理真机 · 单臂
让仿真评测与真机成绩相关系数 > 0.9 · 基于 Bridge V2 场景 · WidowX 250
SimplerEnv(Li et al. RSS 2024)由斯坦福 & UC San Diego 联合发起。核心洞察是:机器人策略在仿真里的分数不可信,不是因为物理模拟不准,而是因为像素分布对不齐。SimplerEnv 用两个技术把仿真-真机拉齐:
- 视觉配准(Visual Matching):用真机拍的背景 RGB 叠加仿真的前景物体 + 机械臂 · 让仿真图像的 low-level 视觉特征分布接近真机
- 环境变异聚合(Variant Aggregation):系统性地改变光照、纹理、干扰物、桌面颜色,多个 variant 结果平均
WidowX 侧是 SimplerEnv 三个 embodiment(Google Robot / WidowX / Franka)之一,源自 UC Berkeley 的 Bridge V2 真机数据集。核心价值:VLA 不用租真机也能拿到有意义的评测分。
Qwen-VLA 分数
对比参考:Octo-small 仿真
29.5% / 真机 25.6% · Octo-base 16.0/20.8%
发展史 · 仿真评测为什么曾经不可信
在 SimplerEnv 之前,机器人策略评测有一个尴尬的裂缝:
- 真机评测:一次
25×50rollouts 要跑几天,还要人在旁边 reset 场景,成本极高 - 仿真评测:便宜快 · 但仿真里的 SR 排序 和真机排序对不上 —— 常常仿真第一名到真机是最后一名
Li 团队的关键发现:把 Octo / RT-1-X 等已发布策略同时在 SimplerEnv 和真机上跑,视觉配准模式下 Pearson 相关系数 > 0.9、Mean Maximum Rank Violation (MMRV) < 0.15。意思是仿真里策略间的相对排序与真机完全一致,可以放心当代理指标用。
这个结果让 SimplerEnv 迅速成为 VLA 论文里的必测项,尤其是主打 Bridge V2 / RT-1-X / Octo blueprint 的模型。
4 个 WidowX 官方任务
两种评测模式
| 模式 | 做法 | 用途 |
|---|---|---|
| Visual Matching | 真实拍摄背景 RGB + 仿真前景物体和机械臂 | 最贴近真机的评测 · 主指标 |
| Variant Aggregation | 系统改变光照 / 纹理 / 桌面颜色 / 干扰物,多 variant 平均 | 测策略的鲁棒性 · 副指标 |
配套数据集 · Bridge V2
| 字段 | 值 |
|---|---|
| 规模 | 60k+ 条真机轨迹 |
| 采集机构 | UC Berkeley RAIL Lab |
| 场景 | Berkeley 厨房台面 · 多种前景物体 / 背景 / 光照 |
| 机器人 | WidowX 250 单臂(6 DoF + 双指夹爪) |
| 控制频率 | 5 Hz(Bridge 环境标准) |
| 仿真物理引擎 | SAPIEN · 500 Hz |
| 许可 | MIT / CC-BY |
典型样例(视觉配准)
视觉配准模式:真实 RGB 背景 + 仿真前景物体 & 机械臂。图源:SimplerEnv GitHub raw。
主流模型分数(4 任务平均)
| 策略 | 真机 SR | 仿真 SR | 说明 |
|---|---|---|---|
| Octo-base | 20.8 | 16.0 | UC Berkeley 官方基座 |
| Octo-small | 25.6 | 29.5 | 轻量版 |
| RT-1-X | 0 | 0 | 仅在 Google Robot 任务上可评 |
| Qwen-VLA-Instruct | — | 73.7 | 论文只报仿真 |
Qwen-VLA 的 73.7% 大幅高于 Octo 系列,可能一部分归因于 backbone 规模(Qwen3.5-4B vs Octo < 1B),一部分归因于四阶段训练里的 RL 阶段直接在 SimplerEnv 上做了 fine-tune(见模型页 Stage IV)。
常见误区 / 局限
- SimplerEnv ≠ 真机:相关系数虽高,但仿真第 1 名不一定就是真机第 1 名,只保证大致排序对。想拿真机名次仍需真机评测。
- WidowX 侧任务偏简单:4 个任务都是「挑一个物体放到另一个位置」,缺长程 / 多阶段 / 双臂协作。想测复杂能力要看 RoboTwin / LIBERO-10。
- Bridge V2 分布 dominance:仿真环境是 Bridge V2 场景的 replay,训练里见过 Bridge 数据的模型有天然优势。
- Qwen-VLA 用了 SimplerEnv 做 RL:这意味着它的 73.7% 不是严格 zero-shot,而是「用它的 reward 训过」;比较时要注意与真正 zero-shot 模型(π₀ 类)的口径差异。