← VLA Atlas

ALOHA 真机 · 双臂 · 遥操作模仿

低成本开源双臂遥操作平台 · 10 分钟演示就能学精细操纵

ALOHA(Zhao et al. 2023: A Low-cost Open-source Hardware System for Bimanual Teleoperation)由 Tony Zhao 在 Stanford 时期开源。核心贡献是一套 leader-follower 遥操作硬件 + 配套的 ACT (Action Chunking Transformer) 模仿学习方法,让 10 分钟 演示就能训出 80-90% 成功率的精细操纵策略。

后续演化:ALOHA 2(Google DeepMind 改进版,标准化夹爪与工作台)· Mobile ALOHA(加移动底盘,Stanford 2024)· 已成为真机 VLA 事实上的标准测试床,Hugging Face LeRobot 上有几十个 aloha_* 任务数据集。

Qwen-VLA 论文里的 ALOHA 分数是真机 OOD 评测—— 在真实 ALOHA 2 平台上跑,测试训练时未见过的场景布局、背景、光照、物体配置。是全篇论文最贴近产品部署的指标。

Qwen-VLA 分数

76.9%
Avg OOD Success Rate · 真机分布外泛化 · arXiv 2605.30280
测试维度:场景布局 / 背景 / 光照 / 物体配置 / 本体变化下的平均 · 见论文 §5.1.6

发展史 · 三代 ALOHA

  1. 2023-04 · ALOHA v1arXiv 2304.13705)· Tony Zhao @ Stanford · 双 ViperX 300 S · 静态双臂 · 配套 ACT 论文
  2. 2024-01 · Mobile ALOHA项目页)· Zipeng Fu / Tony Zhao · 加移动底盘 · 演示做菜 / 开柜 / 乘电梯 · 共训(co-training)加静态数据 SR 提升 90%
  3. 2024-05 · ALOHA 2项目页)· Google DeepMind · 标准化夹爪 + 工作台高度 · 更换 3-finger 灵巧手可选 · 25 Hz 控制频率

关键设计哲学:硬件足够便宜且标准化,让所有研究组能复现同一个真机实验。当年这是革命性的 —— 之前研究组之间「我在真机 X 上跑 30%」和「我在真机 Y 上跑 60%」根本没法比较。

硬件规格

字段
双臂2 × Interbotix ViperX 300 S · 6 DoF/臂 + 平行夹爪
遥操作结构Leader ×2(人手)+ Follower ×2(执行)· 关节-关节复制
控制频率50 Hz(原版 ALOHA)· 25 Hz(ALOHA 2)
摄像头CAM_HIGH 顶视 + CAM_LOW 俯视 + CAM_LEFT_WRIST / CAM_RIGHT_WRIST 腕部
硬件成本约 $20K–30K USD(双臂 + 传感器 + 计算机 · Mobile 版含底盘约 $32K)
ACT 训练时长单任务 5 小时 GPU(RTX 3090)

三代对照

维度ALOHAALOHA 2Mobile ALOHA
形态静态双臂标准化静态双臂双臂 + 移动底盘
发起方Stanford · ZhaoGoogle DeepMindStanford + Google
创新点ACT 模仿学习夹爪 / 工作台标准化全身遥操作 · 家务任务
典型任务精细操纵 6 类更多标准化任务做菜 / 开柜 / 乘电梯
控制频率50 Hz25 Hz50 Hz

ACT · Action Chunking Transformer

ALOHA 配套论文的核心 idea:与其像传统模仿学习那样每一步只预测下一步动作,不如一次预测未来 K 步(chunk)。这样:

ACT 之后所有主流 VLA 都采用 action chunking:π₀ / OpenVLA / Qwen-VLA 都是 K=32-64 步一次预测。可以说 ACT 定义了当代 VLA 的输出接口

典型 LeRobot 任务

static_coffee
咖啡机操作 · 双臂配合 · ~55K episodes
static_vinh_cup
打开 Vinh 杯盖 · 精细拧转 · ~45K episodes
static_battery
插入电池槽 · 精细对准 + 力控
static_thread_velcro
穿线缆带 · 精细协调
mobile_wipe_wine
Mobile ALOHA · 擦拭酒渍 · ~65K episodes
mobile_cabinet
Mobile ALOHA · 开柜取物 · 移动+操纵联合

Qwen-VLA 真机评测口径

论文中 76.9%真实世界分布外(OOD)平均成功率。测试流程:

  1. 用 CPT checkpoint 起 · 遥操作 SFT 分支在内部 ALOHA 2 数据上 fine-tune
  2. 部署到实体 ALOHA 2 平台
  3. 用五个 OOD 维度分别评测:场景布局 / 背景 / 光照 / 物体配置 / 本体变化
  4. 每个维度包含若干具体任务,取平均

76.9% 是这五个维度的平均。具体每任务分项分数请查论文 §5.1.6。

常见误区 / 局限

相关工作

RoboTwin
ALOHA 硬件的仿真对应 · 双臂 50 任务
DROID
Franka Panda 真机 · 76K 轨迹 · 单臂对照
RH20T
上海交大 · 单臂真机 · 20K trajectories
Qwen-VLA
在 ALOHA 2 上做 SFT + OOD 评测

参考链接

ALOHA 项目页
tonyzhaozh.github.io/aloha
Mobile ALOHA 项目页
mobile-aloha.github.io
ALOHA 2 项目页
Google DeepMind 版本
arXiv 2304.13705
Learning Fine-Grained Bimanual Manipulation · ACT 论文
GitHub · aloha
硬件 BOM + 训练脚本
Hugging Face · LeRobot
lerobot/aloha_* 系列数据集