ALOHA 真机 · 双臂 · 遥操作模仿
低成本开源双臂遥操作平台 · 10 分钟演示就能学精细操纵
ALOHA(Zhao et al. 2023: A Low-cost Open-source Hardware System for Bimanual Teleoperation)由 Tony Zhao 在 Stanford 时期开源。核心贡献是一套 leader-follower 遥操作硬件 + 配套的 ACT (Action Chunking Transformer) 模仿学习方法,让 10 分钟 演示就能训出 80-90% 成功率的精细操纵策略。
后续演化:ALOHA 2(Google DeepMind 改进版,标准化夹爪与工作台)· Mobile ALOHA(加移动底盘,Stanford 2024)· 已成为真机 VLA 事实上的标准测试床,Hugging Face LeRobot 上有几十个 aloha_* 任务数据集。
Qwen-VLA 论文里的 ALOHA 分数是真机 OOD 评测—— 在真实 ALOHA 2 平台上跑,测试训练时未见过的场景布局、背景、光照、物体配置。是全篇论文最贴近产品部署的指标。
Qwen-VLA 分数
测试维度:场景布局 / 背景 / 光照 / 物体配置 / 本体变化下的平均 · 见论文 §5.1.6
发展史 · 三代 ALOHA
- 2023-04 · ALOHA v1(arXiv 2304.13705)· Tony Zhao @ Stanford · 双 ViperX 300 S · 静态双臂 · 配套 ACT 论文
- 2024-01 · Mobile ALOHA(项目页)· Zipeng Fu / Tony Zhao · 加移动底盘 · 演示做菜 / 开柜 / 乘电梯 · 共训(co-training)加静态数据 SR 提升 90%
- 2024-05 · ALOHA 2(项目页)· Google DeepMind · 标准化夹爪 + 工作台高度 · 更换 3-finger 灵巧手可选 · 25 Hz 控制频率
关键设计哲学:硬件足够便宜且标准化,让所有研究组能复现同一个真机实验。当年这是革命性的 —— 之前研究组之间「我在真机 X 上跑 30%」和「我在真机 Y 上跑 60%」根本没法比较。
硬件规格
| 字段 | 值 |
|---|---|
| 双臂 | 2 × Interbotix ViperX 300 S · 6 DoF/臂 + 平行夹爪 |
| 遥操作结构 | Leader ×2(人手)+ Follower ×2(执行)· 关节-关节复制 |
| 控制频率 | 50 Hz(原版 ALOHA)· 25 Hz(ALOHA 2) |
| 摄像头 | CAM_HIGH 顶视 + CAM_LOW 俯视 + CAM_LEFT_WRIST / CAM_RIGHT_WRIST 腕部 |
| 硬件成本 | 约 $20K–30K USD(双臂 + 传感器 + 计算机 · Mobile 版含底盘约 $32K) |
| ACT 训练时长 | 单任务 5 小时 GPU(RTX 3090) |
三代对照
| 维度 | ALOHA | ALOHA 2 | Mobile ALOHA |
|---|---|---|---|
| 形态 | 静态双臂 | 标准化静态双臂 | 双臂 + 移动底盘 |
| 发起方 | Stanford · Zhao | Google DeepMind | Stanford + Google |
| 创新点 | ACT 模仿学习 | 夹爪 / 工作台标准化 | 全身遥操作 · 家务任务 |
| 典型任务 | 精细操纵 6 类 | 更多标准化任务 | 做菜 / 开柜 / 乘电梯 |
| 控制频率 | 50 Hz | 25 Hz | 50 Hz |
ACT · Action Chunking Transformer
ALOHA 配套论文的核心 idea:与其像传统模仿学习那样每一步只预测下一步动作,不如一次预测未来 K 步(chunk)。这样:
- 累积误差从
O(T²)变O((T/K)²)—— 大幅缓解compounding error - 动作序列的时序一致性用 transformer 建模 —— 更平滑
- 用 CVAE 建模 demonstration 里的多模态—— 同一状态下允许多种正确动作
ACT 之后所有主流 VLA 都采用 action chunking:π₀ / OpenVLA / Qwen-VLA 都是 K=32-64 步一次预测。可以说 ACT 定义了当代 VLA 的输出接口。
典型 LeRobot 任务
~55K episodes~45K episodes~65K episodesQwen-VLA 真机评测口径
论文中 76.9% 是真实世界分布外(OOD)平均成功率。测试流程:
- 用 CPT checkpoint 起 · 遥操作 SFT 分支在内部 ALOHA 2 数据上 fine-tune
- 部署到实体 ALOHA 2 平台
- 用五个 OOD 维度分别评测:场景布局 / 背景 / 光照 / 物体配置 / 本体变化
- 每个维度包含若干具体任务,取平均
76.9% 是这五个维度的平均。具体每任务分项分数请查论文 §5.1.6。
常见误区 / 局限
- ALOHA vs ALOHA 2 数据不完全通用:控制频率(50 vs 25 Hz)、夹爪都变了,用 v1 数据直接跑 v2 硬件可能翻车。
- Mobile ALOHA 底盘复杂度:加了移动能力后坐标系变得复杂,很多 static 训练的模型难以适应。
- 硬件仍然贵:$20K+ 对个人研究者仍是门槛,「低成本」是相对于工业双臂 ($200K+) 而言。
- 真机评测代价高:一次完整 OOD 评测要 40-100 小时人工 · 论文里没有 error bar 或只跑 5-10 rollouts / 任务是常见的。看到 76.9 别当成 ±0.1 的精度,实际 ±5-10 都可能。
- Zhao 2024 已加入 Google:ALOHA 系列的持续维护跟着他走了,v1 官方仓库更新变慢,社区版和 Mobile ALOHA 是主流。