← VLA Atlas

MolmoAct SimplerEnv 70.5 zero-shot · LIBERO 86.6 · 双臂 +22.7 vs π₀-FAST

Allen AI + UW · Action Reasoning Models (ARMs) 首创 · 三阶段结构化 pipeline · 完全开源 weights + code + dataset

MolmoActarXiv 2508.07917)是 Allen AI 2025-08 的重量级工作,提出 Action Reasoning Model (ARM) 这一新范式:把 VLA 从"感知直接映射到控制"改成三阶段结构化 pipeline:

  1. Depth-aware perception tokens:编码观察和指令
  2. Mid-level spatial plans:生成可编辑的 trajectory traces(可以在 UI 上直接改)
  3. Low-level actions:预测精确的动作

结果:MolmoAct-7B-D 用少一个量级的数据(26.3M vs π₀ 903M)就打过 π₀ / GR00T N1 等 baseline,且是唯一同时开源 weights + code + dataset + action reasoning dataset 的 SOTA VLA。项目页 allenai.org/blog/molmoact

关键数字(论文 §5 口径)

BenchmarkMolmoAct-7B-D最强对手差值
SimplerEnv Visual Matching (zero-shot)70.5%Magma 68.4%+2.1
SimplerEnv Variant Aggregation (fine-tuned)72.1%RT-2-X 64.3%+7.8
LIBERO 平均86.6%ThinkAct 84.4%+2.2
LIBERO-Long77.2%ThinkAct 70.9%+6.3
真机单臂 Franka(3 任务)task progression+10% vs π₀-FASTπ₀-FAST baseline+10.0
真机双臂 Franka(3 任务)task progression+22.7% vs π₀-FASTπ₀-FAST baseline+22.7
OOD 泛化平均 vs π₀-FAST+23.3%π₀-FAST baseline+23.3
Mid-training with MolmoAct Dataset+5.5% avgno mid-train baseline+5.5

预训练数据规模的震撼对比

MolmoAct 反常识的一点:预训练数据量比 π₀ 少一个量级,性能却更好:

ModelPre-training samples
π₀≥ 903M
MolmoAct-7B-D-Pretrain~26.3M(1/34)

数据组成:OXE 子集(BC-Z + BridgeData V2 + RT-1)+ 多模态 web data + 辅助机器人数据。结构化 reasoning 补偿了数据量—— 高质量深度感知 + 可编辑 spatial plans + low-level actions 三阶段监督比暴力堆数据更有效。

真机 Franka 主结果(论文 Fig 5)

每任务 50 条 tele-op 演示,25 trials 评估 task progression score:

单臂 Franka(3 任务)

双臂 Franka(3 任务)

OOD 泛化:真机 4 类 shift(论文 Fig 6a)

3 类物体 + 2 种颜色盘子的多任务真机,训 300+ 演示,OOD 测试 4 方面:

  1. Language Variation:改写指令(rephrase)
  2. Spatial Variation:目标物体位置变化
  3. Distractors:加不相关物体干扰
  4. Novel Objects:替换成没见过的物体

相对 π₀-FAST +23.3% 平均 task progression。MolmoAct 在 4 个 OOD axis 上都胜出。

MolmoAct Dataset(10K 条真机演示)

MolmoAct 首次开源了一个mid-training数据集:

这是社区第一次拿到专为 VLA mid-training 设计的开源数据集——之前只有各家闭源采集。

Instruction Following:Elo Arena(论文 Fig 7-8)

作者用 head-to-head arena 让人类评审在 open-ended 指令下选更好的 rollout:

1) 模拟环境执行(vs SpatialVLA / OpenVLA)

2) Visual Trace 生成(vs Gemini-2.5-Flash / GPT-4o / HAMSTER)

Steerability:sketching 修改动作(论文 Fig 9)

MolmoAct 的一个杀手锏:轨迹可以用 UI 上画的 sketching 直接修改。测试 pick_up_bowl 任务:

这是"human-in-the-loop VLA"的一个漂亮 demo —— 让机器人可编辑、可解释。

模型架构与训练

差异化定位

MolmoAct 是"结构化 reasoning + 完全开源"路线的当代旗舰:

MolmoAct 在 NORA-1.5 论文的 LIBERO Table 里就是核心对照 baseline(MolmoAct-7B-D 86.6%),说明它是当代 VLA 圈子里的标准参照

相关

MolmoAct2(后继版)
2026-05 · +MolmoER + OpenFAST + Adaptive Depth · LIBERO 97.2%
ThinkAct(同为 Reasoning-VLA)
用 GRPO RL 而非结构化 depth-aware pipeline
NORA-1.5(对照 baseline)
NORA-1.5 Table 2 里就是拿 MolmoAct-7B-D 86.6% 作对照
π₀ / π₀-FAST(对照 · 被超越)
MolmoAct 双臂 +22.7%、OOD +23.3%

参考链接

arXiv 2508.07917
MolmoAct: Action Reasoning Models that can Reason in Space · 2025-08-11 · 118 citations
Allen AI Blog · MolmoAct
项目页 · 演示视频 · 数据集下载