← VLA Atlas

NORA-1.5 LIBERO 95.0% · SimplerEnv VM 82.8% · 真机 +46 vs π₀

NTU 新加坡 declare-lab · Flow matching action expert + World-Model reward + DPO 后训练 · 首个成熟 DPO for VLA 方案

NORA-1.5arXiv 2511.14659)从两个角度改 NORA 基座:

  1. 架构升级:在 NORA 自回归 backbone 后加 flow-matching action expert,单这一步就持续超各 SOTA VLA
  2. Reward-driven post-training:造两类 reward — (a) action-conditioned world model 判断动作是否走向目标(WM reward);(b) 相对 ground-truth 的偏差启发式(GTA reward)。用它们组 preference 数据集,跑 DPO 对齐 policy

NORA-1.5 是首个把 DPO 训练用自动 preference 落到 VLA 的开源工作 —— 从而不用人标 preference pair。

SimplerEnv Visual Matching 主结果(论文 Table 1)

ModelPick CokeMove NearDrawerAvg
OpenVLA16.346.235.627.7
π₀ (fine-tuned)72.765.338.358.7
π₀-FAST (fine-tuned)75.367.542.961.9
SpatialVLA (fine-tuned)86.077.957.473.7
MolmoAct (fine-tuned)77.777.160.071.6
NORA-1.5 (SFT)92.878.762.277.9
NORA-1.5 (DPO)94.088.066.482.8

SimplerEnv Variant Aggregation(论文 Table 1)

ModelPick CokeMove NearDrawerAvg
SpatialVLA (fine-tuned)88.072.741.867.5
MolmoAct (fine-tuned)76.161.378.872.1
NORA-1.5 (DPO)92.679.044.171.9

LIBERO(论文 Table 2)

ModelSpatialObjectGoalLongAvg
OpenVLA84.788.479.253.776.5
π₀-FAST96.496.888.660.285.5
π₀96.898.895.885.294.2
ThinkAct88.391.487.170.984.4
NORA-1.5 (SFT)97.396.494.589.694.5
NORA-1.5 (DPO)98.096.095.490.595.0

真机 Galaxea A1(论文 Table 3,9 任务)—— NORA-1.5 打过 π₀ 46 point

ModelPart. Succ.Distractor 抓错 ↓Success
π₀ (3.3B)44.44%68.33%25.55%
NORA (3B)73.3%13.3%58.88%
NORA-1.5-FAST (3.3B)78.88%15.00%71.11%

Galaxea A1 是"不在预训数据集里"的机器人 —— 测的是跨机型泛化。三类任务:Put U in U(3 个)· Put U in S with distractor(3 个)· Move U to U with distractor(3 个)。NORA-1.5 相对 π₀ 提升 46 point,且 distractor 抓错率降 53 point。

DPO Reward 消融(论文 Table 4)—— WM + GTA 组合最好

Reward StrategySimplerEnv VM AvgSimplerEnv VA Avg
SFT baseline(无 DPO)77.970.7
WM (endgoal) only76.472.5
WM (subgoal) only78.772.2
GTA only81.272.5
WM (endgoal) + GTA82.871.9
WM (subgoal) + GTA79.073.0

观察:(1) WM (endgoal) 单用会在 Move Near 掉性能(不理解安全约束);(2) GTA 单用好但对"pick coke can"不 fit;(3) 组合 WM + GTA 最稳定;(4) WM (subgoal) 比 WM (endgoal) 更抗视觉变化(VA 上表现更好) —— 因为 subgoal 帧更近、变化更小、信号更清晰。

DPO 让 Gripper 轨迹变漂亮

论文 Fig 3 展示:DPO 前的 gripper 有大量 fixation 和 zigzag;DPO 后 trajectory 平滑很多。数量上:

说明 DPO 不仅提高成功率,还让动作策略本身更高效。

关键工程发现

差异化定位

NORA-1.5 是把 alignment 引入 VLA最完整的开源代表:

DPO for VLA 这条线还很新,NORA-1.5 是第一个能 reproduce 的开源实现,值得研究。

相关

Flow Matching
NORA-1.5 的核心动作头
π₀(被超越)
Galaxea A1 上 π₀ 25.55% vs NORA-1.5 71.11%
ThinkAct
同为 RL for VLA · 但走 reasoning 而非 policy alignment

参考链接

arXiv 2511.14659
NORA-1.5: VLA with WM- and Action-based Preference Rewards · 2025-11-18
GitHub · declare-lab/nora-1.5
代码 + 权重(页面请核实)