← VLA Atlas

UniVLA LIBERO 95.5% · CALVIN SOTA · WidowX 69.8%

BAAI / CASIA / THU · 8.5B 纯自回归 Transformer · 视觉 / 语言 / 动作三模态离散 token 统一建模 + World Model post-training

UniVLAarXiv 2506.19850)主张 VLA 不需要"多头拼接",而是把视觉、语言、动作全部离散化到统一 token 空间,用一个 8.5B 参数的纯自回归 Transformer(与 Emu3 同架构)建模。这条路线的关键创新是用"世界模型"作为 post-training 目标:在 622K 无动作标注的机器人视频上让模型学"给定语言+当前帧,预测下一帧",从而把因果动力学吃到 backbone 里,再迁移到 policy 微调。

Table 4 (§4.4) 的 ablation 是它最有说服力的数字:不做 post-training,LIBERO 只有 48.5%;只做 T2I post-training 到 69.8%;只做 video prediction 到 78.9%;加上"世界模型"(text + video 一起 condition)直接飙到 94.2%。这条曲线明确回答了"到底哪种 post-training 有用"。

关键数字(论文 Table 1-3 口径)

BenchmarkUniVLA最强对手差值
LIBERO 平均(Spatial/Object/Goal/Long)95.5%85.5% (π₀-FAST)+10.0
LIBERO-Long(长时任务)94.0%69.0% (CoT-VLA)+25.0
LIBERO-Object98.8%96.8% (π₀-FAST)+2.0
CALVIN ABCD→D avg len4.634.49 (RoboVLMs)+0.14
CALVIN ABC→D avg len4.414.28 (Seer-Large)+0.13
SimplerEnv-WidowX overall69.8%42.7% (SpatialVLA)+27.1
NAVSIM 自动驾驶 PDMS81.784.0 (Transfuser+MC+LiDAR)-2.3

NAVSIM 是 UniVLA 用同一个模型只加下游微调、只用前视单摄测的结果 —— 不做任何驾驶数据预训练就落到接近 BEV+LiDAR 方案的水位,说明 token 统一路线有跨域潜力。

架构与训练配方

关键 Ablation:World Model 是最有效的 post-training

Post-training 策略LIBEROSimplerEnv-WidowXLIBERO-LongCALVIN
不做 post-train48.50.017.41.46
仅 action prediction43.9 (-4.6)0.010.6 (-6.8)0.52 (-0.94)
text-to-image69.8 (+21.3)6.355.83.79
video prediction78.9 (+30.4)17.780.83.59
world model(text + video)94.2 (+45.7)64.689.24.61

来源:论文 Table 4。有一个反直觉观察:直接在机器人视频上做 action prediction 反而下游表现(-4.6),因为不同数据源 action space 不一致,学到的东西不 transfer。视觉预测(尤其带语言条件的 world model)比 action 预训练更有效 —— 这为"世界模型是通用 VLA post-training 手段"提供了实锤。

数据效率与训练效率

UniVLARoboVLMsGR-1
CALVIN 10% 数据 avg len3.192.522.00
CALVIN 收敛到 4.6+2k iters
SimplerEnv-Bridge 到 60%+12k iters, bs 12850k iters, bs 128

来源:论文 Table 5。post-training 之后 fine-tuning 阶段的 sample efficiency 和 iteration efficiency 都 4-5× 提升。

History Context 的最佳窗口

结论:短 window + 1-2 帧历史 已经吃到大部分收益,符合 Markov 直觉。这条实证有助于工程侧压缩 context 长度、降低推理成本。

SimplerEnv-WidowX 分任务分数

任务UniVLASpatialVLARoboVLMsOpenVLA
Put Spoon on Towel83.316.745.80.0
Put Carrot on Plate66.725.020.80.0
Stack Green on Yellow33.329.24.20.0
Put Eggplant in Basket95.810079.24.1
Overall Success69.842.737.51.0

差异化定位

把 UniVLA 放在离散动作 token 路线的时间线里看:

UniVLA 的另一个隐含贡献:证明"多头拼接"不是 VLA 必需品。同期的 Motus / RDT2 都在做架构统一,但 UniVLA 是最激进的 pure-AR 版本。

相关

离散 Action Token 路线
UniVLA 是这条路线目前最强代表
π₀-FAST(被超越对象)
LIBERO 平均 85.5% → UniVLA 95.5%
Motus(同为统一路线)
MoT + UniDiffuser 是另一种统一姿势
RDT2
AR + Diffusion 两阶段,另一种"离散 + 连续"路线

参考链接

arXiv 2506.19850
Unified Vision-Language-Action Model · 2025-06-24
GitHub · baaivision/UniVLA
代码 + 权重 · BAAI 官方(页面地址请核实)