← VLA Atlas

RynnVLA-001 SO-100 90.6% · 打过 π₀ 20 points

Alibaba DAMO · 12M egocentric 视频预训练 + ActionVAE 潜动作压缩 · SO-100 真机三任务 SOTA

RynnVLA-001arXiv 2509.15212)是 Alibaba DAMO 的官方 VLA,主打用大规模 ego-centric 视频生成式预训练做 VLA 初始化。整个 pipeline 两阶段预训练 + ActionVAE 潜动作压缩,在 SO-100 真机三任务上把 π₀ 打出 20 point 优势。

结果的说服力来自严格的对照实验—— 论文 Table 3 展示了 4 种初始化方案(scratch / Chameleon T2I / 只用 Stage-1 视频预训 / 完整 Stage 1+2)的成功率,越完整越强,最终版 90.6% 显著超过 Chameleon 起步的 50.0%。

SO-100 真机三任务(论文 Table 1)

MethodGreen BlocksStrawberriesPen→HolderAverageSR@1
GR00T N1.565.053.348.355.637.2
π₀75.671.164.470.456.3
RynnVLA-00190.091.790.090.656.7

3 个任务分别考察:基础物体识别 + 抓取(green blocks,248 演示);精细定位 + 抓取(strawberries,249 演示);3D 空间推理 + 插入(pen holder,301 演示)。数据在 3 台 SO-100、不同环境、不同光照下采集。

三种测试场景(论文 Table 2)

MethodSingle-TargetMulti-TargetDistractor 干扰
GR00T N1.563.346.756.7
π₀80.071.160.0
RynnVLA-00193.386.791.7

π₀ 在指令遵循带干扰场景显著掉分(60%)—— 它更多是 vision-driven,倾向抓最容易的东西;而 RynnVLA-001 保持稳定 91.7%,是因为预训练里带了多目标 + 干扰物的数据分布。

两阶段预训练(核心贡献)

Stage 1 · Ego-Centric Video Generative Pretraining

Stage 2 · Human-Centric Trajectory-Aware Modeling

预训练消融(论文 Table 3)—— 每阶段贡献

初始化Green BlocksStrawberriesPen→HolderAvg
Scratch(随机初始化)06.76.74.4
Chameleon T2I 权重56.650.043.350.0
+ Stage 1 视频预训81.786.785.084.4
+ Stage 2 完整(Full)90.091.790.090.6

Scratch → Chameleon 提升 +46(说明 T2I 预训比随机好),Chameleon → +Stage 1 提升 +34(ego 视频预训是最大的单步收益),Stage 1 → +Stage 2 提升 +6(keypoint trajectory 目标进一步桥接)。

ActionVAE:潜动作压缩

RynnVLA-001 用 VAE 把动作序列压成 latent embedding,让 VLA 输出"潜空间动作"再解码,而不是直接吐 raw action tokens。

Action 表示CALVIN ABC→D avg len
Raw actions prediction4.019
Deeper 5-layer action head3.323 (更差)
ActionVAE latent (Full)4.161

两个观察:(1) VAE 潜表示比 raw actions 更好(+0.14 avg len)—— 因为它压缩了冗余、结构化了 latent;(2) 反直觉地,更深的 action head 反而降性能(3.323)—— transformer hidden state 已经是好表征,简单线性映射足够,深 MLP 引入噪声。这个结论对做 action head 的团队很有指导。

其他关键工程细节

差异化定位

RynnVLA-001 是"用视频生成作为 VLA 预训练目标"这条路的规模化尝试。同类思路:

RynnVLA-001 走的是"预训练 → 有监督下游微调"的中间路线,工程性最强,配合 SO-100 消费级机械臂能立即上手。

相关

ACT · CVAE 动作头
RynnVLA-001 的 ActionVAE 与 ACT 的 CVAE 有共同 idea
π₀(被超越对象)
RynnVLA-001 在 SO-100 上打过 π₀ 20 point
Genie Envisioner
同为"视频生成 + VLA"路线

参考链接

arXiv 2509.15212
RynnVLA-001: Human Demonstrations → Robot Manipulation · 2025-09-18
GitHub · alibaba-damo-academy/RynnVLA-001
代码 + 权重(地址请核实)