RynnVLA-001 SO-100 90.6% · 打过 π₀ 20 points
Alibaba DAMO · 12M egocentric 视频预训练 + ActionVAE 潜动作压缩 · SO-100 真机三任务 SOTA
RynnVLA-001(arXiv 2509.15212)是 Alibaba DAMO 的官方 VLA,主打用大规模 ego-centric 视频生成式预训练做 VLA 初始化。整个 pipeline 两阶段预训练 + ActionVAE 潜动作压缩,在 SO-100 真机三任务上把 π₀ 打出 20 point 优势。
结果的说服力来自严格的对照实验—— 论文 Table 3 展示了 4 种初始化方案(scratch / Chameleon T2I / 只用 Stage-1 视频预训 / 完整 Stage 1+2)的成功率,越完整越强,最终版 90.6% 显著超过 Chameleon 起步的 50.0%。
SO-100 真机三任务(论文 Table 1)
| Method | Green Blocks | Strawberries | Pen→Holder | Average | SR@1 |
|---|---|---|---|---|---|
| GR00T N1.5 | 65.0 | 53.3 | 48.3 | 55.6 | 37.2 |
| π₀ | 75.6 | 71.1 | 64.4 | 70.4 | 56.3 |
| RynnVLA-001 | 90.0 | 91.7 | 90.0 | 90.6 | 56.7 |
3 个任务分别考察:基础物体识别 + 抓取(green blocks,248 演示);精细定位 + 抓取(strawberries,249 演示);3D 空间推理 + 插入(pen holder,301 演示)。数据在 3 台 SO-100、不同环境、不同光照下采集。
三种测试场景(论文 Table 2)
| Method | Single-Target | Multi-Target | Distractor 干扰 |
|---|---|---|---|
| GR00T N1.5 | 63.3 | 46.7 | 56.7 |
| π₀ | 80.0 | 71.1 | 60.0 |
| RynnVLA-001 | 93.3 | 86.7 | 91.7 |
π₀ 在指令遵循带干扰场景显著掉分(60%)—— 它更多是 vision-driven,倾向抓最容易的东西;而 RynnVLA-001 保持稳定 91.7%,是因为预训练里带了多目标 + 干扰物的数据分布。
两阶段预训练(核心贡献)
Stage 1 · Ego-Centric Video Generative Pretraining
- 数据:12M ego-centric 操纵视频
- 目标:Image-to-Video —— 给定当前帧 + 语言指令 → 预测接下来 7 帧
- 作用:学"运动的物理先验" —— 视觉表征天然对齐 VLA 的输入格式
Stage 2 · Human-Centric Trajectory-Aware Modeling
- 在 Stage 1 基础上,联合预测未来帧 + 未来 keypoint 轨迹
- 作用:桥接"视觉帧预测"和"动作预测"两个空间
预训练消融(论文 Table 3)—— 每阶段贡献
| 初始化 | Green Blocks | Strawberries | Pen→Holder | Avg |
|---|---|---|---|---|
| Scratch(随机初始化) | 0 | 6.7 | 6.7 | 4.4 |
| Chameleon T2I 权重 | 56.6 | 50.0 | 43.3 | 50.0 |
| + Stage 1 视频预训 | 81.7 | 86.7 | 85.0 | 84.4 |
| + Stage 2 完整(Full) | 90.0 | 91.7 | 90.0 | 90.6 |
Scratch → Chameleon 提升 +46(说明 T2I 预训比随机好),Chameleon → +Stage 1 提升 +34(ego 视频预训是最大的单步收益),Stage 1 → +Stage 2 提升 +6(keypoint trajectory 目标进一步桥接)。
ActionVAE:潜动作压缩
RynnVLA-001 用 VAE 把动作序列压成 latent embedding,让 VLA 输出"潜空间动作"再解码,而不是直接吐 raw action tokens。
| Action 表示 | CALVIN ABC→D avg len |
|---|---|
| Raw actions prediction | 4.019 |
| Deeper 5-layer action head | 3.323 (更差) |
| ActionVAE latent (Full) | 4.161 |
两个观察:(1) VAE 潜表示比 raw actions 更好(+0.14 avg len)—— 因为它压缩了冗余、结构化了 latent;(2) 反直觉地,更深的 action head 反而降性能(3.323)—— transformer hidden state 已经是好表征,简单线性映射足够,深 MLP 引入噪声。这个结论对做 action head 的团队很有指导。
其他关键工程细节
- 图像分辨率:384×384 是 sweet spot(256×256 严重掉,因为 VQGAN 是 512×512 训的)
- 相机布局:LeRobot SO-100 的前视相机提供粗定位 + 3D 投影信息(论文 §5.5 通过遮挡实验证明 —— 挡掉前视相机,目标在腕视野外时成功率从 80% 掉到 0%);腕视相机负责精细局部调整
- 训练数据多样性:不带 distractor 训 → 遇到 distractor 场景 0% 成功;带 distractor 训 → 90%。训练数据分布必须覆盖 test 场景
- 数据规模:3 任务共 798 条真机演示(248 + 249 + 301)—— 相对小训练量下的 SOTA,说明预训练价值极高
差异化定位
RynnVLA-001 是"用视频生成作为 VLA 预训练目标"这条路的规模化尝试。同类思路:
- Large Video Planner:更极端,直接用预训视频模型 zero-shot 出 plan
- Genie Envisioner:GE-Base 是 instruction-conditioned video diffusion,思路相似但走一体化平台
- UniVLA world-model post-train:也是"视频作为 post-train 目标",但用离散 token 自回归而非 VAE 潜空间
RynnVLA-001 走的是"预训练 → 有监督下游微调"的中间路线,工程性最强,配合 SO-100 消费级机械臂能立即上手。