← VLA Atlas

Qwen-VLA Qwen Team · 2026-05

统一操纵、导航、轨迹预测的一体化视觉-语言-动作基础模型

Qwen-VLA 是 Qwen 团队在 2026-05-28 发布的具身基础模型(arXiv 2605.30280)。它的核心主张是:操纵、导航、轨迹预测 三大类具身决策问题不用做三个专用模型,而是可以塞进同一个 VLA 里,只需切换 embodiment prompt 就能跨机器人本体、跨环境泛化。

基线成绩:LIBERO 97.9 · Simpler-WidowX 73.7 · RoboTwin-E/H 86.1/87.2 · R2R 69.0 OSR · RxR 59.6 SR · ALOHA 真机 OOD 76.9 · DOMINO 零样本 26.6

架构 · Architecture

图像 / 视频 RGB · 多视角 任务指令 "pick up the red cup" Embodiment Prompt "dual arms, 30Hz, predict 32 actions..." Qwen3.5-4B VLM Native multimodal backbone ViT + spatial merging gated linear attention + grouped-query softmax 感知 · 理解 · 推理 hidden Noisy action chunk flow-matching latent · shape [T, D_act] DiT Action Expert Flow-matching policy · 1.15B 16 DiT blocks (70.8M each) AdaLN 时间步 + multi-section RoPE joint self-attn (hidden ⊕ action) Euler 少步积分 → clean action Action chunk(未来 32-64 步动作) 图例: 感知输入 主干 动作专家 输出

分工类比生物运动控制的大脑(backbone)与小脑(action expert)。VLM 负责视觉-语言理解与推理,DiT 通过 flow matching 在动作空间做去噪,两者靠 joint self-attention 沟通。

Embodiment-aware Prompt

为了在一套权重上支持不同机器人本体,Qwen-VLA 给每条训练样本前面拼一段固定模板的机器人描述:

The robot is {robot_tag} with {single arm / dual arms}
[, waist][, and mobile base]. The control frequency is
{FPS} Hz. Please predict the next {chunk_size} control
actions to execute the following task: {ori_instruction}.

robot_tag、腰部/底盘选项、控制频率、动作分块长度都跟随各数据集的原始配置。同一个「pick up the red cup」的任务意图,会因为 embodiment prompt 不同而映射到不同关节空间的动作程序。

四阶段训练 · Staged Recipe

Text-to-Action DiT 预训练(T2A)

VLM 冻结,只训 DiT,刻意不给图像。让 decoder 从纯语言 + embodiment prompt 学一个「语言索引的动作先验」:不同措辞选择动作空间的不同区域,embodiment prompt 调制到平台特有的运动参数化。

持续预训练(CPT)

解冻两个模块,用 §3.2 的混合数据(仿真 + 真机轨迹 + 人类第一视角 + 导航 + 轨迹监督 + 视觉语言)一起训。此时 decoder 已有语言先验,多模态容量专注于把动作 grounding 到视觉观测

监督微调(SFT) · 双分支并行

  • 多任务 SFT:VQA、空间 grounding、操纵、导航联合训练,本体和任务平衡采样
  • 遥操作 SFT:从 CPT checkpoint 上单独用内部遥操作数据 fine-tune,专攻真机部署

强化学习(RL) → Qwen-VLA-Instruct

从多任务 SFT 起点用稀疏二值成功奖励做 RL,只在 SimplerEnv 一个仿真环境里训。刻意窄化 RL 范围,测试单一仿真环境的成功率提升能否迁移到 OOD 场景 —— 这是最终对外报分数的模型。

全部基准分数(Qwen-VLA-Instruct)

数据集形态指标分数
LIBERO仿真 · Panda 单臂Avg Success Rate97.9%
Simpler-WidowX仿真 · WidowX 单臂Avg Success Rate73.7%
RoboTwin-Easy仿真 · 双臂Success Rate86.1%
RoboTwin-Hard仿真 · 双臂Success Rate87.2%
R2RVLN · 室内Oracle Success Rate69.0%
RxRVLN · 多语Success Rate59.6%
ALOHA真机 · ALOHA 2 双臂Avg OOD Success76.9%
DOMINO动态操纵 · 5 本体Zero-shot Success26.6%

参考

arXiv 2605.30280 PDF
Qwen-VLA 完整论文 · Qwen Team · 2026-05-28
GitHub · QwenLM/Qwen-VLA code
权重 / 推理 / 训练脚本