← VLA Atlas

Ψ₀ Psi-Zero Humanoid · 比 GR00T N1.6 高 40% · 800h 人 + 30h 机器人

Unitree G1 · Qwen3-VL-2B + MM-DiT 500M action expert · 阶段解耦训练 · 数据质量 > 数据总量的实证

Ψ₀arXiv 2603.12263)针对 humanoid 领域一个反常识发现:把人类视频和 humanoid 数据一起 co-train 效果并不好,因为人和 humanoid 的运动学差异过大。Ψ₀ 分阶段训练 —— 先在 EgoDex 大规模人视频上预训 VLM 学"视觉-动作表征",再在 Humanoid Everyday 真机数据上后训一个 MM-DiT action expert 学关节控制。

结果颠覆"数据越多越好"的直觉:只用 ~800 小时人视频 + 30 小时真机数据,就打过用了 10× 数据的基线 40% 以上(8 个真实 humanoid loco-manipulation 任务的平均成功率)。这条数据配方是全篇最有启发的贡献。

硬件与任务(论文 §IV-A1, §IV-B1)

两阶段配方

Stage 1 · VLM 自回归预训练(EgoDex)

Stage 2 · Action Expert 后训练(Humanoid Everyday)

Stage 3 · Downstream Fine-tuning

只 fine-tune action expert · 40K steps · cosine lr 1e-4 · 每个任务 80 条 teleop 演示。

核心对比:Ψ₀ 打过所有开源 humanoid baseline(论文 Fig 7)

基线全部认真复现(作者原文:"invest huge effort to reproduce the best possible results"):

结果:Ψ₀ 平均总成功率比第二好的 baseline GR00T N1.6 高 40% 以上(作者原话:"achieves an average overall success rate that is at least 40% higher than that of the second-best baseline, GR00T-N1.6")。这里 GR00T N1.6 是最新一代的 humanoid foundation model,Ψ₀ 用远少的数据打赢它是有力的方法论证明。

Ablation Table I(论文核心表)

单个任务:"Pick toys into a box and lift it" —— 3 步子任务(右臂 pick-place / 左臂 pick-place / 双臂 lift)。10 次 rollout 报每步成功次数:

EgoDex PreHE PostRTCMM-DiTNaive DiTR-ArmL-ArmDual-ArmOverall
1/101/101/100/10
9/102/103/102/10
8/106/106/106/10
8/108/109/108/10
9/109/1010/109/10

Ablation 亮点:Naive DiT 完全失败(0/10),MM-DiT 也只有 2/10;加 EgoDex 预训到 6/10,再加 HE 后训到 8/10,再加 real-time chunking 到 9/10。这条曲线明确说:三件事都必要,最大的单步收益是 EgoDex 预训(+4)。

三个方法论 Insight

  1. 分阶段避免运动学冲突:人和 humanoid 运动学差异过大,共同 loss 反而互相干扰;分阶段先学视觉表征,再学关节控制,两者互不冲突
  2. MM-DiT 优于 Naive DiT:文中归因为 MM-DiT 的 dual-modulation + joint attention 更适合 VL-conditioned action prediction(Naive DiT 原本是给 text-to-image 用的)
  3. Test-time chunking 不稳定,改用 training-time chunking:作者试了 test-time 引导(Black 2025)但不稳定;改成训练时就注入 chunking condition。RTC 减少物理碰撞并提高吞吐无性能损失

与 EgoScale 的对照(数据哲学)

Ψ₀ 和 EgoScale(2602.16710)是同一时期两条相反哲学:

两者不冲突,前者可能是"高质量数据未饱和时"、后者是"noise 数据 crawl 到瓶颈时"—— 但方法论对比很值得对着看,特别是要选择数据配方的团队。

相关

GR00T N1(同赛道 · 被超越)
NVIDIA humanoid foundation · GR00T N1.6 是 Ψ₀ 的第二好 baseline
EgoScale(数据哲学对照)
走 scaling law 路线,与 Ψ₀ 相反
Flow Matching
Ψ₀ MM-DiT action expert 的底层技术
π₀.₅(被超越)
Ψ₀ 上的另一个 humanoid baseline

参考链接

arXiv 2603.12263
Ψ₀: Open Foundation Model for Universal Humanoid Loco-Manipulation · 2026-03-12