EvoVLA Self-Evolving · Discoverse-L 69.2 · Stage Hallucination -23.7pp
北大 Hao Tang 组 · ECCV 2026 · 首个诊断并系统化解决 VLA "stage hallucination" 的 self-evolving 框架 · 开源
EvoVLA(arXiv 2511.16166, ECCV 2026)来自北大 Hao Tang 组,直击当前 VLA 长时任务的一个隐蔽缺陷:Stage Hallucination—— 模型学会利用粗粒度评估信号抄近路,报告高进度但实际上没完成多阶段任务。
EvoVLA 提出self-supervised 三件套直接对抗这个问题:
- Stage-Aligned Reward (SAR):用 triplet contrastive learning + Gemini 生成的 hard negatives,阻止视觉短路
- Pose-Based Object Exploration (POE):把好奇心 grounding 在相对 gripper-object pose上,而非 raw pixels
- Long-Horizon Memory:selective context retention + gated fusion,稳定长时 rollout 的内在 shaping
项目页 aigeeksgroup.github.io/EvoVLA,代码 GitHub。
关键数字(论文摘要口径)
| 指标 | EvoVLA | OpenVLA-OFT | Δ |
|---|---|---|---|
| Discoverse-L 平均成功率 | 69.2% | 59.0% | +10.2 pp |
| Stage Hallucination(越低越好) | 14.8% | 38.5% | -23.7 pp |
| Sample Efficiency | 1.5× | 1.0× | +50% |
| 真机 4 任务平均 | 54.6% | 43.6% | +11 pp |
Stage Hallucination 从 38.5% → 14.8%(降到 baseline 的 38%)是最有说服力的指标 —— 这意味着 EvoVLA 学到了真的完成多阶段任务,而不是"看起来完成"。
什么是 Stage Hallucination
长时任务通常有多个 stage(比如"打开抽屉 → 拿物体 → 关抽屉")。传统 VLA 训练用粗粒度 evaluation signal(最终成功 / 失败)+ RL/BC 的 dense reward,这会诱导:
- 模型学会假装完成早期 stage —— 比如把抽屉朝正确方向推一下(不真的打开),reward 就会给部分分
- Rollout 报告的 "task progress" 高,但实际能力没到位
- Sim-to-real 迁移时崩塌:仿真里"看起来完成",真机上根本没做
作者的观察:OpenVLA-OFT 的 stage hallucination 达 38.5%—— 相当于每 3 次 rollout 就有 1 次是"假完成"。这是长时 VLA 一个被系统性忽视的缺陷。
三个组件详解
1) Stage-Aligned Reward (SAR) —— 用 Gemini 生成 hard negatives
- Triplet contrastive learning:anchor(当前 stage 正确状态)+ positive(下一个 stage 目标)+ hard negative
- Hard negative 由 Gemini 生成:看起来像正确 stage 但实际不同的图像
- 迫使模型学会精确区分 stage 边界,不能靠"视觉相似"混过
2) Pose-Based Object Exploration (POE) —— 好奇心接地气
- 传统 curiosity-driven exploration 用 raw pixel prediction error 做 reward → 大量 attention 花在无关的视觉变化上
- POE 只在相对 gripper-object pose的变化上计好奇 —— 探索直接绑定"和目标物体的相对位置"
- 训练效率大幅提高(1.5× sample efficiency 的主要来源)
3) Long-Horizon Memory —— Context Selection + Gated Fusion
- 只保留 critical history tokens(避免 catastrophic forgetting,也避免噪声)
- Gated fusion 让内在 shaping 在长 rollout 中不衰减
差异化定位
EvoVLA 是"Self-Evolving VLA"路线在 2025-2026 最有说服力的开源代表:
- vs 传统 imitation VLA(π₀ / OpenVLA / OpenVLA-OFT):他们不解决 stage hallucination;EvoVLA 首先诊断并系统解决
- vs 纯 RL VLA:EvoVLA 是 self-supervised,不用大规模 online RL;工程量小,reproducible
- vs Curiosity-driven RL:POE 把 curiosity 从 raw pixel 绑到 pose,规避了"探索无关变化"的浪费
- vs Memory-based VLA(MemER):MemER 是显式 keyframe 检索,EvoVLA 是 self-supervised gated fusion —— 不需要额外的 keyframe policy
Stage hallucination 是一个已经存在但没被认真讨论的问题 —— 你 fine-tune 一个 VLA 到看起来 90% 成功率,但 sim2real 到 40%,可能就是 stage hallucination 在作祟。EvoVLA 是这方面的第一个正面攻击。
Discoverse-L Benchmark(作者提出)
EvoVLA 顺带贡献了 Discoverse-L benchmark:3 个 multi-stage 长时操纵任务,专门测量 stage hallucination 率。让"看起来成功但没真做"的模型无处遁形。
这是社区目前唯一直接测量 stage hallucination 的 benchmark —— 如果做 self-evolving 或 long-horizon VLA,会经常被 cite。
Sim-to-Real 迁移
作者在真机上跑了 4 个操纵任务:
- EvoVLA 平均 54.6% · OpenVLA-OFT 43.6% · Δ = +11 pp
- 验证 self-evolving 训练对 sim-to-real gap 有明显帮助 —— 因为模型学到的是真的完成任务,而不是投机取巧