Genie Envisioner World+Act+Sim 一体化 · Agilex/Franka/RoboTwin 全打
AgiBot Genie Team · GE-Base(video diff)+ GE-Act(flow)+ GE-Sim + EWMBench · 一个平台四个组件
Genie Envisioner (GE)(arXiv 2508.05635)是 AgiBot 拿出的整套 VLA 栈 —— 四个组件同时发:世界基础模型 + 动作模型 + 神经模拟器 + 基准套件。目的不是发一个新架构,是把 policy learning / evaluation / simulation 三件事塞进同一个 video-diffusion 框架。
结果在 Agilex Cobot Magic 和 Dual Franka 两个跨形态平台上,用只 1 小时(250 条 demos)的适应数据就超过 π₀ / GR00T N1 / UniVLA 三大基线 —— 尤其是 cloth folding / box folding 这类可变形物体操纵。
四大组件
| 组件 | 技术 | 输入 | 输出 | 作用 |
|---|---|---|---|---|
| GE-Base | Instruction-conditioned video diffusion | 指令 + 当前帧 | latent 表征 | 世界基础模型 · 捕捉真实交互的时空+语义动态 |
| GE-Act | Flow-matching decoder | GE-Base latent | Action trajectory | 动作头 · 少监督即可跨形态 |
| GE-Sim | Action-conditioned 神经模拟器 | Action + 当前帧 | Rollout frames | 闭环 policy 开发的 high-fidelity rollout |
| EWMBench | Benchmark 套件 | Model outputs | 视觉/物理/对齐分数 | 标准化基准 |
Agilex Cobot Magic 跨形态适应(论文 Fig 11)
用 250 条 teleop demos(~1 小时数据)做 fine-tune,测 cloth folding 和 box folding:
| Model | Cloth Folding | Box Folding |
|---|---|---|
| GR00T N1 | 0% | 0% |
| UniVLA | 需 human intervention 才能几步 | 同 |
| π₀(可变形物体强项) | 显著低于 GE-Act | 同 |
| GE-Act | SOTA | SOTA |
注意:π₀ 在 deformable manipulation 是公认强项,GE-Act 仍然超它。作者归因于 GE-Base 的大规模视频预训练学到了 fine-grained 可变形动力学。
Dual Franka 跨形态适应(论文 Fig 13)
同样 250 demos(~1 小时),空间鼠标控制而非 teleop,cloth folding:
GE-Act 显著超所有 baseline,尽管 π₀ 和 GR00T N1 在 Franka 平台上做过大规模预训而 GE 只用 1 小时适应数据。这是"预训世界模型 > 预训 policy"的另一条证据。
RoboTwin 4-任务 all-in-one 联合训练
用 200 demos(50/task)在 4 个任务上联合训练一个模型,评估时直接跑全 4 个任务。对照方法是 1 task 1 model:
- GE-Act 联合训 3/4 任务超过 π₀ 和 GO-1(1-task-1-model)
- 只在"lift pot" 任务略输 —— 归因于联合训练引入的任务干扰
联合训一个模型能匹敌每个任务单独训一个模型—— 说明 GE-Base 的 latent 表征够通用,能支持 policy 复用。
Two-Stage 跨形态适应管线
- Stage 1 · 适应视觉生成端:只用少量新平台 instruction-conditioned 视频演示,fine-tune 视频 DiT 模块。CLIP 和视频 encoder 冻结。目的是让模型能合成新平台风格的操纵视频。
- Stage 2 · 从零训新 action DiT:因为 action space 语义在新平台不同,pretrained action decoder 不能复用。GE-Base 视觉 backbone 保留,只重训一个 action head。
这套 pipeline 用最少的新数据实现跨形态适应,工程性极强。
关键工程细节
- 数据源:AgiBot G1 in-domain 大规模预训(数量论文未明确列,但可以推断是万小时级别)
- 视频编码:CLIP 视觉 encoder + video encoder,都在 Stage 1 冻结以保护语义 priors
- 跨形态数据量:Agilex 250 demos ~1h · Franka 250 demos ~1h · RoboTwin 4 任务 200 demos —— 都是低数据量适应场景
- 发布:代码 / 模型 / benchmarks 全部承诺开源
差异化定位
Genie Envisioner 的特点是工程完整度:
- vs UniVLA:UniVLA 是 pure-AR 架构统一,GE 是"video diffusion + flow matching decoder + 神经模拟器"三合一 —— 工程完整
- vs Motus:Motus 强调 MoT 一个模型多模式,GE 是四个模型协作(一个平台)—— 部署更灵活
- vs π₀ / GR00T:这些都是纯 policy 模型,GE 自带 GE-Sim 支持闭环 rollout —— 对没物理仿真器的团队是稀缺资源
- EWMBench:GE 团队顺手做了一个 benchmark 套件,评视觉保真度、物理一致性、指令-动作对齐 —— 为社区建了标准
对做产品化 VLA 的团队,GE 的 GE-Sim 特别有价值 —— 一个学出来的神经模拟器闭环 rollout policy,跳过物理仿真器的实现负担。