EgoScale 20,854 h · Log-Linear Scaling Law · R² = 0.9983
从大规模 egocentric 人类视频学 dexterous 操纵先验 · 用 scaling law 让"要不要再采数据"可预测
EgoScale(arXiv 2602.16710)拿 20,854 小时带动作标注的 egocentric 人类视频训 VLA,是当前公开的最大规模(比前人工作大 20×)。除了规模本身,它的方法论贡献更重要 —— 证明数据规模 vs 验证损失呈 log-linear 关系(R² = 0.9983),且这条线严格预测下游真机成功率。
换言之:"要不要再花钱采数据"这个问题第一次有了公式化答案。工程上把不确定性大幅降低。
五个 Dexterous 评估任务(论文 §3.1)
- Shirt Rolling:双手协作卷 T 恤 → 放入 basket(可变形物体,20 演示)
- Card Sorting:手指搓开一叠牌 → 按颜色插入正确 holder(精细指尖控制,100 演示)
- Tongs for Fruit Transfer:从工具箱抓夹子 → 夹起水果 → 放到指定位置(工具使用)
- Unscrewing a Bottle Cap:抓瓶盖 → 连续旋转(4 种不同大小,25 演示/瓶)
- Syringe Liquid Transfer:拿注射器 → 从 A 管抽液 → 注入 B 管 → 扔到垃圾桶(长时多步 + 流体控制)
Syringe 是最难的 —— 长时、多步推理、精确空间对齐、灵巧地推活塞。这五个任务代表"极限灵巧操纵"的天花板。
核心结果:人视频预训练贡献巨大(论文 Fig 4)
四个训练配方对比(average task completion + absolute success rate):
- Scratch:不用任何人视频 → 表现差
- 只用 mid-training(对齐的 human-robot play 数据) → 中等
- 只用大规模人视频预训练 → 大部分任务超过 mid-train-only baseline
- Pretrain + Midtrain(default) → 最好 · 相对 scratch 平均 task completion 提高 55%+
反直觉的观察:纯"噪声"的大规模人视频 pretrain(虽然不 task-aligned)比精心对齐的 mid-training-only 更强。这说明规模和多样性提供的 inductive bias 比 embodiment alignment 更重要。
Scaling Law(论文 Fig 5)
用不同数据规模(1k / 2k / 4k / 10k / 20k 小时)预训 —— 观察三件事:
- 下游真机 avg task completion:0.30 (1k hours) → 0.71 (20k hours) · 单调上升 · 探测范围内无饱和
- Validation loss vs data scale:log-linear · R² = 0.9983 · 拟合式:
L = 0.024 − 0.003 · ln(D) D = human video data (hours) R² = 0.9983
3. 更关键:validation loss 强预测真机 success rate。换句话说,你可以用 offline 上的 val loss 预测线下要不要再采数据、能带来多大收益。这在 embodied AI 里是稀缺的量化能力。
One-Shot 适应(论文 Fig 6)
把训好的 Pretrain + Midtrain 模型放到全新任务上,只给1 条机器人演示 + 100 条对齐人演示,看能否学会:
| Method | Fold Shirt | Unscrew Water Bottle |
|---|---|---|
| 只 Pretrain | 0 | 0 |
| 只 Midtrain | 0 | 0 |
| Pretrain + Midtrain | 0.88 | 0.55 |
One-shot 泛化只在两步都完成时出现 —— 大规模人视频学"广运动结构",mid-training 把结构锚定到具体机器人。缺一不可。
跨形态泛化(论文 Fig 7)
把训好的模型迁到完全不同的机器人本体 Unitree G1(更短的手臂、更小可达空间、7-DoF tri-finger 而非 22-DoF 五指手):
- 直接用 G1 数据从头训 → 差
- Pretrain + 直接部署 → 差(没有形态对齐)
- Pretrain + midtrain (含少量 G1 play data) → Pen in Bin 和 Dish in Rack 都大幅提升
这证明:EgoScale 学到的是可复用的 motor prior—— hand opening / closure / coordinated finger articulation 这些原语在不同形态间可迁移。
动作表示的影响(论文 Fig 8)
三种人类手部动作表示的对比:
- Wrist-only(去掉所有指级监督):差 —— 特别是 Tongs / Cards 这种需要精确抓握
- Fingertip-based(EgoVLA 用的路线,预测手腕 + 指尖 SE(3),再 MLP 映到 joint):中等 —— 指尖 pose 小误差会被 MLP 放大成不合理关节配置
- 22-DoF joint-space(EgoScale default):最好,各任务一致强
结论:直接在 joint space 监督是当前最稳的路子。这个 finding 对做 dexterous hand VLA 有直接指导意义。
Ψ₀ vs EgoScale:两条相反的数据哲学
EgoScale 和 Ψ₀ Psi-Zero 是同期发表的两条相反配方:
| 项 | EgoScale | Ψ₀ |
|---|---|---|
| 数据量 | 20,854 小时人视频 | 800 小时人视频 + 30 小时机器人 |
| 主张 | Scaling 有效,数据越多越好 | 数据质量 > 数量 |
| 方法论 | Log-linear scaling law | 阶段解耦 · 高质量精挑 |
| 本体 | 22-DoF Sharpa 手 → 迁 G1 tri-finger | Unitree G1 whole-body |
| 结论强度 | +55% over scratch,20k hours 未饱和 | 800h+30h 打过 10× baseline 40% |
两者不冲突 —— 前者证明"高质量数据未饱和时 scaling 有效",后者证明"noisy crawl 到瓶颈时质量胜出"。适用场景不同,一起看更完整。