← VLA Atlas

Kairos 3.0-4B RoboTwin 2.0 96.1% · LIBERO-Plus 90.8% · 4B 打过 28B

商汤 · 大晓机器人(ACE ROBOTICS) · Native World Model Stack for Physical AI · 4B 参数四大 benchmark 第一 · 完全开源

Kairos 3.0-4BarXiv 2606.16533)是商汤旗下大晓机器人(ACE ROBOTICS)的原生世界模型栈。模型于 2025-12-18 首次开源(Kairos 3.0-4B 权重 + 数据集 + 技术文档),技术报告于 2026-06-15 arXiv 挂出并配套官方 press release 宣布"四大全球具身智能基准第一"。团队由王晓刚(商汤联合创始人)任董事长、陶大程(澳大利亚科学院院士)任首席科学家。主打用统一模型同时做世界理解 / 生成 / 预测,并把这一套推到 4B 参数级别 就跑赢 28B / 16B 的对手。项目页 kairos-homeworld.github.io,完全开源(权重 + 数据集 + 技术文档)。

三大设计要点:

  1. Native Pre-training Paradigm + Cross-Embodiment Data Curriculum:把开放世界视频、人类行为、机器人交互按 developmental curriculum 组织,逐步渐进
  2. Native Unified Architecture + Hybrid Linear Temporal Attention:sliding-window 抓局部动力学 + dilated sliding 抓中程依赖 + gated linear 维持全局持久记忆 —— 有 formal theoretical bounds 证明误差不会随时间累积
  3. Deployment-Aware System Co-Design:server 和消费级硬件都能低延迟 rollout · Kairos-4B 是首个端侧直接机器人控制的世界模型

四大 Embodied Benchmark 全线 SOTA

BenchmarkKairos-4B当代最强对手Δ
RoboTwin 2.0 (WAM)96.1MotuBrain 96.0+0.1
LIBERO-Plus (7 扰动)89.0ACoT-VLA 88.0+1.0
LIBERO-Plus (Kairos-joint 变体)90.8ACoT-VLA 88.0+2.8
WorldModelBench Robot9.30Cosmos3-Nano 16B 9.26+0.04
DreamGen Bench Avg Score0.618Wan2.2 14B 0.611+0.007
VideoPhy45.55Cosmos-Predict2.5-14B 45.16+0.39
PAI-Bench Robot Overall (small 组)82.57GigaWorld-0 2B 80.87+1.70

Kairos-4B 用少数几分之一的参数量打赢所有对手:WorldModelBench 9.30 (4B) 打 Cosmos3-Nano 9.26 (16B)、Lingbot 9.04 (28B);PAI-Bench 4B 打 Cosmos-Predict2.5-14B 79.40。

RoboTwin 2.0 全场对比(论文 Table 11)

超 50 个 bimanual 任务 · Clean + Randomized 双设定。Kairos 在 Clean 96.9 / Randomized 95.2 / Average 96.1 全领先。VLA + WAM 两类共 17 个 baseline:

Model类型CleanRand.Average
π₀VLA65.958.462.2
X-VLAVLA72.972.872.9
π₀.₅VLA82.776.879.8
ABot-M0VLA81.280.480.8
LingBot-VLAVLA86.585.385.9
starVLAVLA88.288.388.3
G0.5VLA93.792.893.2
MotusWAM88.787.087.8
Fast-WAMWAM91.991.891.8
Being-H0.7WAM90.289.689.8
AIMWAM94.092.193.1
SANTSWAM94.694.294.4
MotuBrainWAM95.896.196.0
KairosWAM96.995.296.1

注意:MolmoAct2 和 GR00T N1.7 没有在 RoboTwin 2.0 上报告成绩,所以此表不含它们。

LIBERO-Plus(更难的 LIBERO 扰动版)

MethodCameraRobotLanguageLightBGNoiseLayoutAvg
π₀61.040.863.589.384.180.176.469.4
π₀.₅75.879.483.395.595.089.687.085.7
GR00T N1.692.633.580.193.695.493.675.079.4
ACoT-VLA96.670.479.795.197.195.985.088.0
Kairos95.572.686.897.795.896.881.589.0
Kairos-joint95.974.695.397.197.195.483.890.8

Kairos-joint 是 inference 阶段让"未来 video tokens 和 action tokens 联合去噪"的变体 —— 让 action prediction 显式关注 video generation → 从 89.0 → 90.8 (+1.8)。

核心架构:Hybrid Linear Temporal Attention

Kairos 最有理论深度的贡献:三种 attention 并行处理不同时间尺度

论文提供 formal theoretical bounds,证明这种时间分解严格限制误差累积—— 状态传播在长时间下有数学保证。这是"世界模型"路线里少见的可证明的稳定性论述。

Kairos-4B 端侧特性

Kairos-4B 是首个能端侧直接机器人控制的世界模型

关键 Ablation(论文 Table 13-14)

1) Human-Centric 数据规模的影响(LIBERO-Plus)

ModelAvgGain
w/o human-centric data83.0
w/ human-centric data89.0+6.0

2) 联合 Generation + Prediction 训练

ModelAvgGain
Action Prediction Only65.8
Video Generation + Action Prediction89.0+23.2

只训 ActionDiT 相比联合训 video + action,性能掉 23.2—— 视频生成任务是学习 world model 的关键监督信号,不能删。

Human Evaluation(论文 Fig 19)

10 位志愿者对 5 个模型(匿名)做 head-to-head 主观评估,Kairos-4B 的胜率:

差异化定位

Kairos 是"World Model + Action 一体化"路线当前最强开源代表:

如果做 world-model-based VLA,Kairos 是当代必读工作 —— 尤其它的理论保证让训练动态可预测。

相关

Motus(同为 WAM 路线)
RoboTwin 2.0 87.8 vs Kairos 96.1
Genie Envisioner
另一条 World Model + Act 一体化路线
π₀.₅(被超越对象)
RoboTwin 2.0 79.8 / LIBERO-Plus 85.7
Flow Matching
Kairos ActionDiT 用到 flow matching

开源资源

arXiv 2606.16533
Kairos: A Native World Model Stack for Physical AI · 2026-06-15
GitHub · kairos-agi/kairos-sensenova
Kairos 3.0 官方代码 · Apache 2.0 License
HuggingFace · kairos-agi
模型权重 · 4B-480P / 4B-720P / 4B-Robot / Distilled 变体
ModelScope · kairos-team/kairos30
Kairos 3.0 collection · 国内镜像
项目页 · kairos-homeworld.github.io
技术文档 · 数据集