← VLA Atlas

GR00T N1 NVIDIA · 2025-03

开源人形机器人基础模型 · 双系统视觉-语言-动作架构

GR00T N1 是 NVIDIA 于 2025-03-27 发布的开源具身基础模型(arXiv 2503.14734),主打人形机器人的端到端多任务学习。核心创新是双系统架构:System 2(缓慢思考)由 Eagle-2 VLM 负责视觉理解与推理,System 1(快速反应)由 Diffusion Transformer 实时生成流畅的电机动作。与同类 Qwen-VLA / Wall-X 等强调操纵+导航+轨迹一体化不同,GR00T N1 专注人形本体的双足平衡与全身协调控制

基线成绩(仿真):DexMG 9 任务 · RoboCasa 24 任务 · Digital Cousin GR-1 24 任务 · VLABench 39.7(LeRobot 视频排行榜)。真机部署于 Fourier GR-1 人形机器人,验证了双臂双足协作的数据高效学习能力。

产品线与版本

截至 2025-03-27,NVIDIA 官方发布的人形机器人 VLA 产品线:

版本发布日期参数量状态
GR00T N12025-03-272B开源 · 已发布
GR00T N1.5无确凿信息
GR00T N2无确凿信息

本页重点讲 N1。N1.5 / N2 若已发布将另开页面。

架构 · 双系统设计

双系统架构 · Kahneman System 1/2 类比 RGB 相机输入 语言指令 System 2 · VLM Eagle-2 Vision-Language 缓慢思考 推理 · 理解 · 任务规划 hidden state 传递下游 hidden 本体感觉 System 1 · DiT Diffusion Transformer 快速反应 Flow Matching · 去噪 实时动作生成 动作输出(关节速度) 关键耦合点 Joint Self-Attention System 2 的 hidden state 与 System 1 的动作向量在 Diffusion Transformer 内做 cross-attention 与 self-attention 交互。 两个系统端到端联合训练,不是串联推理,而是紧耦合的前向通路。 图例 输入 System 2 System 1 耦合

论文灵感来自 Kahneman 心理学的 System 1(直觉、快速)与 System 2(理性、缓慢)模型。System 2 在每个环节思考"要做什么",System 1 在控制频率下"怎样流畅地做"。

核心模块详解

System 2: Eagle-2 Vision-Language Model

NVIDIA 自研 VLM,专门为机器人感知优化。处理 RGB 图像序列(多视角或单摄像头时序)与文本指令,输出包含视觉理解的隐状态向量。这些向量编码了"环境中有什么"、"任务是什么"的语义信息,作为 System 1 的条件信号。

System 1: Diffusion Transformer (DiT) Action Head

基于 Flow Matching 的动作去噪器,输入包含:

输出是「未来 T 步的关节速度指令」。推理时用 Euler 积分逐步去噪,实现实时流畅的运动生成。

本体感觉编码 (Proprioception Encoder)

多层感知机 (MLP),针对不同机器人本体的不同状态维度。例如 Fourier GR-1 是人形双臂双足,状态维度远高于单臂机械臂。通过 embodiment ID 索引不同的 MLP 矩阵,在同一套权重上支持多个机器人本体。

数据混合与训练

GR00T N1 训练数据来自三个来源的混合(具体占比未在论文/模型卡披露):

数据源特征用途
真机轨迹多个机器人平台(Fourier GR-1 等)· RGB + proprioception现实世界 grounding
人类第一视角视频人做演示任务的自然视频 + 语言标注跨越模态差异 · 学习多样化动作
合成数据(Isaac Sim)仿真环境中的虚拟轨迹 · 大规模廉价生成覆盖稀有场景、长尾分布

这个混合策略与 Qwen-VLA 相似,但 GR00T N1 特别强调了 Isaac Sim 合成数据 作为主要扩展手段,这是 NVIDIA 生态优势(官方物理仿真工具链)。

仿真基准

GR00T N1 在三个关键任务集上评测(都是仿真):

基准任务数评测体系特点
DexMG9细致灵巧操纵关节精度高 · 对手指控制敏感
RoboCasa24移动操纵 (mobile manipulation)导航+操纵联合 · 室内场景
Digital Cousin GR-124人形双臂双足同架构虚拟验证 · 平衡+协调

真机部署与评估

机器人本体:Fourier GR-1 人形机器人

双足双臂人形机器人,154 个关节(头、躯干、双臂、双腿都有独立控制)。GR00T N1 在这个平台上完成了以下任务的真机评测:

评估方法:人工观察 (human assessment) 与自动成功率检测的混合。具体数值未详细披露。

VLABench 排行榜

NVIDIA 官方维护的 VLABench 排行榜采用 LeRobot 数据集的视频预测任务评测 VLA 模型。GR00T N1 的排名成绩是 39.7(具体指标定义见排行榜页面)。

与 Qwen-VLA、π₀ 等主流基础模型在同一排行榜对标。

和其他 VLA 的对比

维度GR00T N1Qwen-VLAWall-Xπ₀
参数量2B~4B未披露~7B
主攻本体人形双臂双足多本体(单臂/导航/轨迹)双臂操纵多本体
VLM 主干Eagle-2Qwen3.5-4BSigLip + LLaVACLIPv2 + LLaVA
动作模块DiT (Flow Matching)DiT (Flow Matching)CNN 回归 + 扩散Flow Matching
数据合成策略Isaac Sim 为主多源混合广采真机多源 + domain-specific 合成
发布时间2025-03-272026-05-282024-102024-10

核心差异点

局限与未来方向

获取与部署

模型权重与代码

训练数据

硬件需求

模型支持多种 NVIDIA 加速器:Ampere (A100) / Blackwell (B100) / Hopper (H100) / Lovelace (L40) / Jetson 嵌入式 GPU。推理框架:PyTorch。

发展路线

根据官方博客与 GitHub roadmap,GR00T 系列的后续计划(截至 2025-03):

N1.5 / N2 的时间表与功能细节尚未官方公布。

关键论文与参考

arXiv 2503.14734 PDF
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots · NVIDIA Team · 2025-03-27
GitHub · NVIDIA/Isaac-GR00T code
推理、适配器、微调脚本、Isaac Sim 数据生成工具
HuggingFace · nvidia/GR00T-N1-2B model
权重、模型卡、推理示例
NVIDIA Isaac GR00T 项目页
官方文档、部署指南、行业应用案例
arXiv 2501.14818 related
Eagle 2: Building Post-Training Data Strategies · NVIDIA · 2025 · GR00T 的 VLM 主干论文