VLA Atlas · 视觉-语言-动作模型图谱
Qwen-VLA 一体化具身模型 + 7 个跨形态基准的解读合集
VLA(Vision-Language-Action)是把「看」「说」「动」三种能力压进同一个大模型的思路:给它一张图 + 一句自然语言指令,它直接输出一段机器人动作序列。2026 年 5 月 Qwen Team 发布的 Qwen-VLA 用 Qwen3.5-4B 多模态主干 + 1.15B DiT flow-matching action expert,把 操纵、导航、轨迹预测 三类任务统一到同一套动作生成框架里,并在下面 8 项主流基准上给出一份跨形态、跨环境的成绩单。
本页把这份基准清单结构化:每个数据集独立子页讲清它在测什么、数据长什么样、Qwen-VLA 跑到了多少分,以及和 π₀ / Wall-X / OpenVLA 等同类工作的可比性。
模型 · Model
目前完整讲解的是 Qwen-VLA 与 Wall-X / WALL-OSS,其余是待补的对照参考项(先外链到官方)。
模型 · 2025-2026 最新
2025 下半年到 2026 年上半年集中出的一批 VLA 新工作,覆盖 LIBERO SOTA、跨形态 zero-shot、世界模型 + VLA 统一、人形 loco-manipulation、端侧高效、DPO 后训练、分层 + 记忆 / 推理 等新方向。数字均以 arXiv 摘要口径为准,未披露项在子页里标注。
下面几个也在追踪,但暂不建独立页(信息量或差异化不足以支撑一页),先外链官方:
思路对照 · Concepts
从「怎么把动作接到 VLM 上」的角度,主流路线可以拆成 4 类,每一类各自的取舍不同。
实测 · 微调实录
不是讲论文,是真把模型跑起来的记录 —— 单卡能不能训、坑在哪、失败长什么样。
数据集 · 操纵
数据集 · 导航
数据集 · 动态操纵
叉车挑战赛 · 相关文献
2026 树根杯·具身智能平衡重叉车挑战赛专项调研。目标:感知 → 决策 → 控制 → 作业 一体化,完成 移动 / 叉取 / 搬运 / 放置。这里汇总目前公开的叉车 / 类叉车重型机械 RL 相关论文,供比赛期间快速对标。全球公开的完整"叉车 pick-place RL 预训练权重"目前不存在,但方法层面已被 HMER 等工作揭示。
📌 叉车专项 · Direct Forklift RL
🌲 类似长 horizon 任务参考 · Analogous RL Tasks
🔧 本地资源 · Local Cloned
社区合集 · Curated Lists
本站 18 页只覆盖了 VLA 领域一部分。想第一时间看到新论文/新开源,直接 star 下面这几个 GitHub awesome-list(多数每周有新条目)—— 我们的讲解页会有滞后。
订阅建议:GitHub Watch → Releases only,或用 RSS 订阅 commits,新条目会自动提醒。star 数和最近提交时间以 GitHub 页面为准。