R2R VLN · Matterport3D · 英语
Room-to-Room · 首个真实室内环境的视觉-语言导航基准(CVPR 2018)
R2R(Anderson et al. CVPR 2018)第一次把「跟着自然语言在真实室内建筑里走路」变成一个可评测的任务。基于 Matterport3D 90 个真实建筑扫描,把每个环境的可行 viewpoint 组织成图,智能体只能在图上走或用 stop 动作停下。
R2R 之后的 VLN 系列(Touchdown / REVERIE / RxR / VLN-CE …)都继承这套「离散图 + 全景观测 + 自然语言指令」的框架。R2R 是 VLN 领域最重要的基线,几乎所有导航 VLA 的必测项。距今已 8 年,但至今没有任何模型在 R2R Val-Unseen 上"打饱和"——即使强如 Qwen-VLA 的 69% OSR,离人类 86%+ 仍有明显差距。
Qwen-VLA 分数
OSR 允许 agent 在轨迹上任何时刻算到达(更宽松),SR 只算最终
stop 位置。SR 通常比 OSR 低 5-15 个点。
发展史 · 从简单 VQA 到室内导航
2017 年 Peter Anderson 团队(澳国立 & Adelaide)的动机:
- 当时 VQA 已经卷到接近饱和(VQA v2 top 模型 > 70%),但都是"看一张图回答一句",缺动作维度
- 已有的导航任务(如 gym 里的 Reacher)都是低维网格世界,缺视觉复杂度
- Matterport3D 数据集刚发布,给了
90栋建筑的稠密扫描 · 现成的真实室内场景
Anderson 把这三个元素拼起来 —— 让人类标注者对 Matterport3D 里的一条路径写一句自然语言指令,就得到了 R2R。这一手直接开启了 VLN(Vision-and-Language Navigation)子领域。
2020 年之后 R2R 又被 R2R-CE(continuous env、不是图)与 R2R-Habitat(用 Habitat 仿真器加速)扩展,Qwen-VLA 报告的是原始离散图版。
规模
| 指标 | 值 |
|---|---|
| 导航指令总数 | 21,567 |
| 轨迹数 | 7,189 |
| 真实建筑环境 | 90(Matterport3D) |
| 全景 viewpoint | 10,800(RGB-D 稠密采样) |
| 平均指令长度 | 29 词 |
| 标注者 | Amazon Mechanical Turk · 3 条 / 轨迹 |
任务定义
智能体从起点 viewpoint 出发,按自然语言指令走到目标 viewpoint。每一步动作只能:
- 移动到当前 viewpoint 图上相邻的一个 viewpoint;
- 或输出
stop动作声明到达。
观测:每步给 36 × 224 × 224 RGB 全景(36 个 30° 视角切片),或者按视线方向切出 pano tile。
不允许穿墙、不允许跨图跳跃。当 stop 位置距离目标 < 3m(原版协议)判定 SR = 1。
数据切分
评测指标
| 缩写 | 全称 | 含义 | 范围 |
|---|---|---|---|
| SR | Success Rate | agent 主动 stop 且距目标 < 3m 的比例 | [0,1] |
| OSR | Oracle Success Rate | 轨迹上任一时刻曾经 < 3m 的比例(宽松版) | [0,1] |
| SPL | Success weighted by Path Length | SR × (最短路径 / 实际路径),兼顾效率 | [0,1] |
| nDTW | normalized Dynamic Time Warping | agent 轨迹与参考轨迹的形状相似度 | [0,1] |
| NE | Navigation Error | agent 停止位置到目标的欧氏距离 | [0m, ∞) |
主流报告顺序:SR / SPL / nDTW(严格)→ OSR(宽松参考)→ NE(回归诊断)。当模型只报 OSR 不报 SR 时要注意:这可能在掩盖模型"走对了但没停下"的问题。
典型指令示例
Head upstairs and walk past the piano through an archway directly in front. Turn right when the hallway ends at pictures and table. Wait by the moose antlers hanging on the wall.
意译:上楼,从正前方的拱门经过钢琴。走廊在装饰画和桌子处右转,在挂着驼鹿鹿角的墙旁停下。
Go to the living room and find the chair that has a view of the television.
意译:前往客厅,找到能看到电视的那把椅子。
R2R 指令风格:命令式 · 平均 29 词 · 混合方向(left/right)+ 参照物(piano/moose antlers)+ 停止信号(stop / wait)。相比 RxR 的 78 词长指令,R2R 的短指令对关键词提取要求更高。
主流模型分数(Val-Unseen)
| 模型 | SR | OSR | SPL | 说明 |
|---|---|---|---|---|
| Seq2Seq(原论文 baseline) | 21.8 | 28.4 | 18.0 | CVPR 2018 |
| PREVALENT | 57 | 65 | 53 | 2020 · 预训练 VLN backbone |
| HAMT | 65.7 | 73.2 | 61.5 | 2021 · 历史建模 transformer |
| DUET | 72.7 | 81.4 | 60.4 | 2022 · 双分支结构 |
| Qwen-VLA-Instruct | — | 69.0 | — | 2026 · 通用 VLA 兼做导航 |
| 人类上限 | 86.4 | 89.5 | 76.1 | 原论文标注者相互评 |
Qwen-VLA 用 OSR 69% 打过 PREVALENT 但没到 DUET/HAMT 的水平——这是通用 VLA 兼职导航的典型表现:不专精但可控。VLN 专项模型仍有明显优势。
常见误区 / 局限
- 离散图不是真实导航:R2R 里 agent 只能在预定义的 viewpoint 之间跳,不能选择任意位置停下。真实机器人不是这样。R2R-CE(Continuous Env)用 Habitat 仿真器给出连续动作版本。
- 90 环境不够多:Val-Unseen 只有 11 栋建筑,模型在其中一个上出问题就能把 SR 拉低 5%。分数波动大。
- MTurk 指令质量参差:3 条指令 / 轨迹里有的很详细有的很粗糙,训练时可能引入噪声。
- Matterport3D 商用受限:数据集需要签 EULA 才能下载。个人研究通常没问题,商业化项目要注意授权。
- OSR 是宽松指标:只算路过而不管停不停对。看重最终决策的话请优先看 SR / SPL。
和 RxR 的关系 · 和其他 VLN 的关系
RxR 是 R2R 的多语言 & 长指令扩展:把 21K 条 29 词的英文指令扩到 126K 条 78 词的英/印地/泰卢固三语指令,并额外记录了标注者按指令实际走出的 follower path。基础任务框架和评测指标继承 R2R。
- Touchdown(Chen 2019)· 户外街景版 · Google Street View
- REVERIE(Qi 2020)· R2R + 目标物体定位 · 需要找到并交互
- R2R-CE(Krantz 2020)· 连续动作版 · Habitat 仿真器
- ScanQA / NR3D · 静态 3D scene 里的 VQA