RxR VLN · 多语言 · 长指令 · 双路径
Room-across-Room · 126K 条 78 词长指令 · 英/印地/泰卢固三语 · Google EMNLP 2020
RxR(Ku et al. EMNLP 2020)由 Google Research 发起,是 R2R 的 规模 × 语言 × 稠密对齐 三维扩展:
- 规模:指令数量 21K → 126K(约
6×),指令长度 29 词 → 78 词 - 语言:英文 → 英/印地/泰卢固各 42K
- 对齐:每一步 pose trace 与指令文本时空对齐,可以做逐词-逐动作监督
- 双路径:guide(标注者规划) + follower(另一标注者按指令走出)
相比 R2R 的短指令,RxR 明显更接近真实人类下达指令的方式 —— 会指参照物、会解释、会有冗余。也更难。
Qwen-VLA 分数
指标含义:agent 主动
stop 后距目标 < 3m 的比例(严格版)· 比 R2R 的 OSR 更难
发展史 · 为什么在 R2R 之外还要 RxR
2020 年 Google Research(Alexander Ku 等)观察到 R2R 有三个显著限制:
- 规模不足:21K 指令 / 7189 轨迹 · 训 transformer 都不够 saturate
- 只有英语:全球 VLN 研究都建立在美式英语假设上,其他语言的语义结构(尤其非印欧语系)没有被考虑
- 指令太短:29 词一句话很难体现自然对话的丰富度 · 真实场景里"请帮我从楼上的书房拿一杯咖啡"是长指令
RxR 一次解决三个问题:×6 规模、加两门非印欧语系语言(印地/泰卢固)、指令平均 78 词。同时新增 pose trace 与 follower path —— 这两个是 RxR 独有的数据资产,让研究者可以做逐词监督和指令歧义分析。
规模
| 指标 | 值 |
|---|---|
| 总指令数 | 126K |
| 语言分布 | 英语 42K + 印地语 42K + 泰卢固语 42K |
| 平均指令长度 | 78 词 |
| Guide 路径 | 16.5K |
| Follower 路径 | 126K |
| 环境 | Matterport3D 室内场景(沿用 R2R) |
| Pose trace 采样频率 | 虚拟相机每 secs 记录 |
| 许可 | CC BY 4.0 |
多语言与文化多样性
选择英/印地/泰卢固三语的动机:
- 覆盖数十亿使用者:印地语 3.8 亿、泰卢固语 7 千万 · 组合覆盖印度次大陆
- 暴露隐藏偏差:不同语言在描述空间关系、物体命名上有不同倾向
- 跨语系家族:印欧(英)+ 印欧-印度雅利安(印地)+ 达罗毗荼(泰卢固)· 语系上有真正的差异
- 跨文化泛化测试:agent 是否只是学到了英语指令的表面模式
实验发现:单语训练模型 SR 28.5%(Val-Unseen),三语混合训练降到 22.8%。多语言反而伤性能——说明现有 VLN 架构里的语言编码没做好 cross-lingual sharing,是研究空间。
Guide vs Follower 双路径 · 独有设计
R2R 里每条轨迹是「标注者按最短路径走 → 描述路径」的单向数据。RxR 增加了反向验证:
- Guide:标注者 A 规划的理想路径 —— 参考答案(可能受工具、初值影响)
- Follower:标注者 B 拿到指令后实际走出的路径 —— 展现真实理解的分布
价值:
- 捕捉自然语言歧义 —— 同一指令在多门/多房间场景下有多个合理解释,follower 路径体现这一点
- 去除算法偏见 —— guide 可能过度依赖最短路径算法
- 实证:用 follower 路径训练相比只用 guide,
SR +2-5%,nDTW提升最显著
后续 VLN 领域几乎所有工作都在用 RxR 的 follower 路径做数据增广。
数据切分
评测指标
| 指标 | 定义 |
|---|---|
| SR | agent 停止且距目标 < 3m 的比例 |
| SPL | SR × (最短路径长 / 实际路径长),考虑效率 |
| nDTW | 归一化动态时间规整 · RxR 的招牌指标(因为它有 pose trace) |
| NE | 终点绝对误差(米) |
nDTW 在 RxR 上尤其重要:因为 follower 路径体现了自然的语义解释,agent 走出的路径能否形似而不是点到参考路径,是 RxR 独有的检验维度。
典型指令示例(英语原文)
Our starting point is in a living room, we're facing towards a long beige sofa, and in front of the sofa there are three glass coffee tables. Turn around and exit through the doorway that's in front of you, walk pass the bed that's on your right and then turn left. We're now facing towards another living room, and on the left there's an open door. Walk towards that open door, enter the bathroom that's in front of you, turn towards the right into the shower area, and that's your destination.
意译:起点在客厅,正对一条长米色沙发,前面有三张玻璃咖啡桌。转身从正前方的门走出去,绕过右手边的床后左转。面向另一个客厅,左边有扇开着的门,走过去、进入前面的浴室、右转进淋浴区就是目的地。
71 词 · 接近 78 词平均值 · 逐步跨房间 · 混合相对/绝对方位 · 多段行为。相比 R2R 的命令式短句,RxR 的指令更像描述式—— "我们"、"你面对"、"你右边"这种主观视角频繁出现。
主流模型分数(Val-Unseen)
| 模型 | SR | SPL | nDTW | 说明 |
|---|---|---|---|---|
| Instruction Only(原论文 baseline) | 4.5 | 4.2 | 28.5 | EMNLP 2020 |
| Cross-modal Attention (mono-EN) | 28.5 | 23.1 | 45.3 | 单语 |
| HAMT | 56.5 | 48.3 | 63.1 | 2021 迁移自 R2R |
| DUET | 60.4 | 53.7 | - | 2022 |
| Qwen-VLA-Instruct | 59.6 | — | — | 2026 · 通用 VLA |
常见误区 / 局限
- 多语言反而拉低单语:三语混训比单英语训低 5-6% SR · 说明 RxR 的多语言部分至今没被真正吃干净。
- 指令长 = 关键信息稀疏:78 词里可能只有 10 词是关键决策,其他是描述性冗余。模型如果处理不好长上下文会严重被稀释。
- Guide 与 follower 不完全对齐:follower 路径的停止位置可能与 guide 不同(歧义所致),SR 评测时需要选参考。
- 官方项目页可能已下线:google-research-datasets.github.io/RxR 404 · 数据要从 GitHub 仓库拉。
- 非英文 pose trace 数据质量:印地/泰卢固标注者数量少于英文,某些环境可能只有 2-3 条指令。