← VLA Atlas

RxR VLN · 多语言 · 长指令 · 双路径

Room-across-Room · 126K 条 78 词长指令 · 英/印地/泰卢固三语 · Google EMNLP 2020

RxR(Ku et al. EMNLP 2020)由 Google Research 发起,是 R2R规模 × 语言 × 稠密对齐 三维扩展:

相比 R2R 的短指令,RxR 明显更接近真实人类下达指令的方式 —— 会指参照物、会解释、会有冗余。也更难。

Qwen-VLA 分数

59.6%
SR(Success Rate)· Val-Unseen split
指标含义:agent 主动 stop 后距目标 < 3m 的比例(严格版)· 比 R2R 的 OSR 更难

发展史 · 为什么在 R2R 之外还要 RxR

2020 年 Google Research(Alexander Ku 等)观察到 R2R 有三个显著限制:

  1. 规模不足:21K 指令 / 7189 轨迹 · 训 transformer 都不够 saturate
  2. 只有英语:全球 VLN 研究都建立在美式英语假设上,其他语言的语义结构(尤其非印欧语系)没有被考虑
  3. 指令太短:29 词一句话很难体现自然对话的丰富度 · 真实场景里"请帮我从楼上的书房拿一杯咖啡"是长指令

RxR 一次解决三个问题:×6 规模、加两门非印欧语系语言(印地/泰卢固)、指令平均 78 词。同时新增 pose tracefollower path —— 这两个是 RxR 独有的数据资产,让研究者可以做逐词监督指令歧义分析

规模

指标
总指令数126K
语言分布英语 42K + 印地语 42K + 泰卢固语 42K
平均指令长度78 词
Guide 路径16.5K
Follower 路径126K
环境Matterport3D 室内场景(沿用 R2R)
Pose trace 采样频率虚拟相机每 secs 记录
许可CC BY 4.0

多语言与文化多样性

选择英/印地/泰卢固三语的动机:

实验发现:单语训练模型 SR 28.5%(Val-Unseen),三语混合训练降到 22.8%。多语言反而伤性能——说明现有 VLN 架构里的语言编码没做好 cross-lingual sharing,是研究空间。

Guide vs Follower 双路径 · 独有设计

R2R 里每条轨迹是「标注者按最短路径走 → 描述路径」的单向数据。RxR 增加了反向验证:

价值:

  1. 捕捉自然语言歧义 —— 同一指令在多门/多房间场景下有多个合理解释,follower 路径体现这一点
  2. 去除算法偏见 —— guide 可能过度依赖最短路径算法
  3. 实证:用 follower 路径训练相比只用 guide,SR +2-5%nDTW 提升最显著

后续 VLN 领域几乎所有工作都在用 RxR 的 follower 路径做数据增广

数据切分

Train
61 环境 · 主训练数据
Val-Seen
已见环境的新指令 · 初步泛化
Val-Unseen
全新环境 · 主评测 split
Test-Standard
公开排行榜 · EvalAI 打分
Test-Challenge
加大难度子集 · 社区第二赛道

评测指标

指标定义
SRagent 停止且距目标 < 3m 的比例
SPLSR × (最短路径长 / 实际路径长),考虑效率
nDTW归一化动态时间规整 · RxR 的招牌指标(因为它有 pose trace)
NE终点绝对误差(米)

nDTW 在 RxR 上尤其重要:因为 follower 路径体现了自然的语义解释,agent 走出的路径能否形似而不是点到参考路径,是 RxR 独有的检验维度。

典型指令示例(英语原文)

Our starting point is in a living room, we're facing towards
a long beige sofa, and in front of the sofa there are three
glass coffee tables. Turn around and exit through the doorway
that's in front of you, walk pass the bed that's on your right
and then turn left. We're now facing towards another living
room, and on the left there's an open door. Walk towards that
open door, enter the bathroom that's in front of you, turn
towards the right into the shower area, and that's your
destination.

意译:起点在客厅,正对一条长米色沙发,前面有三张玻璃咖啡桌。转身从正前方的门走出去,绕过右手边的床后左转。面向另一个客厅,左边有扇开着的门,走过去、进入前面的浴室、右转进淋浴区就是目的地。

71 词 · 接近 78 词平均值 · 逐步跨房间 · 混合相对/绝对方位 · 多段行为。相比 R2R 的命令式短句,RxR 的指令更像描述式—— "我们"、"你面对"、"你右边"这种主观视角频繁出现。

主流模型分数(Val-Unseen)

模型SRSPLnDTW说明
Instruction Only(原论文 baseline)4.54.228.5EMNLP 2020
Cross-modal Attention (mono-EN)28.523.145.3单语
HAMT56.548.363.12021 迁移自 R2R
DUET60.453.7-2022
Qwen-VLA-Instruct59.62026 · 通用 VLA

常见误区 / 局限

相关工作

R2R(前身)
Room-to-Room 英文单语版 · 2018
CVDN
Cooperative VLN Dialog · 多轮对话导航
RxR-Habitat
RxR 的连续动作版 · Habitat 仿真
Qwen-VLA
通用 VLA 兼职做导航

参考链接

项目主页
google-research-datasets.github.io/RxR(可能已下线)
arXiv 2010.07954
Room-Across-Room · Ku et al. EMNLP 2020
GitHub · RxR
google-research-datasets/RxR
Matterport3D
底层环境资源