【AAAI 2026】ReconVLA:以重建式视觉监督实现精准机器人操纵|从机器人视觉表征对齐视角
摘要
本文解读 AAAI 2026 论文《ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver》。该论文提出ReconVLA,一个以重建式视觉监督实现隐式 grounding 的视觉-语言-动作(VLA)模型,通过融合注视区域(gaze region)重建、扩散 Transformer与大规模视觉预训练,让机器人像人眼一样聚焦目标区域,解决传统 VLA 视觉注意力分散导致的操纵失准问题。实验表明CALVIN ABC→D 第 5 子任务成功率 64.1%、平均完成长度 3.95/5,ABCD→D 平均 4.23/5,并在真机未见目标上保持可用(基线近乎 0%),为具身智能的视觉表征对齐提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- ReconVLA 与显式 grounding 方法(RoboGround、VIP)有何区别?
- 为什么要重建"注视区域"而不是整幅图像?
- 思维链 grounding(输出 bbox)为什么效果差?
- 预训练数据是怎么得到的?需要动作标注吗?
- ReconVLA 在真实机器人上的表现如何?
- ReconVLA 的损失函数包含哪几项?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver |
| 标题(中文) | ReconVLA:以重建式视觉监督实现精准机器人操纵 |
| 作者 | Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li |
| 机构 | 香港科技大学(广州)· 西湖大学 · 浙江大学 · Monash University |
| 会议 | AAAI 2026 |
| arXiv | https://arxiv.org/abs/2508.10333 |
| 项目网站 | https://zionchow.github.io/ReconVLA/ |
背景与动机
传统 VLA 模型(RT-2、OpenVLA、RoboFlamingo、VLAS、UniVLA 等)只监督动作输出,模型虽然能在多模态理解基础上执行动作,但视觉注意力往往呈弥散状态,无法聚焦目标物体。论文通过注意力可视化发现:在杂乱场景与长程任务中,模型视觉 token 获得的注意力远低于语言 token,常常聚焦错误区域,导致操纵错误的对象。
为什么这个问题重要?精准的视觉 grounding 是 VLA 实现精确抓取的基础,尤其体现在杂乱环境和长程任务中。例如"把西瓜放进黄色碗里"这类指令,基线模型注意力分散在无关位置直接导致任务失败。
现有 grounding 工作分两类,都未从根本上修正注意力分配:
- 显式 grounding(RoboGround、VIP):借助 LISA、YOLOv11 等外部专家模型分割目标并作为额外输入,增强感知但不提升策略自身的 grounding 能力,且整图+裁剪图的输入冗余反而损害空间理解。
- 思维链 grounding(ECoT、GraspVLA):先输出边界框坐标再输出动作,坐标形式难以引导精确操纵,直接回归坐标与动作数值对自回归 VLA 训练挑战极大。
下表给出 CALVIN ABC→D 上 10 个代表性基线的完整结果(附录 D 完整基线表)。这个设置要求模型在未见背景(环境 A/B/C 训练、环境 D 测试)上完成 5 个连续子任务,是检验泛化的硬基准:
| Method | 1/5 | 3/5 | 5/5 | Avg Len |
|---|---|---|---|---|
| UniPi (NIPS'23) | 56.0 | 8.0 | 4.0 | 0.92 |
| SuSIE (ICLR'24) | 87.0 | 49.0 | 26.0 | 2.69 |
| GEVRM (ICLR'25) | 92.0 | 54.0 | 26.0 | 2.83 |
| GR-1 (ICLR'24) | 85.4 | 59.6 | 40.1 | 3.06 |
| Vidman (NIPS'24) | 91.5 | 68.2 | 46.7 | 3.42 |
| CLOVER (NIPS'24) | 96.0 | 70.8 | 45.4 | 3.53 |
| VLAS (ICLR'25) | 87.2 | 40.9 | 19.6 | 2.40 |
| RoboFlamingo (ICLR'24) | 82.4 | 46.6 | 23.5 | 2.47 |
| OpenVLA (CoRL'24) | 91.3 | 62.0 | 43.5 | 3.27 |
| UniVLA (RSS'25) | 95.5 | 75.4 | 56.5 | 3.80 |
| ReconVLA (ours) | 95.6 | 76.9 | 64.1 | 3.95 |
从历史脉络看(附录 H),VLA 领域经历了 RT-2(2023)确立范式 → 生成式操纵方法(UniPi、SuSIE、GR-1、3D-VLA 预测未来帧增强规划)→ 显式/CoT grounding 与 ROSS 重建式视觉指令微调(2024)→ ReconVLA(2026)首次把注视区域重建作为 VLA 隐式视觉监督。ReconVLA 因此被视为"机器人视觉表征对齐"方向的奠基工作,后续 Spatial Forcing(ICLR 2026)等沿此脉络发展。
研究主线:从问题到结论
图 7:ReconVLA 研究主线流程图(Mermaid)——问题→动机→设计→方法→实验→结论,边标注关键证据。
基准/方法设计
核心洞察:人眼在操纵物体时只聚焦视野中的一小块区域(即注视行为),其余部分模糊。ReconVLA 把这个机制建模为重建目标——让模型从噪声中重建目标操纵区域(gaze region),重建过程成为视觉输出的隐式监督信号,迫使模型把视觉注意力集中到正确目标,同时增强该区域的细粒度感知,并在长程任务中隐式促进子任务规划。
图 1:观察画面、gaze region 与注意力图可视化。长程任务 "stack blocks" 中,ReconVLA 自适应调整 gaze region,把视觉注意力引导到正确目标,完成"先抓起蓝块、再叠到粉块上"的连续操作。
三种 grounding 范式对比(附录 A):显式范式(EG)用 YOLOv11 检测目标并联合输入整图/裁剪图,平均长度 3.61;思维链范式(CG)输出边界框坐标,仅 0.63;ReconVLA 的隐式范式(IG)直接监督视觉输出,达到 3.95。直接监督视觉输出既避免了输入冗余,又绕开了坐标回归的联合训练难题。
图 2:三种 grounding 范式概念对比。(a) 显式:外部 grounding 专家 + 整图/裁剪图输入;(b) CoT:先输出 bbox 坐标再输出动作;(c) 隐式(本文):通过重建过程把关键区域作为隐式视觉监督。
分类全景
图 8:VLA 视觉 grounding 方法分类全景(Mermaid)——显式 / CoT / 隐式 / 生成式四类范式及其代表方法。
方法细节
ReconVLA 由重建部分和动作部分组成,基于 LLaVA-7b(Qwen2-7b 语言模型 + SigLIP-so400m-patch14-384 视觉编码器)构建:
图 3:ReconVLA 架构:多视角图像 + 文本指令输入;动作部分输出离散动作 token;重建部分以 reconstructive tokens 为条件,从噪声 $z_t$ 去噪重建 gaze region 场景 token $z_0$。
- 重建目标:只重建目标操纵区域而非整幅图,模拟人眼注视;在潜在空间重建(冻结 VAE 视觉 tokenizer 提取场景 token),避免像素级冗余,去噪过程促使模型捕获内在特征而非克隆 RGB 值。
- 扩散重建:轻量扩散 Transformer(DiT)作为去噪器,以模型视觉输出 $h_R$ 为条件,从噪声 $z_t$ 恢复 gaze region token $z_0$。重建损失采用去噪均方误差形式:$L_{visual} = E[||D(z_t; h_R, t) - \epsilon||^2]$。
- 总损失:$L = L_{action} + L_{visual}$,其中 $L_{action}$ 为自回归动作预测的交叉熵,$L_{visual}$ 为重建项。
- 指令前缀交错(附录 F):指令 token 置于图像 token 之前,图像 token 通过因果注意力融合指令信息,保证模型处理与指令目标对应的视觉 token,且不损害语言建模能力。
- 大规模视觉预训练:预训练数据来自 BridgeV2、LIBERO 与 CALVIN,用微调后的 Grounding DINO 自动分割指令目标区域,形成整图/裁剪图配对数据,共10 万+ 轨迹、200 万样本。预训练与微调均同时回传重建与动作梯度,保持优化目标一致性;预训练不依赖动作数据,原则上可融入任意规模的互联网视频实现 scaling。
实验设计与结果
评测协议:CALVIN 基准基于 PyBullet 仿真与 Franka Panda 机械臂,含 34 个任务、4 个环境(A/B/C/D),长程挑战为 5 个连续子任务,500 次 rollout 评估各子任务成功率与平均完成长度。真机使用 6-DoF AgileX PiPer 机械臂、RealSense D515(Eye-on-Base)与 ORBBEC Dabai(Eye-on-Hand)相机,4 个任务(水果入碗、叠碗、翻杯子、清理桌面)各约 150 条轨迹、20 次测试,并替换为未见目标检验泛化。
图 4:真机实验设置与四个代表性任务:Stack bowls、Put fruit into bowl、Flip cups、Bus table。目标物体与背景颜色均含变体以测试泛化。
主结果(CALVIN ABC→D):ReconVLA 第 5 子任务 64.1%、平均长度 3.95,全面超越 CLOVER(45.4%、3.53)、UniVLA(56.5%、3.80)与 OpenVLA(43.5%、3.27),在最后子任务上分别领先 18.7、7.6、20.6 个百分点。ABCD→D 更困难设置下平均完成 4.23/5、首任务 98.0%,超过 GR-1(4.21)与 RoboFlamingo(4.08)。
范式对比(附录 A):
| Paradigm | 1/5 | 3/5 | 5/5 | Avg Len |
|---|---|---|---|---|
| Baseline(无 grounding) | 88.8 | 63.7 | 49.0 | 3.36 |
| EG(YOLOv11 裁剪图输入) | 94.4 | 70.9 | 50.2 | 3.61 |
| CG(CoT 输出 bbox) | 47.0 | 1.6 | 0.0 | 0.63 |
| IG(本文) | 95.6 | 76.9 | 64.1 | 3.95 |
消融实验(附录 B):
| Variant | 1/5 | 3/5 | 5/5 | Avg Len |
|---|---|---|---|---|
| Full(重建 + gaze + 预训练) | 95.6 | 76.9 | 64.1 | 3.95 |
| 去掉预训练 | 96.8 | 76.9 | 58.2 | 3.85 |
| 去掉 gaze 区域(重建全图) | 89.8 | 67.7 | 46.5 | 3.42 |
| 去掉重建(纯动作基线) | 88.8 | 63.7 | 49.0 | 3.36 |
消融显示:预训练贡献最大(平均长度 +0.53),因为未见测试环境下定位目标并重建本身极难,大规模预训练显著提升视觉生成泛化;重建 gaze 区域优于重建全图——聚焦目标避免操纵错误物体,而全图像素冗余在未见场景下难以重建。
ABCD→D 完整对比(附录 E):3D-VLA 0.70 → GR-1 4.21 → VLAS 3.70 → RoboFlamingo 4.08 →ReconVLA 4.23。
注意力可视化:指令 "put the watermelon into the yellow bowl" 下,基线注意力高度分散导致任务失败;ReconVLA 精准聚焦西瓜。最难任务 stack block 成功率从 59.3% 提升到 79.5%(+20.2%)。
图 5:CALVIN 与真机上的注意力图对比:第 1 行基线注意力分散或聚焦错误区域导致动作失准;第 2 行 ReconVLA 借助视觉监督信号聚焦目标区域,精确完成操作。
真机结果:ReconVLA 在水果入碗与叠碗上接近或超过 90%,四个任务全部优于 OpenVLA 与 PD-VLA;未见目标上 OpenVLA/PD-VLA 近乎 0%,ReconVLA 凭借大规模混合数据预训练仍能成功 grounding 并完成任务。
图 6:真机多任务结果:4 个已知任务 + 2 个未见任务的成功率。ReconVLA 在 Put Fruit into Bowl 与 Stack Bowls 上接近或超过 90%,在未见任务上显著优于 OpenVLA 与 PD-VLA。
结果对比总结
图 9:结果对比总结(Mermaid)——第 5 子任务成功率 64.1%,分别领先 CLOVER 18.7pp、UniVLA 7.6pp、OpenVLA 20.6pp,真机未见目标仍可用。
关键发现
- 注意力分散是操纵失准的根因:注意力可视化显示传统 VLA 视觉 token 获得的注意力远低于语言 token,在杂乱/长程场景中聚焦错误区域。
- 隐式 grounding 全面胜过显式与 CoT:同基线受控对比 IG 3.95 > EG 3.61 > Baseline 3.36 ≫ CG 0.63(平均完成长度)。
- 重建 gaze 区域优于重建全图:去掉 gaze 区域后平均长度从 3.95 降至 3.42,聚焦目标物体避免操纵错误对象。
- 大规模预训练带来 0.53 平均长度增益:10 万+ 轨迹、200 万样本(BridgeV2/LIBERO/CALVIN + Grounding DINO 自动配对)显著增强未见环境的重建泛化。
- 精确操纵大幅提升:stack block 任务成功率 59.3% → 79.5%(+20.2%)。
- 真机未见目标泛化:OpenVLA/PD-VLA 在未见目标上近乎 0%,ReconVLA 仍可成功 grounding 并完成动作。
局限性
- 依赖 Grounding DINO 标注质量:预训练数据的 gaze region 由检测器自动生成,标注质量受检测器限制。
- 真机评估规模有限:4 个任务、每任务 20 次测试,统计显著性空间有限。
- 未见场景仍有挑战:unseen 环境下定位与重建难度大,预训练缓解但未消除。
- 重建计算开销:扩散去噪增加训练/推理计算,高频控制场景需权衡延迟(作者展望:借助自动数据处理流水线融入互联网视频实现 scaling)。
常见问题(FAQ)
ReconVLA 与显式 grounding 方法(RoboGround、VIP)有何区别?
显式方法依赖 LISA、YOLOv11 等外部专家分割目标并作为额外输入,未提升策略自身的 grounding 能力,且整图+裁剪图的输入冗余损害空间理解;ReconVLA 直接监督视觉输出,通过重建目标区域隐式完成 grounding,无需额外输入或输出。
为什么要重建"注视区域"而不是整幅图像?
重建整图面临像素冗余,在未见场景下极难完成;只重建目标操纵区域模拟人眼注视行为,引导注意力聚焦正确目标、增强细粒度感知,消融显示重建 gaze 区域(3.42)明显优于重建全图的效果。
思维链 grounding(输出 bbox)为什么效果差?
坐标形式不足以有效引导模型精确操纵目标位置,且直接输出精准坐标与动作数值对自回归 VLA 的训练提出挑战,CALVIN 上平均完成长度仅 0.63。
预训练数据是怎么得到的?需要动作标注吗?
预训练数据来自 BridgeV2、LIBERO、CALVIN 开源机器人数据集,用微调后的 Grounding DINO 自动分割指令目标区域,生成整图/裁剪图配对数据;重建预训练不依赖机器人动作数据,因此原则上可以融入任意规模的互联网视频。
ReconVLA 在真实机器人上的表现如何?
4 个真机任务中水果入碗、叠碗接近或超过 90% 成功率,全部优于 OpenVLA 与 PD-VLA;在训练中未出现过的目标物体上,基线几乎全部失效,ReconVLA 仍能正确 grounding 并完成任务,展示了视觉泛化能力。
ReconVLA 的损失函数包含哪几项?
总损失为动作预测交叉熵 $L_{action}$ 与注视区域重建项 $L_{visual}$ 之和;其中重建项为扩散去噪均方误差,去噪器以模型视觉输出为条件从噪声恢复 gaze region 的场景 token。
参考链接
- ReconVLA 项目主页(含视频与演示)
- arXiv 论文页:ReconVLA (2508.10333)
- RT-2:Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- OpenVLA:An Open-Source Vision-Language-Action Model
- GR-1:A GPT-style Model for Robot Visual Manipulation
- Grounding DINO:Marrying DINO with Grounded Pre-Training
- ROSS:Reconstructive Visual Instruction Tuning
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)