浙大造出“聪明大脑“:让AI看3D房间时,像人一样懂得“按需取用“

这项由浙江大学与斯坦福大学合作完成的研究,于2026年发表在ACM国际多媒体顶级会议(MM '26,2026年11月10日至14日,巴西里约热内卢),论文编号DOI为10.1145/3767308.3835083,arXiv编号为2608.05137。感兴趣的读者可通过该编号检索完整论文。

**一个藏在日常里的难题**

假设你正站在一个陌生的房间里,朋友问你:"那张沙发是什么颜色的?"你的眼睛会自然地扫向沙发,关注它的颜色信息。但如果朋友换了一个问题:"沙发到床的距离有多远?"这一次,你的大脑就会切换到另一种感知模式——不再只是"看颜色",而是开始估算空间距离,甚至下意识地用脚步丈量。

这种"按问题切换关注重点"的能力,对人类来说再自然不过,但对人工智能来说,却长期是一个棘手的挑战。现实世界中的三维场景,可以用许多不同的方式来描述和表达:普通的彩色照片(RGB视频)能捕捉颜色和纹理,深度图(Depth Video)能感知距离和远近,鸟瞰图(Bird's-Eye-View Map,简称BEV)能展示房间的整体布局,点云(Point Cloud)就像用无数个空间中的点来勾勒物体的轮廓,而体素网格(Voxel Grid)则像用细小的立方块堆砌出三维空间的模型。这五种"语言"各有所长,但现有的AI系统几乎清一色地采用一个粗暴的策略:不管用户问什么问题,把所有模态的信息一股脑塞给模型,让它自己想办法。

这种"眉毛胡子一把抓"的做法带来了显而易见的问题。当AI被问及沙发的颜色时,那些描述空间距离的点云数据其实帮不上什么忙,反而像噪音一样干扰了模型对颜色信息的判断;反之,当AI被问及物体的形状时,颜色信息又成了多余的负担。浙江大学与斯坦福大学的研究团队在论文中提出了一个清晰的诊断:固定模态组合的策略,本质上是在浪费算力,稀释推理能力。

为了解决这个问题,研究团队提出了一个名为SmartMage的新系统。这个名字本身就藏着设计哲学——"Smart"代表它内置的智能路由模块(SMART),"Mage"则代表它的专家激活模块(MAGE)。整套系统的核心理念,就是让AI学会"看问题选工具":根据用户提问的语义,动态地决定该调用哪些感知模态,再把选中的信息分配给最合适的"专家"来处理。

**一、每种感知工具都有它最擅长的舞台**

在深入了解SmartMage的工作原理之前,有必要先理解这个研究所基于的一个关键发现:不同类型的问题,天然地偏好不同的感知模态。

研究团队通过大量实验观察到,当问题涉及颜色、材质、外观等视觉属性时,普通的RGB彩色图像就能提供最直接的答案,就像直接用肉眼观察物体一样。当问题涉及物体的空间位置、到某个参照物的距离,或者整个房间的布局关系时,深度图和鸟瞰图就发挥出了独特的优势——前者能精确量化物体在空间中的位置,后者则像一张从天花板俯视的地图,把房间里所有东西的排列一览无余。而当问题关注物体的三维形状、几何结构,或者需要区分两个外观相似但形状不同的物体时,点云和体素网格的价值就凸显出来了,它们就像用手去触摸一个物体,能感知到相机镜头看不清楚的立体细节。

这个发现虽然直觉上不难接受,但在AI系统的设计实践中却长期被忽视。正是基于这一洞察,研究团队构建了SmartMage的整体框架——一套从"全局感知"到"局部处理"的两阶段自适应系统。

**二、SmartMage的"感知流水线":从原始数据到统一语言**

在介绍两个核心模块之前,先来了解SmartMage如何处理原始输入数据。这套系统能够同时接收五种模态的输入,并将它们统一转换成AI能够理解的数字表示。

处理RGB-D视频(即同时包含彩色图像和深度信息的视频)时,系统面临一个实际挑战:一段室内场景视频往往包含数百帧画面,大量帧之间几乎是重复的视角,全部处理既浪费计算资源,又意义不大。研究团队为此专门设计了一个名为FoVSR的快速关键帧筛选算法。这个算法的思路颇为巧妙:它不依赖耗时的深度图计算,而是直接利用相机的空间位置信息,估算每一帧能"看到"哪些空间区域,然后通过贪心策略选出那些能够覆盖最多未被覆盖区域的帧,最后再在每个选中帧附近的几帧中挑出画面最清晰的那一帧。实验表明,FoVSR相比此前主流方法实现了超过100倍的加速,这使得系统在处理大规模场景时效率大幅提升。

鸟瞰图的生成方式同样独具匠心。研究团队将场景的三维重建网格从正上方进行正交投影,得到一张俯视地图,并将实例级别的语义分割信息一并投影到这张地图上,在每个物体的位置标注锚点。这样生成的鸟瞰图不仅展示了房间的物理轮廓,还清晰地标记出了各个物体的位置关系,是理解空间布局的绝佳工具。

点云则直接从场景的三维重建网格中均匀采样8192个点,每个点不仅携带三维坐标,还附带颜色、法线方向和语义标签等信息。体素网格采用0.02米的精细分辨率,将整个场景离散化为密集的三维网格,通过Mask3D这个专门用于三维语义分割的稀疏神经网络,聚合出每个实例级别的体积特征。最终,五种模态的特征都被统一投影到相同维度(4096维)的表示空间中,为后续的智能路由做好准备。

**三、SMART模块:那个懂得"按需取用"的智慧调度员**

SMART,全称"语义引导的模态自适应路由",是SmartMage系统的第一个核心模块,也是实现"按问题选工具"这一核心理念的关键所在。

打个比方,SMART的角色就像一个经验丰富的餐厅调度员。当顾客(用户)点了一道需要精细刀工的菜,调度员会把这道菜分配给擅长刀功的厨师;当点的是需要精准控温的甜点,调度员会把任务交给擅长烘焙的师傅。调度员不会让所有厨师都参与每一道菜的制作,因为那样既浪费资源,又可能互相干扰。

SMART调度员在做决策时,综合考量三个维度的信息。

第一个维度是"语义先验估计"。当用户的问题被输入系统时,SMART首先对问题文本进行分析,从中推断这类问题通常偏好哪些模态。这个推断是通过一个轻量级的预测头实现的,它直接作用于问题的文字编码,输出一个关于各模态相关程度的概率分布。以"毯子是什么颜色的"这类问题为例,系统会从中学习到,颜色问题高度依赖RGB信息;而"沙发在哪里"这类位置问题,则与鸟瞰图或体素等几何模态更为相关。

第二个维度是"语义相似度评分"。光凭问题类型的先验判断还不够,因为具体场景中每种模态的实际信息含量可能各不相同。SMART的语义相似度评分模块,会针对每种模态分别生成一个"与当前问题相关的信息摘要",然后衡量这份摘要与问题本身的语义匹配程度。具体实现上,系统从问题文本中生成每个模态专属的"查询向量",让该向量与对应模态的视觉特征进行交叉注意力计算,提炼出与问题最相关的视觉证据,再将其与问题的全局语义编码做余弦相似度计算,并通过可学习的缩放参数进行校准。

第三个维度是"模态质量评估"。现实情况中,某些模态的数据质量可能因各种原因而受损——比如相机扫描不完整导致点云稀疏,或者光照不均匀使深度图出现缺失。SMART专门设计了一个模态质量评估模块,从每种模态的特征激活统计中计算三个指标:激活强度(衡量整体信息量)、激活稀疏性(衡量信息的集中程度)和激活稳定性(区分真实结构信息与随机噪声)。这三个统计量组合后,通过一个轻量线性层,输出一个代表该模态可靠程度的质量分数。这样,当某个模态的数据质量较差时,系统会自动降低对它的依赖。

将三个维度的信号加权求和后,SMART生成每种模态的综合路由分数。在此基础上,系统还引入了一个"RGB证据门控"机制:当RGB视频与问题的语义高度匹配时,增强RGB模态的权重;反之则适当降低。最终,系统保留RGB作为固定的基础模态,再从其余四种互补模态中动态选择最相关的若干个,剔除与当前问题无关的模态,只将精选后的模态组合送入下一阶段。

在训练阶段,SMART通过两种互补的损失函数来引导路由行为走向语义一致性。一种是语义相关性损失,鼓励系统将相关模态与查询的相似度得分提升;另一种是辨别性损失,则确保相关模态与不相关模态之间保持足够大的分数差距,让路由决策更加鲜明而非模糊。

**四、MAGE模块:那个让"专家团队"各司其职的精密协调者**

即便SMART已经完成了全局层面的模态筛选,被选中的不同模态信息在进入语言模型的推理阶段后,依然面临一个问题:大型语言模型的每一层都会对所有输入的"词元"(token,可以理解为信息的最小单位)进行统一处理,并不区分这个词元来自RGB图像还是来自点云。不同模态的信息在推理过程中会被混在一起,各自的特点可能因此被磨平。

MAGE——"模态感知门控专家"模块——正是为了解决这个问题而生。它的设计灵感来自"专家混合模型"(Mixture of Experts,简称MoE)这一框架。MoE的基本思想是:与其让一个巨大的神经网络处理所有任务,不如维护一组各有专长的小网络("专家"),并为每个输入信号智能地选择最合适的专家来处理。

MAGE将这个思想与模态感知深度结合起来。在SmartMage系统中,语言模型的第8、12、16、20、24、28层分别被植入了MoE模块,每个模块包含8位专家,每次处理时从中激活最契合当前词元的2位专家。这些专家的初始参数直接继承自预训练语言模型对应层的前馈网络权重,保证了在引入专家分工机制的同时,系统仍然能够从成熟的预训练知识中获益。

MAGE的核心创新在于"模态感知专家推测"模块(MES)。这个模块为序列中的每一个词元都预测一个"模态归属分布"——也就是说,它会判断这个词元更像是来自RGB视频、深度图、鸟瞰图、点云、体素,还是文本。有了这个判断之后,系统会结合一个可学习的"模态-专家亲和度矩阵"(一个记录了每种模态偏好哪些专家的查找表),为每个词元生成一个软性的"推荐专家名单"。

这份推荐名单并不强制覆盖MoE模块自身的路由决策,而是通过一种称为"专家校准损失"的训练目标,温和地引导路由结果向模态一致的方向倾斜。随着训练的进行,不同的专家会自然地形成各自的"专长领域":某些专家对视觉外观信息更敏感,某些专家则更擅长处理几何空间信息,还有些专家专注于文本语义的推理。

从可视化结果可以清晰地看到这一分工机制的实际效果。在没有MES的情况下,不同模态的词元在8个专家之间的分配几乎是均匀随机的,看不出任何规律;而引入MES之后,RGB词元倾向于流向第2号和第6号专家,鸟瞰图词元主要被第3号和第7号专家处理,点云词元大量涌向第5号专家,体素词元则偏好第6号专家。每种模态都找到了自己最合适的"处理车间",信息不再被随机打散,而是在语义一致的通道中流动和提炼。

MAGE还通过一个负载均衡损失函数,防止所有词元都挤向少数几个专家,确保8位专家的工作量大致均衡,避免某些专家过载而其他专家空闲的"不均衡"现象。

**五、一个专门用来揭示"规律"的诊断基准:ScanFacet**

为了更深入地研究不同类型的问题与不同感知模态之间的依存关系,研究团队还专门构建了一个新的诊断基准数据集,命名为ScanFacet。

现有的3D场景理解基准测试(如ScanQA和SQA3D)混合了各种类型的问题,难以单独评估模型在某一类问题上的能力,也无法分析各种模态组合对不同问题类型的差异化贡献。ScanFacet将ScanQA和SQA3D的问答对重新整理分类,划分为八个语义类别:颜色、位置、材质、数量、形状、物体类型、空间关系和其他。最终共收录7936个问答对,其中空间关系类问题最多,占约32%;颜色类问题约占14%;材质类问题相对较少,仅占不到1%。

分类过程采用了三阶段的大语言模型辅助流程:首先进行语义解析,从问题中提取核心意图并标准化同义词;接着进行意图归一化,将解析结果映射到预定义的八个类别之一;最后通过多轮独立推断的多数投票进行一致性过滤。所有自动标注结果还经过了人工审核,错误率控制在3%以下。

通过ScanFacet的细粒度分析,研究团队观察到了清晰的模态-语义偏好模式:颜色和材质类问题的最优模态组合集中在RGB和RGB+深度,几何感知模态(如点云和体素)的加入对这类问题帮助有限甚至有轻微干扰;数量统计和空间关系类问题则明显受益于深度图和体素等几何模态;形状类问题则对点云数据的依赖最为突出。这些观察不仅验证了SmartMage设计的合理性,也为未来研究如何在多模态场景理解系统中实现更精细的模态协同提供了实证依据。

**六、实验结果:在五项标准测试中全面领先**

SmartMage在五项权威3D场景理解基准测试上进行了系统评估,涵盖3D视觉问答、3D密集描述生成和3D视觉定位三大任务类型。

在ScanQA和SQA3D两项3D视觉问答任务上,SmartMage分别取得了32.6分和66.8分的精确匹配率(EM@1),相较于此前的最佳方法Ross3D分别提升了1.8分和3.8分。从SQA3D的细粒度问题类型分析来看,SmartMage在"是什么"(59.4%)、"是否"(82.1%)、"怎样"(66.8%)、"哪个"(60.6%)和"其他"(60.2%)等类型上均取得了最佳成绩,表现出强健的跨类型泛化能力。

在Scan2Cap密集描述生成任务上,SmartMage在两个不同严格程度的评估阈值下均取得了当时最优的CIDEr分数:在较宽松的IoU≥0.25条件下达到93.8,在较严格的IoU≥0.5条件下达到88.7,分别超越了此前最强方法6.7分和4.9分。CIDEr是一种衡量生成文本与参考答案语义相似度的指标,分数越高代表生成的描述越准确、越流畅。

在ScanRefer和Multi3DRefer两项视觉定位任务上,SmartMage的表现尤为突出。在ScanRefer上,它分别以65.9%和59.5%的精度超越了Ross3D的61.1%和54.4%,提升幅度达到4.8和5.1个百分点;在Multi3DRefer上,F1分数从59.6%和54.3%提升至65.4%和60.7%,提升幅度高达5.8和6.4个百分点。在ScanRefer的细化分析中,SmartMage在处理包含多个同类物体的"多实例"歧义场景时表现尤为出色,这正是自适应模态选择能力最能发挥价值的场景。

面对固定模态组合与自适应选择的直接对比,实验结果同样印证了SmartMage的设计思路。仅使用RGB时,各指标处于较低水平;逐步添加单一互补模态后,性能普遍提升,其中体素表示在多个场景下表现略优于点云和深度。然而,将所有模态同时固定输入时,性能并不是最优的,甚至在部分指标上不如三模态组合。而SmartMage的自适应选择策略在所有基准上均取得最佳成绩,充分说明动态路由比静态堆叠更有效。

**七、在ScanFacet上:材质和颜色理解的大幅跃升**

在ScanFacet诊断基准的细粒度对比中,研究团队将SmartMage与六种固定模态配置进行了比较:纯RGB、RGB+深度、RGB+点云、RGB+体素、RGB+鸟瞰图,以及将所有模态固定融合的静态全模态方案。

对比结果中最引人注目的发现是,SmartMage在材质和颜色两个类别上的CIDEr提升最为显著,分别达到了+27.1和+15.9的大幅增益(相对于静态全模态方案)。这与研究团队的预期一致:材质和颜色类问题最依赖RGB和RGB+深度的组合,而静态全模态方案将点云、体素等对颜色判断毫无帮助甚至有干扰的几何模态也强制加入,反而压低了模型对核心视觉信息的关注。SmartMage通过学习到的模态偏好,在面对这类问题时自动规避了干扰模态,让彩色视觉信息得到了充分利用。在形状、空间关系等依赖几何信息的类别上,SmartMage同样取得了可观的提升,验证了它在另一个方向上的动态适应能力。

**八、训练效率与推理速度:鱼和熊掌可以兼得**

引入更复杂的模块,通常意味着更高的计算成本。研究团队专门进行了效率分析,结果出人意料地令人满意。

在训练开销方面,SmartMage的总参数量约为12.6亿,但每次迭代的实际训练时间仅需47.4秒,相比Video-3D LLM(91.6秒)和Ross3D(125.2秒)分别实现了约2倍和2.6倍的加速。这个加速的来源在于SmartMage的稀疏路由机制:每次推理只激活约8.8亿个参数(而非全部),通过避免冗余计算显著降低了训练成本。

在推理延迟方面,SmartMage的"首词延迟"(从输入到开始输出第一个词的时间)为112.5毫秒,端到端延迟为538.2毫秒,与同类方法处于相近水平。三维数据预处理(包括点云、体素等)额外耗费约64.8毫秒,这是引入更多3D模态所带来的合理代价。整体来看,SmartMage在增加了5种模态处理能力的同时,训练效率反而更高,推理速度与竞争对手相当,在实用性上表现出色。

研究团队还在RGB-only的视频理解基准测试(VSI-Bench、VSI-SUPER、MMSI-Bench)上对SmartMage进行了零样本评估,以考察当3D模态完全缺失时系统的鲁棒性。结果显示,SmartMage在这些纯RGB场景下的整体表现保持竞争力,尤其在空间关系推理类别上表现突出,说明系统能够自然地退化到只依赖RGB的工作模式,没有因为其他模态缺失而大幅崩溃。

**九、消融实验:一砖一瓦的价值核验**

为了精确评估每个设计选择的贡献,研究团队进行了系统性的消融实验——也就是逐一"拆除"某个组件,观察性能下降的程度,从而反推该组件的价值。

在SMART模块的三个子组件中,语义相似度评分模块(SSS)的贡献最为关键:移除它后,ScanQA的精确匹配率从29.8跌至27.1,Multi3DRefer的F1分数从56.2跌至52.2,降幅居三个子组件之首。这说明准确衡量每种模态与当前问题的语义匹配程度,是实现有效路由的核心能力。移除语义先验估计(SPE)和模态质量评估(MQE)也各自带来显著的性能下降,但幅度相对较小,说明这两个组件起到了重要的辅助和校正作用。

在MAGE模块中,移除模态感知专家推测(MES)会导致SQA3D精确匹配率从64.5降至63.1,Multi3DRefer F1分数从57.2降至55.8。单独使用SMART或MAGE的效果都弱于两者结合,而完整的SmartMage系统在所有基准上均取得最佳成绩,证明了两个模块之间的协同增益。

在损失函数的消融实验中,移除语义相关性损失对性能的冲击最大,验证了明确的查询-模态对齐训练信号的不可或缺性。专家校准损失和负载均衡损失的联合移除则带来了第二大降幅,表明有效的专家路由需要模态感知先验和负载均衡机制的双重保障,缺一不可。

在MoE的设计探索方面,研究团队发现MoE层植入的深度至关重要:将MoE模块布置在模型的浅层(第0至10层)仅带来轻微提升,而布置在深层(第8至28层)则带来显著的性能跃升。CIDEr指标从没有MoE时的88.4,经由浅层MoE的90.9,一路攀升至深层MoE的107.6。这一规律与直觉吻合:浅层网络主要提取低级感知特征,而深层网络才承载着高级语义推理,模态专家的分工在语义层面才真正有用武之地。专家数量的缩放实验同样揭示了一个有趣的饱和规律:从2个专家扩展到20个专家时,性能持续稳定提升;超过20个后,增益开始趋于平缓甚至轻微下滑,说明过多的专家会引入路由混乱,专家数量与多样性之间存在一个最优平衡点。

**十、这套系统还存在哪些局限**

研究团队在论文中对SmartMage的局限性进行了坦诚的讨论。

一方面,大型语言模型有词元数量的预算限制,这迫使系统必须对各种模态的输入进行压缩。FoVSR算法虽然能高效筛选关键帧,但可能遗漏某些视角独特的重要帧,导致空间上下文不完整。点云的最远点采样策略在保持覆盖均匀性的同时,不可避免地降低了精细物体的点密度,对小型结构的表示能力有所削弱。

另一方面,系统的性能部分受制于训练数据的质量。ScanNet数据集中存在模糊的多视角图像和不精确的标注,这些噪声会在需要精细空间判断的任务上造成明显的干扰。研究团队展示了两个典型的失败案例:一个是标注歧义造成的错误,两个外观和位置都相似的物体同时满足描述条件,系统选中了其中一个但标注答案是另一个;另一个是光照不一致导致的颜色感知错误,场景中不同区域的光照差异使系统对物体颜色产生了误判。这两类失败案例揭示了未来需要重点攻克的方向:如何提升对歧义描述的处理能力,以及如何增强对视觉外观变化的鲁棒性。

---

说到底,SmartMage回答的是一个看似简单却长期被忽视的问题:AI在理解三维世界时,真的需要同时看所有东西吗?答案是否定的。通过让系统学会"看问题选工具",再让内部的专家团队各司其职,研究团队在五项权威基准上全面刷新了纪录,同时还让训练速度提升了两到三倍。

这项研究对AI与三维世界交互方式的影响,或许比单纯的性能数字更为深远。随着具身智能(能够在物理空间中自主行动的AI)逐渐成为技术前沿的热点方向,像SmartMage这样懂得"按需感知、精准推理"的系统,将是让机器人真正理解室内环境、与人自然协作的重要基础。未来某天,当一个家用机器人被你问到"沙发是什么颜色"和"桌子在床的哪边"时,它或许就会用类似SmartMage的方式,从容地切换感知工具,给出既准确又高效的回答。感兴趣深入了解技术细节的读者,可以通过arXiv编号2608.05137查阅完整论文。

---

Q&A

Q1:SmartMage和普通的多模态AI模型有什么区别?

A:普通多模态AI会把所有感知数据(彩色图像、深度图、点云等)无差别地同时输入模型,SmartMage则根据用户问题的语义,动态决定该使用哪几种数据,比如颜色类问题主要使用彩色图像,形状类问题则更多依赖点云数据,避免了无关信息的干扰,也降低了计算浪费。

Q2:SmartMage的SMART模块是如何判断应该调用哪些感知模态的?

A:SMART综合三种信号做判断:首先分析问题文本属于哪类语义(颜色、位置、形状等),推断该类问题通常偏好哪些模态;其次计算每种模态当前内容与问题的语义相似度;最后评估每种模态的数据质量是否可靠。三者加权融合后,系统选出最相关的模态组合,排除干扰。

Q3:ScanFacet是什么数据集,它有什么特别的用途?

A:ScanFacet是研究团队专门构建的诊断基准数据集,将现有3D场景理解问答数据重新分成颜色、位置、材质、数量、形状、物体类型、空间关系和其他八个语义类别,共7936条数据。它的用途不是训练,而是精细分析不同感知模态组合对不同类型问题的贡献,帮助研究者理解模态与语义之间的深层关联规律。