这项由浙江大学与斯坦福大学合作完成的研究于2026年发表在ACM国际多媒体顶级会议MM 262026年11月10日至14日巴西里约热内卢论文编号DOI为10.1145/3767308.3835083arXiv编号为2608.05137。感兴趣的读者可通过该编号检索完整论文。**一个藏在日常里的难题**假设你正站在一个陌生的房间里朋友问你那张沙发是什么颜色的你的眼睛会自然地扫向沙发关注它的颜色信息。但如果朋友换了一个问题沙发到床的距离有多远这一次你的大脑就会切换到另一种感知模式——不再只是看颜色而是开始估算空间距离甚至下意识地用脚步丈量。这种按问题切换关注重点的能力对人类来说再自然不过但对人工智能来说却长期是一个棘手的挑战。现实世界中的三维场景可以用许多不同的方式来描述和表达普通的彩色照片RGB视频能捕捉颜色和纹理深度图Depth Video能感知距离和远近鸟瞰图Birds-Eye-View Map简称BEV能展示房间的整体布局点云Point Cloud就像用无数个空间中的点来勾勒物体的轮廓而体素网格Voxel Grid则像用细小的立方块堆砌出三维空间的模型。这五种语言各有所长但现有的AI系统几乎清一色地采用一个粗暴的策略不管用户问什么问题把所有模态的信息一股脑塞给模型让它自己想办法。这种眉毛胡子一把抓的做法带来了显而易见的问题。当AI被问及沙发的颜色时那些描述空间距离的点云数据其实帮不上什么忙反而像噪音一样干扰了模型对颜色信息的判断反之当AI被问及物体的形状时颜色信息又成了多余的负担。浙江大学与斯坦福大学的研究团队在论文中提出了一个清晰的诊断固定模态组合的策略本质上是在浪费算力稀释推理能力。为了解决这个问题研究团队提出了一个名为SmartMage的新系统。这个名字本身就藏着设计哲学——Smart代表它内置的智能路由模块SMARTMage则代表它的专家激活模块MAGE。整套系统的核心理念就是让AI学会看问题选工具根据用户提问的语义动态地决定该调用哪些感知模态再把选中的信息分配给最合适的专家来处理。**一、每种感知工具都有它最擅长的舞台**在深入了解SmartMage的工作原理之前有必要先理解这个研究所基于的一个关键发现不同类型的问题天然地偏好不同的感知模态。研究团队通过大量实验观察到当问题涉及颜色、材质、外观等视觉属性时普通的RGB彩色图像就能提供最直接的答案就像直接用肉眼观察物体一样。当问题涉及物体的空间位置、到某个参照物的距离或者整个房间的布局关系时深度图和鸟瞰图就发挥出了独特的优势——前者能精确量化物体在空间中的位置后者则像一张从天花板俯视的地图把房间里所有东西的排列一览无余。而当问题关注物体的三维形状、几何结构或者需要区分两个外观相似但形状不同的物体时点云和体素网格的价值就凸显出来了它们就像用手去触摸一个物体能感知到相机镜头看不清楚的立体细节。这个发现虽然直觉上不难接受但在AI系统的设计实践中却长期被忽视。正是基于这一洞察研究团队构建了SmartMage的整体框架——一套从全局感知到局部处理的两阶段自适应系统。**二、SmartMage的感知流水线从原始数据到统一语言**在介绍两个核心模块之前先来了解SmartMage如何处理原始输入数据。这套系统能够同时接收五种模态的输入并将它们统一转换成AI能够理解的数字表示。处理RGB-D视频即同时包含彩色图像和深度信息的视频时系统面临一个实际挑战一段室内场景视频往往包含数百帧画面大量帧之间几乎是重复的视角全部处理既浪费计算资源又意义不大。研究团队为此专门设计了一个名为FoVSR的快速关键帧筛选算法。这个算法的思路颇为巧妙它不依赖耗时的深度图计算而是直接利用相机的空间位置信息估算每一帧能看到哪些空间区域然后通过贪心策略选出那些能够覆盖最多未被覆盖区域的帧最后再在每个选中帧附近的几帧中挑出画面最清晰的那一帧。实验表明FoVSR相比此前主流方法实现了超过100倍的加速这使得系统在处理大规模场景时效率大幅提升。鸟瞰图的生成方式同样独具匠心。研究团队将场景的三维重建网格从正上方进行正交投影得到一张俯视地图并将实例级别的语义分割信息一并投影到这张地图上在每个物体的位置标注锚点。这样生成的鸟瞰图不仅展示了房间的物理轮廓还清晰地标记出了各个物体的位置关系是理解空间布局的绝佳工具。点云则直接从场景的三维重建网格中均匀采样8192个点每个点不仅携带三维坐标还附带颜色、法线方向和语义标签等信息。体素网格采用0.02米的精细分辨率将整个场景离散化为密集的三维网格通过Mask3D这个专门用于三维语义分割的稀疏神经网络聚合出每个实例级别的体积特征。最终五种模态的特征都被统一投影到相同维度4096维的表示空间中为后续的智能路由做好准备。**三、SMART模块那个懂得按需取用的智慧调度员**SMART全称语义引导的模态自适应路由是SmartMage系统的第一个核心模块也是实现按问题选工具这一核心理念的关键所在。打个比方SMART的角色就像一个经验丰富的餐厅调度员。当顾客用户点了一道需要精细刀工的菜调度员会把这道菜分配给擅长刀功的厨师当点的是需要精准控温的甜点调度员会把任务交给擅长烘焙的师傅。调度员不会让所有厨师都参与每一道菜的制作因为那样既浪费资源又可能互相干扰。SMART调度员在做决策时综合考量三个维度的信息。第一个维度是语义先验估计。当用户的问题被输入系统时SMART首先对问题文本进行分析从中推断这类问题通常偏好哪些模态。这个推断是通过一个轻量级的预测头实现的它直接作用于问题的文字编码输出一个关于各模态相关程度的概率分布。以毯子是什么颜色的这类问题为例系统会从中学习到颜色问题高度依赖RGB信息而沙发在哪里这类位置问题则与鸟瞰图或体素等几何模态更为相关。第二个维度是语义相似度评分。光凭问题类型的先验判断还不够因为具体场景中每种模态的实际信息含量可能各不相同。SMART的语义相似度评分模块会针对每种模态分别生成一个与当前问题相关的信息摘要然后衡量这份摘要与问题本身的语义匹配程度。具体实现上系统从问题文本中生成每个模态专属的查询向量让该向量与对应模态的视觉特征进行交叉注意力计算提炼出与问题最相关的视觉证据再将其与问题的全局语义编码做余弦相似度计算并通过可学习的缩放参数进行校准。第三个维度是模态质量评估。现实情况中某些模态的数据质量可能因各种原因而受损——比如相机扫描不完整导致点云稀疏或者光照不均匀使深度图出现缺失。SMART专门设计了一个模态质量评估模块从每种模态的特征激活统计中计算三个指标激活强度衡量整体信息量、激活稀疏性衡量信息的集中程度和激活稳定性区分真实结构信息与随机噪声。这三个统计量组合后通过一个轻量线性层输出一个代表该模态可靠程度的质量分数。这样当某个模态的数据质量较差时系统会自动降低对它的依赖。将三个维度的信号加权求和后SMART生成每种模态的综合路由分数。在此基础上系统还引入了一个RGB证据门控机制当RGB视频与问题的语义高度匹配时增强RGB模态的权重反之则适当降低。最终系统保留RGB作为固定的基础模态再从其余四种互补模态中动态选择最相关的若干个剔除与当前问题无关的模态只将精选后的模态组合送入下一阶段。在训练阶段SMART通过两种互补的损失函数来引导路由行为走向语义一致性。一种是语义相关性损失鼓励系统将相关模态与查询的相似度得分提升另一种是辨别性损失则确保相关模态与不相关模态之间保持足够大的分数差距让路由决策更加鲜明而非模糊。**四、MAGE模块那个让专家团队各司其职的精密协调者**即便SMART已经完成了全局层面的模态筛选被选中的不同模态信息在进入语言模型的推理阶段后依然面临一个问题大型语言模型的每一层都会对所有输入的词元token可以理解为信息的最小单位进行统一处理并不区分这个词元来自RGB图像还是来自点云。不同模态的信息在推理过程中会被混在一起各自的特点可能因此被磨平。MAGE——模态感知门控专家模块——正是为了解决这个问题而生。它的设计灵感来自专家混合模型Mixture of Experts简称MoE这一框架。MoE的基本思想是与其让一个巨大的神经网络处理所有任务不如维护一组各有专长的小网络专家并为每个输入信号智能地选择最合适的专家来处理。MAGE将这个思想与模态感知深度结合起来。在SmartMage系统中语言模型的第8、12、16、20、24、28层分别被植入了MoE模块每个模块包含8位专家每次处理时从中激活最契合当前词元的2位专家。这些专家的初始参数直接继承自预训练语言模型对应层的前馈网络权重保证了在引入专家分工机制的同时系统仍然能够从成熟的预训练知识中获益。MAGE的核心创新在于模态感知专家推测模块MES。这个模块为序列中的每一个词元都预测一个模态归属分布——也就是说它会判断这个词元更像是来自RGB视频、深度图、鸟瞰图、点云、体素还是文本。有了这个判断之后系统会结合一个可学习的模态-专家亲和度矩阵一个记录了每种模态偏好哪些专家的查找表为每个词元生成一个软性的推荐专家名单。这份推荐名单并不强制覆盖MoE模块自身的路由决策而是通过一种称为专家校准损失的训练目标温和地引导路由结果向模态一致的方向倾斜。随着训练的进行不同的专家会自然地形成各自的专长领域某些专家对视觉外观信息更敏感某些专家则更擅长处理几何空间信息还有些专家专注于文本语义的推理。从可视化结果可以清晰地看到这一分工机制的实际效果。在没有MES的情况下不同模态的词元在8个专家之间的分配几乎是均匀随机的看不出任何规律而引入MES之后RGB词元倾向于流向第2号和第6号专家鸟瞰图词元主要被第3号和第7号专家处理点云词元大量涌向第5号专家体素词元则偏好第6号专家。每种模态都找到了自己最合适的处理车间信息不再被随机打散而是在语义一致的通道中流动和提炼。MAGE还通过一个负载均衡损失函数防止所有词元都挤向少数几个专家确保8位专家的工作量大致均衡避免某些专家过载而其他专家空闲的不均衡现象。**五、一个专门用来揭示规律的诊断基准ScanFacet**为了更深入地研究不同类型的问题与不同感知模态之间的依存关系研究团队还专门构建了一个新的诊断基准数据集命名为ScanFacet。现有的3D场景理解基准测试如ScanQA和SQA3D混合了各种类型的问题难以单独评估模型在某一类问题上的能力也无法分析各种模态组合对不同问题类型的差异化贡献。ScanFacet将ScanQA和SQA3D的问答对重新整理分类划分为八个语义类别颜色、位置、材质、数量、形状、物体类型、空间关系和其他。最终共收录7936个问答对其中空间关系类问题最多占约32%颜色类问题约占14%材质类问题相对较少仅占不到1%。分类过程采用了三阶段的大语言模型辅助流程首先进行语义解析从问题中提取核心意图并标准化同义词接着进行意图归一化将解析结果映射到预定义的八个类别之一最后通过多轮独立推断的多数投票进行一致性过滤。所有自动标注结果还经过了人工审核错误率控制在3%以下。通过ScanFacet的细粒度分析研究团队观察到了清晰的模态-语义偏好模式颜色和材质类问题的最优模态组合集中在RGB和RGB深度几何感知模态如点云和体素的加入对这类问题帮助有限甚至有轻微干扰数量统计和空间关系类问题则明显受益于深度图和体素等几何模态形状类问题则对点云数据的依赖最为突出。这些观察不仅验证了SmartMage设计的合理性也为未来研究如何在多模态场景理解系统中实现更精细的模态协同提供了实证依据。**六、实验结果在五项标准测试中全面领先**SmartMage在五项权威3D场景理解基准测试上进行了系统评估涵盖3D视觉问答、3D密集描述生成和3D视觉定位三大任务类型。在ScanQA和SQA3D两项3D视觉问答任务上SmartMage分别取得了32.6分和66.8分的精确匹配率EM1相较于此前的最佳方法Ross3D分别提升了1.8分和3.8分。从SQA3D的细粒度问题类型分析来看SmartMage在是什么59.4%、是否82.1%、怎样66.8%、哪个60.6%和其他60.2%等类型上均取得了最佳成绩表现出强健的跨类型泛化能力。在Scan2Cap密集描述生成任务上SmartMage在两个不同严格程度的评估阈值下均取得了当时最优的CIDEr分数在较宽松的IoU≥0.25条件下达到93.8在较严格的IoU≥0.5条件下达到88.7分别超越了此前最强方法6.7分和4.9分。CIDEr是一种衡量生成文本与参考答案语义相似度的指标分数越高代表生成的描述越准确、越流畅。在ScanRefer和Multi3DRefer两项视觉定位任务上SmartMage的表现尤为突出。在ScanRefer上它分别以65.9%和59.5%的精度超越了Ross3D的61.1%和54.4%提升幅度达到4.8和5.1个百分点在Multi3DRefer上F1分数从59.6%和54.3%提升至65.4%和60.7%提升幅度高达5.8和6.4个百分点。在ScanRefer的细化分析中SmartMage在处理包含多个同类物体的多实例歧义场景时表现尤为出色这正是自适应模态选择能力最能发挥价值的场景。面对固定模态组合与自适应选择的直接对比实验结果同样印证了SmartMage的设计思路。仅使用RGB时各指标处于较低水平逐步添加单一互补模态后性能普遍提升其中体素表示在多个场景下表现略优于点云和深度。然而将所有模态同时固定输入时性能并不是最优的甚至在部分指标上不如三模态组合。而SmartMage的自适应选择策略在所有基准上均取得最佳成绩充分说明动态路由比静态堆叠更有效。**七、在ScanFacet上材质和颜色理解的大幅跃升**在ScanFacet诊断基准的细粒度对比中研究团队将SmartMage与六种固定模态配置进行了比较纯RGB、RGB深度、RGB点云、RGB体素、RGB鸟瞰图以及将所有模态固定融合的静态全模态方案。对比结果中最引人注目的发现是SmartMage在材质和颜色两个类别上的CIDEr提升最为显著分别达到了27.1和15.9的大幅增益相对于静态全模态方案。这与研究团队的预期一致材质和颜色类问题最依赖RGB和RGB深度的组合而静态全模态方案将点云、体素等对颜色判断毫无帮助甚至有干扰的几何模态也强制加入反而压低了模型对核心视觉信息的关注。SmartMage通过学习到的模态偏好在面对这类问题时自动规避了干扰模态让彩色视觉信息得到了充分利用。在形状、空间关系等依赖几何信息的类别上SmartMage同样取得了可观的提升验证了它在另一个方向上的动态适应能力。**八、训练效率与推理速度鱼和熊掌可以兼得**引入更复杂的模块通常意味着更高的计算成本。研究团队专门进行了效率分析结果出人意料地令人满意。在训练开销方面SmartMage的总参数量约为12.6亿但每次迭代的实际训练时间仅需47.4秒相比Video-3D LLM91.6秒和Ross3D125.2秒分别实现了约2倍和2.6倍的加速。这个加速的来源在于SmartMage的稀疏路由机制每次推理只激活约8.8亿个参数而非全部通过避免冗余计算显著降低了训练成本。在推理延迟方面SmartMage的首词延迟从输入到开始输出第一个词的时间为112.5毫秒端到端延迟为538.2毫秒与同类方法处于相近水平。三维数据预处理包括点云、体素等额外耗费约64.8毫秒这是引入更多3D模态所带来的合理代价。整体来看SmartMage在增加了5种模态处理能力的同时训练效率反而更高推理速度与竞争对手相当在实用性上表现出色。研究团队还在RGB-only的视频理解基准测试VSI-Bench、VSI-SUPER、MMSI-Bench上对SmartMage进行了零样本评估以考察当3D模态完全缺失时系统的鲁棒性。结果显示SmartMage在这些纯RGB场景下的整体表现保持竞争力尤其在空间关系推理类别上表现突出说明系统能够自然地退化到只依赖RGB的工作模式没有因为其他模态缺失而大幅崩溃。**九、消融实验一砖一瓦的价值核验**为了精确评估每个设计选择的贡献研究团队进行了系统性的消融实验——也就是逐一拆除某个组件观察性能下降的程度从而反推该组件的价值。在SMART模块的三个子组件中语义相似度评分模块SSS的贡献最为关键移除它后ScanQA的精确匹配率从29.8跌至27.1Multi3DRefer的F1分数从56.2跌至52.2降幅居三个子组件之首。这说明准确衡量每种模态与当前问题的语义匹配程度是实现有效路由的核心能力。移除语义先验估计SPE和模态质量评估MQE也各自带来显著的性能下降但幅度相对较小说明这两个组件起到了重要的辅助和校正作用。在MAGE模块中移除模态感知专家推测MES会导致SQA3D精确匹配率从64.5降至63.1Multi3DRefer F1分数从57.2降至55.8。单独使用SMART或MAGE的效果都弱于两者结合而完整的SmartMage系统在所有基准上均取得最佳成绩证明了两个模块之间的协同增益。在损失函数的消融实验中移除语义相关性损失对性能的冲击最大验证了明确的查询-模态对齐训练信号的不可或缺性。专家校准损失和负载均衡损失的联合移除则带来了第二大降幅表明有效的专家路由需要模态感知先验和负载均衡机制的双重保障缺一不可。在MoE的设计探索方面研究团队发现MoE层植入的深度至关重要将MoE模块布置在模型的浅层第0至10层仅带来轻微提升而布置在深层第8至28层则带来显著的性能跃升。CIDEr指标从没有MoE时的88.4经由浅层MoE的90.9一路攀升至深层MoE的107.6。这一规律与直觉吻合浅层网络主要提取低级感知特征而深层网络才承载着高级语义推理模态专家的分工在语义层面才真正有用武之地。专家数量的缩放实验同样揭示了一个有趣的饱和规律从2个专家扩展到20个专家时性能持续稳定提升超过20个后增益开始趋于平缓甚至轻微下滑说明过多的专家会引入路由混乱专家数量与多样性之间存在一个最优平衡点。**十、这套系统还存在哪些局限**研究团队在论文中对SmartMage的局限性进行了坦诚的讨论。一方面大型语言模型有词元数量的预算限制这迫使系统必须对各种模态的输入进行压缩。FoVSR算法虽然能高效筛选关键帧但可能遗漏某些视角独特的重要帧导致空间上下文不完整。点云的最远点采样策略在保持覆盖均匀性的同时不可避免地降低了精细物体的点密度对小型结构的表示能力有所削弱。另一方面系统的性能部分受制于训练数据的质量。ScanNet数据集中存在模糊的多视角图像和不精确的标注这些噪声会在需要精细空间判断的任务上造成明显的干扰。研究团队展示了两个典型的失败案例一个是标注歧义造成的错误两个外观和位置都相似的物体同时满足描述条件系统选中了其中一个但标注答案是另一个另一个是光照不一致导致的颜色感知错误场景中不同区域的光照差异使系统对物体颜色产生了误判。这两类失败案例揭示了未来需要重点攻克的方向如何提升对歧义描述的处理能力以及如何增强对视觉外观变化的鲁棒性。---说到底SmartMage回答的是一个看似简单却长期被忽视的问题AI在理解三维世界时真的需要同时看所有东西吗答案是否定的。通过让系统学会看问题选工具再让内部的专家团队各司其职研究团队在五项权威基准上全面刷新了纪录同时还让训练速度提升了两到三倍。这项研究对AI与三维世界交互方式的影响或许比单纯的性能数字更为深远。随着具身智能能够在物理空间中自主行动的AI逐渐成为技术前沿的热点方向像SmartMage这样懂得按需感知、精准推理的系统将是让机器人真正理解室内环境、与人自然协作的重要基础。未来某天当一个家用机器人被你问到沙发是什么颜色和桌子在床的哪边时它或许就会用类似SmartMage的方式从容地切换感知工具给出既准确又高效的回答。感兴趣深入了解技术细节的读者可以通过arXiv编号2608.05137查阅完整论文。---QAQ1SmartMage和普通的多模态AI模型有什么区别A普通多模态AI会把所有感知数据彩色图像、深度图、点云等无差别地同时输入模型SmartMage则根据用户问题的语义动态决定该使用哪几种数据比如颜色类问题主要使用彩色图像形状类问题则更多依赖点云数据避免了无关信息的干扰也降低了计算浪费。Q2SmartMage的SMART模块是如何判断应该调用哪些感知模态的ASMART综合三种信号做判断首先分析问题文本属于哪类语义颜色、位置、形状等推断该类问题通常偏好哪些模态其次计算每种模态当前内容与问题的语义相似度最后评估每种模态的数据质量是否可靠。三者加权融合后系统选出最相关的模态组合排除干扰。Q3ScanFacet是什么数据集它有什么特别的用途AScanFacet是研究团队专门构建的诊断基准数据集将现有3D场景理解问答数据重新分成颜色、位置、材质、数量、形状、物体类型、空间关系和其他八个语义类别共7936条数据。它的用途不是训练而是精细分析不同感知模态组合对不同类型问题的贡献帮助研究者理解模态与语义之间的深层关联规律。