AMIGO基准:多图像智能体定位如何推动AI从感知走向行动
1. 项目概述当AI代理学会“看图说话”与“指哪打哪”最近在AI圈子里一个叫“AMIGO”的基准测试开始被频繁提及。乍一看这个缩写你可能会联想到“朋友”但在多模态AI领域它代表着一个更具挑战性的新方向Agentic Multi-Image Grounding Oracle Benchmark。简单来说它要评测的是AI模型能否像一个具备自主行动能力的“智能体”一样同时理解多张图片并精准地“指”出图片中特定物体或区域的位置。这听起来像是把“看图说话”和“目标检测”结合起来了但AMIGO的野心远不止于此。传统的视觉问答或指代定位任务往往是“一问一答”或“一图一指”模型被动地响应一个明确的指令。而AMIGO引入的“Agentic”概念意味着模型需要具备主动的、多步骤的推理和交互能力。比如我给你三张不同角度拍摄的客厅照片然后问“请找出那个既能放书又能放咖啡杯的家具并告诉我它在每张照片中的位置。” 模型需要先理解“放书又放咖啡杯的家具”指的是茶几或边桌然后主动地在三张图片中分别搜寻、确认这个目标最后输出一组坐标框。这个过程更像是一个智能机器人在通过摄像头环视环境后自主完成任务。为什么这个基准很重要因为现实世界的AI应用无论是家庭机器人、自动驾驶还是工业质检面对的都极少是单一、静止、背景干净的图片。它们处理的是连续的、多视角的、信息可能冗余或互补的视频流或图像集。一个真正的“智能体”需要能从这些海量视觉信息中主动提取关键线索进行空间推理并执行精确的定位动作。AMIGO正是为了衡量模型在这种复杂、动态、需要“智能”参与的视觉 grounding 任务上的能力而设计的。它不满足于模型“看到了什么”更要考核它“如何主动地去看并找到目标”。2. 核心概念拆解Agentic、Multi-Image与Grounding的深度融合要深入理解AMIGO我们必须把它的名字拆开看看每个部分到底带来了什么新的挑战。2.1 Agentic从被动响应到主动规划“Agentic”是当前AI研究特别是Agent和RAG领域的一个热词。它强调AI系统应具备自主性、目标导向性和序列决策能力。在AMIGO的语境下这体现在任务设计上多轮交互与状态维持任务可能不是一次性下达的。智能体可能需要先根据初始指令如“找到红色的物体”进行一轮搜索和定位然后根据反馈如“不对我要的是亮红色不是暗红色”调整策略进行第二轮更精确的搜索。这要求模型具备对话历史和任务状态的记忆与理解能力。主动感知与信息查询智能体可能被允许主动“提问”以澄清模糊指令。例如当指令说“找到那个工具”时如果场景中有锤子、螺丝刀等多种工具智能体可以反问“您指的是哪个工具请描述它的特征。” 这种主动寻求信息的能力是高级智能的关键。规划与分解复杂任务面对“找出所有可能装有液体的容器”这样的指令智能体需要规划一个搜索策略先识别所有容器类物体杯子、瓶子、碗再逐一判断其状态是否为空、是否有液体痕迹。这是一个需要分解和排序的子任务序列。注意AMIGO中的“Agentic”并非要求模型必须控制一个物理机器人去移动摄像头。更多是在推理层面模拟智能体的行为即模型内部需要模拟“注意力的转移”、“假设的生成与验证”、“行动此处指视觉搜索序列的规划”。2.2 Multi-Image超越单帧理解的视觉推理“Multi-Image”是AMIGO区别于传统数据集的根本。它要求模型处理两张或更多相关图像。这些图像可能来自同一场景的不同视角如一个物体的前、后、左、右视图。这考验模型的多视角几何理解和物体完整性的心理构建能力。同一场景的不同时间点如一个房间整理前和整理后的对比。这引入了动态变化理解模型需要识别什么物体被移动、添加或移除。语义相关但视觉不同的场景如“各种款式的椅子”、“不同天气下的街道”。这要求模型进行更高层次的语义归纳和跨图像类比。处理多图像的核心挑战在于信息融合与冲突解决。一张图片里被遮挡的物体可能在另一张里清晰可见一张图片里的模糊区域可能在另一张里是高分辨率。模型需要像人脑一样自动将这些碎片信息拼接成一个更完整、更可靠的3D场景或事件理解而不是简单地对每张图独立处理再投票。2.3 Grounding精准的空间锚定“Grounding”在这里特指视觉定位即将自然语言描述如“左上角那只打哈欠的猫”映射到图像中具体的像素区域bounding box或 segmentation mask。这是连接语言与视觉的桥梁。AMIGO将 grounding 的难度提升到了新的层次跨图像指代指令可能是“找出在第一张图出现但第二张图消失的物体”。模型必须先分别在两张图中进行 grounding然后进行集合运算差集。关系性 grounding指令涉及物体间关系如“找到离窗户最近的那把椅子”。这需要模型在 grounding 多个物体窗户、所有椅子的基础上进行空间关系计算距离比较。基于推理的 grounding目标物体可能不能直接通过属性描述识别而需要推理。例如“找到可能用来修理这个破损桌子的工具”。模型需要先 grounding “破损的桌子”推理出修理动作如拧螺丝、敲打再 grounding 出符合该动作的工具螺丝刀、锤子。AMIGO的“Oracle”一词暗示了这个基准旨在评估模型在理想条件下给定清晰的多图像输入和指令的 grounding 能力上限为未来更复杂的具身智能任务打下基础。3. 基准构建的核心挑战与设计思路构建AMIGO这样的基准远比收集一个传统的图像标注数据集复杂。它需要精心设计任务范式、数据结构和评估指标。3.1 任务范式设计模拟智能体交互AMIGO的任务很可能被设计成一个交互式仿真环境中的挑战。虽然最终提交的可能是静态的测试集但其数据生成过程模拟了智能体交互场景构建使用3D引擎如Unity、Unreal或高质量的仿真平台如Habitat、AI2-THOR生成复杂的室内外场景。这样可以确保获得同一场景精确的多视角渲染图并且所有物体的3D位置、属性都是已知的“Ground Truth”便于自动生成复杂的指代指令和 bounding box 标注。指令生成通过模板或大语言模型生成多样化的、涉及多图像和多步骤推理的指令。例如简单检索“在所有这些图片中找出包含沙发的图片并框出沙发。”跨图像存在性判断单图 grounding复杂比较“对比图A和图B找出所有位置发生了变化的物体并分别在两幅图中框出它们。”变化检测双图 grounding推理定位“根据这三张厨房不同角度的照片推断出冰箱门打开的方向并框出冰箱门把手。”3D推理功能性 grounding动作空间定义对于“Agentic”部分模型可能需要输出一个动作序列。在AMIGO的评测中这个“动作”可能被简化为关注点坐标模型下一“步”应该关注图像的哪个区域模拟眼动。提问模型生成一个澄清性问题文本。最终 grounding 输出输出一组 bounding boxes每个目标图片对应一个或多个框。3.2 数据集的关键属性一个合格的AMIGO数据集应具备以下属性以确保其挑战性和实用性属性描述为何重要视觉多样性场景、物体、光照、视角、遮挡程度高度多样。防止模型过拟合特定背景或视觉模式确保泛化能力。语言复杂性指令涵盖多种语法结构、词汇包含模糊指代、否定、并列、关系从句等。考验模型深层的语言理解与视觉关联能力。推理深度任务需要常识推理、空间推理、物理推理或多步逻辑推理。区分“模式匹配”的模型和真正“理解”的模型。标注粒度不仅提供 bounding box可能还包括物体ID跨图像的同一实例、属性、关系等丰富标注。支持更精细的任务设计和评估如实例追踪、关系问答。规模与分割足够大的训练集、验证集和具有挑战性的测试集可能包含新颖组合或分布外样本。保证模型可学习并能公平评估其真实能力。3.3 评估指标超越简单的IoU传统的 grounding 任务常用交并比IoU来衡量预测框与真实框的重合度。对于AMIGO单一的IoU远远不够需要一套综合指标定位精度平均精度AP或平均召回率AR在不同IoU阈值下如0.5 0.75的分数。这是基础。多图像一致性对于跨图像指代的同一物体模型在不同图片中预测的框其对应的特征是否被模型识别为同一实例这需要引入实例一致性分数。指令跟随度模型输出的 grounding 结果是否严格满足了指令的所有约束例如指令要求“所有蓝色的球”模型是否找全了有没有误检红色的球这可以通过计算约束满足率来衡量。交互效率如果评测交互过程对于需要多轮交互的任务可以用任务完成率与平均交互轮次的加权分数来评估。用最少的问题、最精准的定位完成任务的智能体更优。推理正确性对于需要推理才能定位的任务可以设计“二阶段评估”先评估模型中间推理步骤的正确性如是否正确识别了“需要修理的物体”再评估最终定位的准确性。4. 实现AMIGO任务的主流技术路径与模型架构面对AMIGO的挑战研究者们不会从零开始。他们会基于现有的强大基础模型进行改造和集成。目前主要有几条技术路径4.1 路径一基于大型多模态模型LMM的端到端增强这是最直接的方法。以GPT-4V、Gemini Pro Vision、LLaVA等为代表的LMM已经具备了强大的跨模态理解和生成能力。针对AMIGO可以对它们进行如下增强架构修改将单图像编码器扩展为多图像编码器。可以采用共享权重的ViT分别编码每张图然后通过一个交叉注意力层或简单的拼接方式将多个图像特征序列融合再与文本指令特征一起输入LLM进行理解。输出适配LMM通常输出文本。要让其输出 bounding box需要在解码器头部添加一个定位头。一种常见做法是借鉴“Pix2Seq”或“Detection Transformer”的思想让模型直接回归框的坐标序列[x_min, y_min, x_max, y_max, image_id]。更优雅的方式是采用指代表达分割的方法让模型输出描述目标区域的细粒度 mask 或一组关键点。训练策略预训练阶段在海量的图像-文本对以及现有的 grounding 数据集如RefCOCO、Flickr30k Entities上进行训练让模型学会基本的“语言-区域”关联。指令微调阶段使用AMIGO或类似的合成数据以多图像多轮对话的形式进行指令微调。数据格式类似系统: 你是一个视觉智能体可以分析多张图片并定位物体。 用户: [图片1][图片2][图片3] 请找出在三张图片中都出现的那把椅子。 助手: 我将分析这些图片。首先我在三张图片中识别椅子类物体...内部推理... 我找到了。定位结果如下 - 图片1: [bbox1] - 图片2: [bbox2] - 图片3: [bbox3]强化学习或拒绝采样为了提升“Agentic”能力可以使用强化学习来优化多轮对话中的提问策略或者用拒绝采样从模型生成的多个候选动作中筛选出最优序列。4.2 路径二专精模型协作的Pipeline方案这种方法不追求单一的“全能模型”而是让多个专精模型各司其职通过一个“控制器”来协调。这更符合当前工程实践的思路视觉感知模块使用一个强大的开放词汇目标检测器如Grounding DINO、OWL-ViT或GLIP。这个模块负责接收图像并输出图像中所有显著物体的类别和边界框类别是基于开放词汇的即可以用文本描述来指定类别。场景理解与融合模块接收所有图片的检测结果构建一个统一的场景图。这个图包含跨图像的物体实例匹配判断不同图片中的框是否是同一物体、物体属性、以及物体间的空间与语义关系。语言理解与规划模块通常是一个大语言模型。它负责解析用户指令将其转化为一个可执行的任务计划。例如“找出最大的那个苹果”可能被分解为a) 在所有图片中检测“苹果”b) 计算每个苹果框的面积c) 选出面积最大的那个d) 返回其图片ID和坐标。执行与 grounding 模块根据LLM生成的计划去查询场景图或调用视觉感知模块的特定功能最终计算出需要 grounding 的目标框。这种方案的优劣分析优势模块化易于调试和更新。每个模块都可以使用当前最先进的技术。可解释性强我们可以查看场景图和任务计划来理解模型的决策过程。劣势流程长存在误差累积。检测模块的漏检、误检会直接影响后续所有步骤。模块间通信尤其是将视觉特征传递给LLM可能丢失信息。在需要复杂视觉推理如根据纹理推断材质的任务上流水线可能不如端到端模型灵活。4.3 路径三基于视觉语言模型VLM的检索与增强这是将当前热门的Agentic RAG思想应用到视觉领域。其核心是将 grounding 问题转化为检索问题。构建视觉记忆库对于给定的多张图片先用视觉编码器如CLIP提取所有图像块image patches或区域提议region proposals的特征向量并存储起来同时记录每个特征对应的空间位置候选框。指令查询用文本编码器如CLIP的文本编码器将用户指令编码成查询向量。多模态检索在视觉记忆库中进行稠密检索找出与指令查询向量最相似的视觉特征。由于指令可能复杂这一步可以迭代进行先检索出与指令整体语义相关的图片或区域再以这些区域为上下文细化查询进行更精准的二次检索。定位生成将检索到的Top-K个视觉特征对应的候选框进行融合如非极大值抑制NMS或者用一个轻量级网络基于检索到的特征回归出最终的精确框。这种方法巧妙利用了对比学习预训练模型如CLIP强大的跨模态对齐能力。其“Agentic”体现在检索过程可以多轮迭代模拟了智能体逐步聚焦注意力的过程。5. 实操挑战与模型训练细节无论选择哪条路径在实际构建和训练一个应对AMIGO基准的模型时都会遇到一系列棘手的工程和算法问题。5.1 数据准备与合成获取高质量、大规模的AMIGO风格标注数据是首要难题。完全人工标注成本极高。因此数据合成成为关键手段利用仿真引擎如前所述使用AI2-THOR、Habitat、ThreeDWorld等仿真平台。可以程序化地生成场景、摆放物体、设置相机轨迹、渲染多视角图片。由于场景的所有元数据物体类别、3D位姿、边界框都是已知的可以自动生成无限多样的、标注完美的指令-grounding对。这是目前最有潜力的方向。基于现有数据集的改造对现有的多图像数据集如Street View、室内全景数据集或视频数据集进行采样获取多帧。然后利用强大的Captioning模型和Grounding模型如GRIT自动生成描述和候选框再进行人工清洗和修正。这种方法能获得更真实的图像但标注质量和指令复杂性可能受限。大语言模型生成指令给定一组图片和其基础标注物体列表、位置可以用GPT-4等LLM来生成复杂、多样的指代指令。例如提供给LLM“图片1中有一只猫在沙发上一个杯子在桌子上。图片2中有同一只猫在地板上杯子仍在桌子上。请生成5条需要对比这两张图才能回答的定位指令。” LLM可以生成如“找出从沙发上移动到地板上的物体”这样的指令。5.2 模型训练的关键技巧处理可变数量的输入图像模型需要能处理任意张数的输入图片。一个实用的技巧是使用注意力掩码。将所有图片的特征序列拼接成一个长序列并设置一个注意力掩码允许每张图片内部的token相互关注同时也可以选择性地允许跨图片的token相互关注这对于跨图像推理至关重要。平衡定位与语言任务在训练端到端LMM时定位任务回归坐标和语言理解任务生成文本的损失函数量纲和梯度尺度可能不同。需要仔细调整多任务损失权重或者采用课程学习策略先让模型学好基础的语言-视觉对齐再逐步引入复杂的定位任务。缓解曝光偏差在训练多轮交互的Agentic模型时训练数据提供了标准的“问题-答案”对。但在推理时模型需要自己生成问题。这会导致训练和推理的不匹配曝光偏差。常用教师强制与计划采样结合的方法或者在训练时引入强化学习直接优化任务完成的最终奖励。利用定位预训练不要从头开始训练定位头。可以初始化定位头来自一个成熟的检测器如DETR的相应权重。这能为模型提供一个很好的空间感知先验。5.3 评估与迭代循环构建AMIGO基准本身也是一个迭代过程设立官方基线基准发布者通常会提供1-2个基线模型如基于某LMM微调的版本和其在验证集上的性能。这为社区提供了起跑线。分析模型失败案例在测试集上运行自己的模型后详细分析错误案例比只看总体分数更重要。模型是在多图像融合上失败了还是在复杂指代上失败了是在空间推理上失败了这些分析能指导下一步的模型改进方向。防止过拟合测试集AMIGO的测试集应该被严格保护只允许有限次数的提交评估。研究重心应放在提升模型的泛化能力上例如通过数据增强多视角渲染、语言指令复述、模型正则化、以及使用更大更多样的预训练数据。6. 未来展望与应用场景AMIGO所指向的“多图像智能体定位”能力绝不仅仅是学术界的玩具。它预示着下一代视觉AI系统的核心能力将在众多领域催生革命性应用具身智能与机器人这是最直接的应用。家庭服务机器人需要根据多角度摄像头观察房间理解“把电视遥控器从沙发左边拿到右边”这样的指令。AMIGO正是这类任务的抽象和评测基准。增强现实与交互AR眼镜用户可以用眼神和语言指示“帮我标出视野里所有可以购买的同款鞋子。” 系统需要实时处理视频流可视为连续图像理解指代并 grounding 出目标。内容审核与安全审核员可以给系统一组用户上传的、从不同角度拍摄的疑似违规物品图片问“这些图片里是否包含违禁品如果有请圈出来。” 系统需要综合多张图片信息做出更准确的判断。工业自动化与质检在生产线从多个角度拍摄产品照片质检系统可以执行复杂指令“检查产品表面找出所有长度大于2mm的划痕并标注最严重的三处。” 这需要跨图像检测、测量和排序。视觉搜索与电商用户上传一张心仪家具的局部特写图并说“在我的客厅照片里找一个适合放这个的位置。” 系统需要 grounding 客厅照片中的潜在区域并考虑空间、风格匹配度。我个人在实际探索中的体会是AMIGO这类基准的出现标志着多模态AI研究正从“感知”走向“认知与行动”。它迫使模型不再满足于描述“看到了什么”而是要去解决“如何根据所见去行动”的问题。实现一个在AMIGO上表现优异的模型需要计算机视觉、自然语言处理、推理规划等多个领域的深度结合。目前来看没有银弹。端到端的LMM路径潜力巨大但数据需求高、可控性弱Pipeline路径可解释性强但系统复杂检索路径新颖但精度上限可能受限于预训练模型的对齐能力。在实际工程中我倾向于采用一种混合策略用一个强大的LMM作为“大脑”进行整体理解和规划同时调用一些专精的视觉工具如Grounding DINO做开放检测SAM做精细分割作为“手和眼”。通过让LMM学习调用这些工具的API可以构建一个既强大又相对可控的智能体系统。这条路线的挑战在于如何高效地训练LMM掌握工具的使用时机和方法而这本身又是一个有趣的“工具学习”问题。AMIGO基准无疑将为这个方向的研究提供一块极佳的试金石。