多 Agent 评测怎么做任务集、交接与终止条件多 Agent 演示看着热闹评测时却不能按“聊得挺顺”打分。任务有没有完成、交接有没有丢信息、循环能不能停都要变成可检查的记录。任务集先覆盖协作形态准备单 Agent 可完成、必须转交、工具失败和需要人工接管的任务。每条样本写明允许的工具、终止状态与验收产物不要求固定措辞。指标围绕状态变化分别统计任务完成、无效转交、重复调用、人工接管与成本。总成功率只做概览真正排查要回到每一步的状态和调用参数。为循环设置步数或时间上限。工具返回空结果时走明确分支。评测记录隐藏凭据和敏感参数。固定版本再复跑保存 Agent 配置、模型版本、提示词和工具契约。一次只改一个关键条件否则成功率变化无法归因。多 Agent 不是人越多越聪明。谁负责、何时交接、怎样结束写清楚评测才不会变成围观对话。