扫描 36 个热门 MCP 服务器:三分之一未通过测试,揭示生态系统诸多问题 扫描结果对 36 个热门 MCP 服务器扫描结果不理想。优秀A 级的有 brave - search _(已存档)_、exa 等共 15 个较差D/F 级的有 11 个包括 MongoDB 官方服务器等。另外 Stripe、Supabase 无法用虚拟凭证扫描未参与评分。发现 1生态系统存在未记录参数的问题几乎所有 D/F 级服务器在“描述”方面得分零突出规则是 D004 — 参数无描述。如 firecrawl 134 个错误中有 132 个是未记录参数问题根源在于模式生成时没人添加 .describe()。提高代理可靠性要统计无 description 的参数并修复。发现 2关键在于文档规范而非工具列表规模但规模会增加规范难度初步分析显示工具列表小的服务器表现更好但 shrimp - task - manager 有 15 个工具却获 A/96 高分。大型且文档完善的工具列表可行但罕见增加工具会增加规范难度和性能开销。发现 3合规性和可用性是两回事最新服务器不一定最易用已存档的 Slack 参考服务器得分 A/97而一些商业服务器有大量无描述参数。代理可用性是“写作”问题mcpgrade 填补了合规性检查工具的空白。如 context7 修复参数描述后静态得分从 C 级跃升至满分。发现 4我将静态得分与实际模型进行了对比拒绝率令人担忧开发 --eval 功能测试模型对工具的选择和参数填充。结果显示文档完善的服务器工具选择准确率 100%firecrawl 降至 84%错误出现在命名冲突处小型、文档完善的工具列表中模型对超范围任务 100% 正确拒绝firecrawl 的 26 个模糊工具列表中只有 50% 拒绝这可能导致危险故障。优秀服务器的标准每个工具描述应回答功能、使用场景和返回结果每个参数有描述、格式和示例值固定值集合用 enum 定义明确声明 required采用统一命名约定错误信息指明缺失或无效参数。在你的服务器上进行测试可通过不同命令在本地、HTTP 或持续集成中测试还可进行实时模型测试。该工具含 24 条规则可在问题列表提异议。维护服务器提高分数可创建 rescan 问题。