题解上线后如何止损把错误类型、耗时与回退接进监控题解检索的麻烦不只是不召回还可能是召回了“看起来像、其实不适用”的材料。滑动窗口混入二分题解时宁可减少上下文并触发拒答也别让模型顺着错误材料补全。把离线评估接到线上监控维护一组带标准答案的查询集按题型、语言和难度分层。每次索引、嵌入模型或分块策略变更后比较 RecallK、MRR、无答案率和人工抽检结果。线上则记录相似度分布、空召回率、引用文档版本和用户反馈这些指标异常时触发告警而不是依赖单一相似度阈值。止损策略阈值应由验证集校准并且与任务绑定。一个可行流程是候选文档不足或分数不稳定时不注入 RAG 上下文改为让模型说明缺少依据。文档与题目 ID、语言或版本不一致时直接过滤。引用内容要求带来源标识回答中的复杂度结论应能回到具体题解或代码推导。索引重建期间使用已验证的只读索引重建完成后用抽样查询验收再切换。func shouldUseContext(problemID string, hits []Hit, minScore float64) bool { if len(hits) 0 || hits[0].Score minScore { return false } for _, hit : range hits { if hit.ProblemID problemID hit.Verified { return true } } return false }这里的minScore不是固定常数换嵌入模型、换语言或换分块方式都应重新校准。对高风险结论增加规则校验或人工审核比调高阈值更可靠。复盘应留下什么每次低质量回答都应能追溯使用了哪些文档、索引版本、检索分数、提示词版本和最终输出。将失败样本回填到评估集能避免同类问题在下一次索引变更后重新出现。