AI 评测系列(04):RAG 评测——RAGAS 四指标实战与一个反直觉发现 RAGAS 四个指标RAGAS(RAG Assessment)是专门为 RAG 系统设计的评测框架,四个指标各自衡量 RAG 流水线的不同环节:Faithfulness(忠实度) → 答案有没有编造上下文里没有的信息? → 低分 = 幻觉风险,模型在"脑补"而不是"检索后生成" → 计算:把答案拆成断言,逐条检查是否在上下文里有支撑 Answer Relevancy(答案相关性) → 答案有没有回答用户的问题? → 低分 = 答案跑题或过于模糊 → 计算:从答案反向生成问题,与原问题计算相似度 Context Precision(上下文精确率) → 检索到的内容里,有多少是有用的? → 低分 = 检索引入了大量噪音,稀释了有用信息 → 计算:每个检索到的 chunk,判断对生成答案是否有贡献 Context Recall(上下文召回率) → 生成正确答案所需的信息,有多少被检索到了? → 低分 = 检索遗漏了关键信息,答案不完整 → 计算:把 ground_truth 拆成断言,逐条检查是否在上下文里四个指标覆盖了 RAG 的两个核心模块:Retrieval(检索)对应 Context Precision + Context Recall,Generation(生成)对应 Faithfulness + Answer Relevancy。实验设计知识库内容:Python 开发规范文档(命名规范、异常处理、性能优化、测试、日志),8 个测试问题 + ground_truth。两个版本对比:Version A(原始): 原始企业文档,含会议纪要、草稿标记、文件引用、历史版本说明 典型企业知识库的"真实状态" Version B(清洗后): 同一内容,经过知识蒸馏处理: → 去除无关元数据(会议时间、作者信息、版本历史) → 结构化为规则列表格式 → 去掉感叹性语言和重复解释 → 专注核心规则内容运行结果RAGAS Evaluation Results ────────────────────────────────────────────────────────────────────── Metric Version A (raw) Version B (clean) Delta ──────────────────────── ──────────────── ───────────────── ────── Faithfulness 1.000 1.000 +0.000 Answer Relevancy 0.732 0.721 -0.011 Context Precision 1.000 1.000 +0.000 Context Recall 1.000 1.000 +0.000 ──────────────────────── ──────────────── ───────────────── ────── Average 0.933 0.930 -0.003预期是清洗版本得分更高:噪音少,检索更准确。实际两个版本几乎没有差异。不是 Bug,是值得分析的发现。为什么两个版本得分相同原因 1:Context Precision = 1.0 的真正含义Context Precision 满分