完整版本:搭建 AI 知识库前,先完成这 7 步需求分析
目录一、AI 知识库解决的是什么问题二、第一步选择一个值得做的场景三、第二步明确用户、问题和边界四、第三步盘点知识来源1. 资料是否有效2. 是否存在冲突3. 是否有负责人4. 是否涉及敏感信息5. 是否允许不同用户访问五、第四步建立一组真实问题六、第五步设计文档处理方式文档解析文本切块添加元数据七、第六步设计回答流程八、第七步确定评估指标和业务价值检索指标回答指标使用指标业务指标九、知识库的三类核心价值1. 让 AI 回答有依据2. 让知识能够持续复用3. 降低重复查找和咨询成本十、最小可行知识库怎么做十一、常见误区误区一先把所有文档上传再说误区二只测试几个演示问题误区三只做向量检索误区四认为知识库能彻底消除幻觉误区五上线后不再维护总结很多团队决定做 AI 知识库后第一反应是选哪个大模型用哪个向量数据库文档应该切成多大这些问题当然重要但不是第一步。真正应该先回答的是谁会使用这个知识库他们要解决什么问题哪些资料可以作为答案依据怎样才算回答正确知识库上线后能产生什么业务价值如果这些问题没有想清楚即使技术链路全部跑通最后也可能只是做出一个“可以聊天但没人愿意用”的系统。一、AI 知识库解决的是什么问题企业内部通常不缺文档真正缺少的是快速、准确地使用文档的能力。常见情况包括文档散落在飞书、Wiki、网盘和聊天记录中同一个问题在不同文档中存在多个版本员工知道答案存在但不知道应该搜索什么关键词新员工频繁询问重复问题客服、研发和运维需要反复查找处理流程大模型不了解企业内部资料只能根据通用知识回答。AI 知识库的作用是把这些分散的资料整理成可以检索、引用和持续更新的知识来源。当用户提问时系统先查找相关资料再让大模型根据资料生成答案并尽量给出引用来源。它的目标不是“把所有文件都上传”而是让特定用户在特定场景下更快地获得有依据的答案。二、第一步选择一个值得做的场景知识库不适合从“全公司所有文档”开始。更合理的做法是先选择一个范围明确、问题高频、资料相对完整的场景。可以从四个维度判断判断维度需要回答的问题使用频率这个问题每周会出现多少次时间成本当前每次查找或咨询需要多久知识质量是否存在相对可靠的标准文档错误成本回答错误会带来多大影响适合作为第一个知识库的场景包括新员工制度问答产品使用手册问答内部 API 文档查询常见故障处理客服标准问答销售产品资料查询。不适合作为第一个场景的情况包括问题一年只出现几次答案主要依赖个人判断资料严重缺失或互相矛盾每次处理都必须访问实时业务系统回答错误可能直接导致严重安全事故。例如“公司报销制度问答”通常比“自动诊断所有线上故障”更适合作为第一个知识库项目。三、第二步明确用户、问题和边界场景确定后需要写清楚谁会用、问什么、系统不能做什么。可以填写下面这张需求卡知识库名称 ​ 目标用户 ​ 主要使用场景 ​ 用户最常问的问题 ​ 答案来自哪些资料 ​ 系统可以回答什么 ​ 系统不能回答什么 ​ 资料不足时应该怎么处理 ​ 是否必须显示引用来源例如知识库名称研发故障处理知识库 ​ 目标用户开发工程师和值班人员 ​ 主要场景线上出现告警后查询处理方法 ​ 常见问题 1. API返回401应该如何处理 2. Redis连接超时应该检查什么 3. 消息积压时应该如何排查 ​ 答案来源 故障处理手册、历史复盘报告、值班记录 ​ 可以回答 已有文档中明确记录的排查步骤 ​ 不能回答 直接修改生产数据、自动执行高风险命令 ​ 资料不足时 明确提示“现有资料中没有找到可靠答案”并建议联系负责人 ​ 引用要求 必须显示文档名称和更新时间这一步非常重要。如果不规定边界知识库很容易把“没找到资料”变成“根据经验编一个答案”。四、第三步盘点知识来源知识库的效果上限首先取决于原始资料而不是模型。建议建立一份资料清单资料名称存储位置负责人更新时间可信度权限故障处理手册内部 Wiki运维组2026-07高研发可见历史工单工单系统客服组持续更新中客服可见聊天记录群聊无明确负责人不确定低不建议直接入库盘点时重点检查五件事。1. 资料是否有效过期流程、废弃接口和旧制度不能与新版本同时作为答案依据。2. 是否存在冲突如果两份文档对同一问题给出不同答案需要先确定哪个版本有效。3. 是否有负责人每类知识都应该有维护人。没有负责人知识库很快就会变成过期资料仓库。4. 是否涉及敏感信息客户资料、员工隐私、密钥、生产账号等内容不能不加处理地进入知识库。5. 是否允许不同用户访问权限不能只在聊天页面控制还必须在检索阶段进行过滤。普通员工不应该检索到管理层文档外部客户也不能看到内部处理记录。五、第四步建立一组真实问题很多团队先上传文档最后才开始测试。更好的顺序是在开发知识库之前先收集一批真实问题。可以从以下地方整理员工历史咨询客服工单搜索记录新人培训问题运维告警记录群聊中的重复提问。第一版可以准备 30100 个问题每个问题记录问题 ​ 标准答案要点 ​ 答案来源 ​ 允许引用的文档 ​ 不应该返回的内容 ​ 资料不足时是否应该拒答例如问题API返回401应该怎么办 ​ 标准答案要点 1. 检查Token是否过期 2. 调用刷新接口获取新Token 3. 刷新失败时重新登录 ​ 答案来源 《API鉴权手册》第3章 ​ 不应该返回 生产环境账号、密钥或未经确认的接口地址这组问题就是知识库的最小评测集。以后更换 Embedding 模型、调整切块方式或者修改提示词都应该重新运行这组问题而不是只挑一两个成功案例展示。六、第五步设计文档处理方式需求和资料确定后才进入文档处理阶段。一个基本流程是文档采集 → 文档解析 → 清洗与去重 → 文本切块 → 生成向量 → 保存向量和元数据 → 建立检索索引文档解析系统需要从 PDF、Word、网页或 Markdown 中提取正文。扫描版 PDF 还需要 OCR。解析完成后要检查标题是否保留表格是否错位代码块是否完整页眉页脚是否被当成正文图片中的关键信息是否丢失。文本切块不要简单按照固定字符数机械切分。一个文本块最好能够独立表达完整知识。例如下面这段内容不应该被拆开问题API返回401。 ​ 原因Token可能已经过期。 ​ 处理方法调用刷新接口获取新Token。如果只检索到“调用刷新接口”却没有问题背景模型可能无法正确使用。切块时可以优先按照标题章节段落问答对操作步骤代码或表格边界。进行拆分。添加元数据每个文本块至少应该保存文档名称章节标题原文地址更新时间文档版本负责人部门访问权限内容类型。元数据不仅用于展示引用也用于权限过滤、版本控制和限定搜索范围。七、第六步设计回答流程知识库不是把文档存入向量数据库后就结束了。一次完整问答通常包括用户提问 → 判断问题类型 → 检索相关资料 → 关键词与向量结果融合 → 对候选资料重新排序 → 根据权限过滤 → 大模型生成答案 → 返回引用来源生产环境还应明确以下规则只能根据检索资料回答资料不足时必须拒答不能把猜测写成确定事实必须显示来源和更新时间多个资料互相冲突时应该提示冲突高风险操作必须要求人工确认。可以使用这样的回答提示词请只根据参考资料回答用户问题。 ​ 要求 ​ 1. 不得补充参考资料中不存在的事实。 2. 如果资料不足请回答“现有知识库中没有找到可靠答案”。 3. 如果资料存在冲突请分别说明不同版本。 4. 回答后列出引用文档名称。 5. 涉及删除数据、修改权限或生产操作时只提供检查建议不直接生成执行指令。八、第七步确定评估指标和业务价值知识库上线后不能只看“回答听起来不错”。至少应该评估四类指标。检索指标正确资料是否进入前 k 条结果第一条结果是否相关权限过滤是否正确过期资料是否仍被召回。回答指标答案是否覆盖关键要点是否忠于原文是否正确引用来源资料不足时是否拒答是否泄露无权访问的信息。使用指标有多少目标用户真正使用用户是否继续追问用户是否点击引用来源问题是否最终解决。业务指标平均查找时间是否降低重复咨询数量是否减少客服平均处理时长是否下降新人独立解决问题的时间是否缩短人工转接率是否下降。例如可以设定这样的 MVP 目标目标用户20名值班开发人员 评测问题50个真实故障问题 目标 80%以上的问题能召回正确文档 回答必须附带来源 高风险问题必须拒绝自动执行 平均资料查找时间从15分钟降低到3分钟有了明确指标才能判断知识库是否真的创造了价值。九、知识库的三类核心价值1. 让 AI 回答有依据知识库为 RAG 提供可检索资料使大模型可以根据企业内部文档回答并展示来源。它可以降低幻觉风险但不能完全消除幻觉因此仍然需要评测、权限和拒答机制。2. 让知识能够持续复用一份经过清洗、分类和权限处理的资料可以被多个应用使用例如内部问答助手客服助手运维助手销售资料助手员工培训助手。但“一次入库”并不代表永远不需要维护。文档更新后知识库也必须同步更新。3. 降低重复查找和咨询成本知识库可以减少查找文档、重复回答和人工转接的时间。它更适合处理高频、标准化、有可靠资料依据的问题而不是替代所有专家判断。十、最小可行知识库怎么做第一版不要追求覆盖所有部门。可以按照下面的范围启动一个明确场景 一类目标用户 一批可靠资料 30100个真实问题 一个检索入口 一套引用和拒答规则 一组可以量化的指标推荐实施顺序选择一个高频场景收集真实问题整理对应文档清理过期和冲突内容设计切块和元数据建立检索与回答流程使用真实问题评测小范围邀请用户试用根据失败案例持续优化证明价值后再扩大范围。十一、常见误区误区一先把所有文档上传再说文档越多不一定越好。大量过期、重复和无关资料会降低检索质量。误区二只测试几个演示问题演示问题通常经过精心挑选不能代表真实使用效果。应该使用历史咨询和真实工单建立评测集。误区三只做向量检索产品编号、错误码、接口名和专业缩写可能更适合关键词检索。实际项目通常需要关键词与向量相结合。误区四认为知识库能彻底消除幻觉知识库只能为模型提供参考资料。如果检索结果错误、资料过期或者提示词约束不足模型仍然可能生成错误答案。误区五上线后不再维护知识库不是一次性项目。文档更新、权限变化和业务流程调整后都需要重新处理相应数据。总结搭建 AI 知识库的第一步不是选择模型或者向量数据库而是回答下面几个问题谁会使用解决什么问题答案来自哪里哪些内容不能回答怎样判断答案正确资料由谁维护上线后创造什么价值先完成场景、资料、权限和评测设计再进入切块、向量化和数据库选型知识库才更可能从“可以演示”变成“真正有人使用”。