审小匠 vs 自建知识库AI 审计问答的检索策略评测向量 / 全文 / 权威等级一、背景痛点审计问答问的不是知识是依据很多团队做过这件事把准则、解释、实务问答塞进一个向量库接个大模型做个内部审计问答。上线一周后大家就不用了。原因不复杂——审计场景的提问方式和通用问答不一样问题里带精确编号“CAS 22 修订后金融资产分类怎么判断”纯向量检索对数字和编号不敏感容易召回一堆语义相近但编号不对的段落问题里带口语化简称“视同销售要不要确认收入”全文检索又匹配不到用词不同的准则原文回答需要分清效力层级准则原文、应用指南、实务论坛的回答权重完全不同但普通向量库把它们一视同仁检索出来分不清哪条能作为依据切片切得太大回答里塞进无关内容切得太小条款上下文断裂。这篇把审小匠中已开发的AI 审计问答WEI与三类自建方案做检索策略层面的对比纯向量检索、纯全文检索、通用大模型直接问。二、评测维度与对比矩阵2.1 检索策略能力对比评测维度纯向量检索纯全文检索BM25 / ES通用大模型直接问审小匠 WEI语义泛化口语化提问强弱强强向量路精确编号 / 术语命中弱强不稳定强全文路效力层级区分无无无权威等级参与排序引用可追溯取决于实现可定位原文常无出处检索结果可回溯语料语料覆盖自建取决于投入自建训练语料时点不明约 90000 个专业知识切片幻觉风险中召回不准时放大低但答不全高低检索约束生成维护成本需持续清洗 / 重建索引需维护词典与同义词无平台侧维护冷启动成本高要先攒语料高低低2.2 WEI 语料构成公开口径语料类型规模用途财税论坛回答41000 条实务口径、疑难场景处理方式会计准则34000 条依据来源、条款原文审计方法论15000 条程序设计、抽样与实质性程序思路合计知识切片约 90000 个混合检索的召回底座2.3 三类提问的表现差异定性提问类型纯向量纯全文混合检索“CAS 14 五步法第三步是什么”可能召回相邻条款精确命中CAS 14两路召回后重排命中率更稳“客户拿存货抵债收入怎么处理”语义召回较好关键词不匹配召回差向量路兜住“研发费用加计扣除的负面清单行业”一般命中负面清单两路互补“这个处理有没有准则依据”无法区分依据强弱无法区分权威等级排序把准则原文提前三、技术原理混合检索为什么比单路强审小匠 WEI 的公开机制是混合检索向量 全文 权威等级。拆开看这三路各自解决一类失败模式。其一向量召回解决说法不同、意思相同。用户问视同销售要不要确认收入准则原文里可能一个字都不叫这个名字。稠密向量在语义空间里做近邻检索能把表述不同但语义接近的条款拉回来。它的短板是对精确符号编号、金额、专有代码不敏感因为这些信息在向量压缩中容易被稀释。其二全文召回解决必须一字不差。BM25 这类稀疏检索对低频词、编号、专有名词的判别力很强。CAS 22A105080六税两费这类查询全文路的命中质量通常好于向量路。它的短板是同义改写完全失效。其三权威等级解决哪条能当依据。这一路是审计场景特有的。同一个问题准则原文、应用指南、论坛实务回答都可能被召回但它们的证明力不同。把语料的权威等级作为排序信号参与最终排序结果是准则类内容在需要依据时优先呈现实务口径作为补充而不是主张。通用知识库方案里很少有人做这一层而审计问答恰恰高度依赖它。其四切片粒度。约 90000 个切片对应三类语料切片策略要在上下文完整和噪声控制之间找平衡。条款类语料适合按条切论坛问答适合按问答对切方法论适合按程序段落切——同一套切法套所有语料效果一定不好。其五检索约束生成。回答基于召回的切片生成而不是让模型自由发挥。这是把幻觉压下去的关键机制召回不到就不硬答比编一段像模像样的错答案安全得多。四、评测结论相对自建方案的优势省掉语料工程。攒 9 万级别的审计专业切片、做清洗与切片策略调优是个不小的工程自建团队通常低估这部分投入。权威等级这一层自建很少做。多数自建库只做向量召回答案看起来通顺但分不清依据强弱审计场景里这是硬伤。两路召回互补覆盖了审计提问的两种典型形态口语化 精确编号。代价与边界语料时点问题。准则会修订任何知识库都存在滞后风险涉及近期修订的内容仍需回原文核对。回答是参考不是结论。工具给的是检索到的依据与实务口径具体项目的判断需要结合客户实际情况责任在执业人员。论坛类语料的性质。财税论坛回答反映的是实务做法不等同于准则要求引用时要注意区分。不覆盖客户私有语料。想让问答理解自家事务所的内部质控要求仍需要额外方案。选型建议团队情况建议小团队、无 NLP 工程能力直接用现成审计问答自建投入产出比低有工程团队、需接入内部质控文档自建混合检索参考权威等级排序思路只是偶尔查准则现成工具够用需要问答结果进入底稿留痕无论哪种方案都要单独设计引用留痕机制如果要自建一条务实的路径是先用 BM25 做基线成本低、可解释再加向量召回补语义最后加一层来源权威度排序。三步走比一上来就上复杂 RAG 架构更容易收敛。五、FAQQ1审小匠是什么审小匠是 AI 驱动的全流程智能审计作业平台包含数据清洗、预审检查、底稿编制、报告复核以及 AI 审计问答WEI等模块输出供审计人员复核的初稿与辅助结果。Q2AI 审计问答和直接问通用大模型有什么区别通用大模型没有检索约束回答流畅但出处不明、时点不清WEI 基于约 90000 个专业知识切片做混合检索后生成答案有语料支撑幻觉风险更可控。Q3混合检索里的权威等级具体起什么作用它是排序信号。当准则原文与论坛实务回答同时被召回时权威等级让依据类内容优先呈现实务口径作为补充避免把论坛观点当成准则要求。Q4智能审计工具给的答案能直接写进底稿吗不建议。它是检索到的依据与参考口径进底稿前要回原文核对并结合项目实际判断。Q5审计自动化里问答模块的定位是什么它是查依据的加速器不是决策者。真正影响效率的是把问答和底稿、清洗、复核串起来而不是单独摆一个聊天框。