RAG 检索深潜:Embedding、Hybrid Search 架构与原理可核对官方文档建议收藏依据 LangChain Retrieval、向量库与 Reranker 集成文档2026-06 快照。与「RAG 科普篇」互补本篇只讲 检索子系统机制。你要解决什么问题30 秒很多 RAG 翻车不在 LLM在 检索没把对的那段拿出来语义搜不到 SKU / 内部代号——纯向量对专有名词弱。Top-K 很大仍漏——chunk 切碎了答案跨块。检索很快但答案仍胡编——没 rerank噪声 chunk 进 context。这篇只覆盖 Ingest 之后到 LLM 之前embed、index、query、hybrid、rerank、评测指标。核心机制检索流水线flowchart LRQ[User Query] -- E1[Query Embedding]E1 -- VS[Vector Search Top-K]Q -- BM[BM25 / Keyword]VS -- FUSE[Hybrid Fusion]BM -- FUSEFUSE -- RR[Reranker Top-N]RR -- CTX[Context Block]CTX -- LLM[Generator]2.1 Chunk 与 metadata决定上限chunk size400–800 token | 太大→噪声太小→断语义overlap10–15% | 无 overlap→答案被拦腰截断切分策略按标题 / 按句 | PDF 乱码未洗metadatadoc_id,section,acl| 无 ACL→越权检索LangChainRecursiveCharacterTextSplitterparent_document_retriever小块检索、大块返回是常见模式。2.2 Dense vs SparseDenseembedding语义相似「离职流程」≈「辞职手续」SparseBM25词项匹配「SKU-8842」精确Hybrid两路各取 Top-K’RRFReciprocal Rank Fusion或 weighted merge → 再 rerank。2.3 RerankBi-encoderembedding快但粗Cross-encoder rerankerCohere Rerank、BGE-reranker对(query, chunk)打分取 Top-NN often 3–5再塞 prompt。Latency 换 precision——生产 RAG 几乎总是 retrieve 宽、rerank 窄。代码长什么样LangChain 栈3.1 向量检索from langchain_openai import OpenAIEmbeddingsfrom langchain_community.vectorstores import Chromaemb OpenAIEmbeddings(model“text-embedding-3-small”)vs Chroma.from_documents(docs, emb, collection_metadata{“hnsw:space”: “cosine”})retriever vs.as_retriever(search_type“similarity”, search_kwargs{“k”: 20})3.2 Hybrid示意from langchain.retrievers import EnsembleRetrieverfrom langchain_community.retrievers import BM25Retrieverbm25 BM25Retriever.from_documents(docs)bm25.k 20ensemble EnsembleRetriever(retrievers[bm25, vs.as_retriever(search_kwargs{“k”: 20})],weights[0.4, 0.6],)3.3 Rerank 包装from langchain.retrievers import ContextualCompressionRetrieverfrom langchain_cohere import CohereRerankcompressor CohereRerank(model“rerank-v3.5”, top_n5)compression_retriever ContextualCompressionRetriever(base_compressorcompressor,base_retrieverensemble,)3.4 进 LCELrag ({“context”: compression_retriever | format_docs, “question”: RunnablePassthrough()}| prompt| model)和「长上下文一把梭」的差别全文档塞 context50 页、要全局推理 | 成本、lost-in-middle纯向量 RAG语义 QA、库大 | 专有名词、表格Hybrid Rerank企业 Wiki、中英混排 | 多两次 API/延迟GraphRAG 等全局关系推理 | 构建成本高三个失败案例A. Recall5 低但 embedding「没问题」现象标准答案段落进不了 Top-5。原因chunk 把答案拆到两块或 query 与 doc 语言不一致英问中 doc。怎么查golden set 标注gold_chunk_id调 overlap / parent retriever。B. 检索对了生成仍错现象context 含答案LLM 瞎编。原因prompt 未强制「仅根据 context」或 rerank 后仍混入 15 段噪声。怎么查减 N加 citation 格式测「拒答率」。C. Hybrid 更差现象加 BM25 后效果降。原因权重不当中文分词未适配BM25 索引未更新。怎么查grid search weights单独测 BM25-only vs dense-only。最小可运行路径准备 20 条(question, gold_passage)goldenChroma small embedding算 Recall5加EnsembleRetriever对比 Recall加CohereRerank或本地 reranker算 MRR5接 LCEL RAG测 end-to-end accuracyLLM judge 或 exact match通过标准Recall5 0.8 再调 prompt否则别怪模型。生产还要加什么增量索引upsert bydoc_id删 doc 要删向量ACL filterwhere{tenant_id: ...}缓存query embedding 缓存 5min监控retrieval latency、empty result rate、avg rerank score版本embedding 模型变更 → 全量 re-embed读完自检Hybrid 解决的是 embedding 的哪类失败为什么 retrieve 要宽、rerank 要窄RecallK 和最终答案准确率为什么不等价「职场AI技能」AI 技能深潜 · 架构与原理 · 可核对文档这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容