RAG 的效果70% 取决于分片质量。这是业内共识但真正讲清楚怎么分、为什么这么分的系统性内容并不多。这篇就是来解决这个问题的。一、RAG 是什么为什么需要分片RAG 这个概念这两年被频繁提及但很多人对它的理解还停留在表面。在讲分片之前先说清楚一件事RAG 到底是什么RAGRetrieval-Augmented Generation检索增强生成是目前最主流的大模型落地架构之一。它的核心思想很简单不给大模型讲它不知道的东西而是让它自己去找。具体来说RAG 的工作流程是四步建库把你的文档切分成小块转成向量存入向量数据库检索用户提问时把问题也转成向量在数据库里找最相似的那几块增强把检索到的内容拼到提示词里作为上下文生成大模型基于原始问题 检索到的上下文生成回答画个流程图用户提问 ↓向量检索 → 找到最相关的文档片段 ↓拼接到提示词中原始问题 片段 ↓大模型生成回答那分片Chunking在整个流程中扮演什么角色分片是 RAG 第一步建库时的核心操作。分片质量直接决定检索精度——这个说法不是夸张。打个比方最直观RAG 系统 一家图书馆文档 一本书分片 你把书拆成章节还是切成页向量检索 图书管理员帮你找相关内容大模型 借书的学生书切成太碎的纸片管理员找不到完整章节学生读到的是断章取义的片段。把整本书塞给管理员检索效率低大量无关内容稀释重点。刀工不好要么切碎了拼不回原样要么块太大塞不进锅。分片直接决定了检索精度——用户的问题能不能找到最相关的片段上下文完整性——检索到的内容是否包含完整的语义单元Token 成本——分片太大浪费 Token分片太小丢失信息向量质量——向量模型对短文本的理解能力 vs 对长文本的稀释效应二、分片的本质矛盾分片的核心矛盾有三个。矛盾一粒度 vs 完整性分太细单个分片语义不完整检索到的是碎片信息LLM 无法独立回答分太粗单个分片包含大量无关信息稀释了向量表示检索精度下降矛盾二检索精度 vs 上下文覆盖精确检索需要小分片确保向量表征高度聚焦上下文完整需要大分片确保检索结果包含足够的回答信息矛盾三通用性 vs 场景适配法律文档需要严格按段落切分技术文档需要保持代码块完整性FAQ 适合按问答对切分学术论文需要按章节切分没有万能的分片策略。三、常见分片策略详解1. 固定长度分片Fixed-Size Chunking思路按固定字符数或 Token 数切分。我是一家科技公司... → 每 512 个字符一刀切实现简单性能最高分片大小可控经常从句子中间切断语义断裂不区分内容结构适合快速原型或者对精度要求不高的场景。最佳实践中文建议 200-500 字符英文 256-512 Token设置 overlap重叠30-50 字符避免边界信息丢失不要设太大向量模型对长文本的表征能力会下降2. 分隔符分片Delimiter-Based Chunking思路按文档自然结构切分。# 按段落切分chunks text.split(\n\n)# 按标题切分Markdown# 注意中文文档标题如 # RAG 原理后面没有空格需要去掉 \schunks re.split(r(?^#{1,6}\s{0,1}), text, flagsre.MULTILINE)尊重原文结构语义完整性好对结构化的文档效果极佳遇到没有标题的长段落就懵了不同文档格式PDF、Word、HTML需要不同的预处理适合 Markdown 文档、技术手册、结构化知识库。3. 递归分片Recursive Character Chunking⭐LangChain 的经典实现。按优先级从粗到细尝试切分1. 先按段落切分2. 段落太长 → 按句子切分3. 句子太长 → 按单词切分4. 单词还太长 → 按字符切分这是 LangChain 默认的RecursiveCharacterTextSplitter的实现逻辑。自适应粒度兼顾完整性和精度内置 overlap 机制经过大规模验证工业级可靠不真正理解语义只是物理切分遇到跨段落的连贯内容可能切断大多数项目的起点。先从它开始后续再优化。4. 语义分片Semantic Chunking思路利用 embedding 模型检测语义边界。当两个相邻文本片段的语义差异超过阈值时在此处切分。核心逻辑计算相邻句子间的语义相似度 → 如果相似度低语义跳跃大→ 在此处切分 →如果相似度高 → 合并到同一片段真正的语义边界切分后每个片段内主题一致避免从连贯段落中间切断分片大小自适应不需要硬编码需要调用 embedding 模型速度较慢阈值调优需要实验计算成本高不适合海量文档预处理对检索精度要求高、文档结构不规则的场景。最佳实践cosine similarity 阈值设为 0.7-0.85可先粗切分再在粗分片内做语义细化配合 overlap 使用效果更好5. 基于结构的分片Structure-Aware Chunking思路利用文档本身的层级结构标题层级、表格、列表、代码块等进行智能切分。示例Markdown按#标题层级切分HTML按section、article切分PDF识别章节结构代码按函数/类定义切分最大程度保留原文结构特别适合有明确层级结构的文档每种文档格式需要专门解析解析质量直接影响分片质量6. 按问答对分片QA Pair Chunking思路将 FAQ、问答文档直接按问题-答案对切分。与用户查询意图天然对齐检索精度较高只适用于有明确问答结构的文档开放式文档无法使用如果原始数据就是 QA 格式直接按问答对切。原始数据是长文档的话可以先用 LLM 做反向提取——自动生成问题形成 QA 对。长答案超过 1000 字可按子段落拆分但每个子段落要补全父问题上下文。overlap 设为 0-10%。四、Overlap重叠的必要性分片时 overlap 基本是必选项。overlap 解决两个问题防止边界信息丢失一个关键信息可能在两个分片的交界处保持上下文连续性检索到的片段不会因为刚好切在中间而丢失开头固定长度分片10-20%递归分片LangChain 默认 20%语义分片5-10%overlap 越大存储和检索成本越高五、分片大小的选择指南经验法则场景推荐大小字符/Token说明中文文档200-500 字符中文一个字通常就是一个 Token英文文档256-512 Token英文一个词平均 1.3 Token代码文档按函数/方法保持代码逻辑完整性学术论文按段落/小节200-800 字符FAQ按问答对无固定大小为什么不要太大向量表征稀释——embedding 模型是为短文本优化的过长会导致语义模糊Token 浪费——检索到大分片后LLM 需要处理更多无关 Token检索精度下降——大分片包含更多噪声向量相似度计算不准确为什么不要太小语义不完整——检索到的片段无法独立回答存储成本翻倍——分片越多向量库越大上下文碎片化——LLM 需要拼接多个片段才能理解六、不同场景的分片策略场景一QA / 知识库问答典型场景企业帮助文档、产品 FAQ、客服知识库推荐策略问答对分片把每一个问题答案对当成一个完整的分片单元。用户提问时意图明确——“怎么重置密码”、“API 密钥在哪找”。如果按传统方式把整个文档切成一段段检索时可能找到包含答案但夹杂大量无关信息的段落或者把答案和前面的背景说明切断。问题和答案天然在一起检索到的分片本身就包含完整的回答逻辑。最佳实践如果原始数据就是 QA 格式直接按问答对切overlap 设为 0如果是长文档可以先用 LLM 做反向提取——自动生成问题形成 QA 对每个 QA 分片建议附加元数据标签、分类、难度级别答案很长超过 1000 字的话可以按子段落拆分但每个子段落要补全上下文把父问题加到子段落开头这种策略在客服场景的检索精度通常能达到 90% 以上。场景二技术文档 / API 文档典型场景开发者文档、SDK 使用说明、API 参考推荐策略结构感知分片 代码块保护按文档结构标题层级粗切分同时确保代码块不被切断。技术文档有两个特点有明显的章节层级结构代码块是完整语义单元不能被从中间切断。按固定长度分片很可能把代码块切断检索到的片段既不完整也缺乏上下文。按段落分片又可能把两个相关的 API 说明合并到一个分片里。最佳实践第一层按标题层级切分##一级标题下的内容作为一个大块第二层在标题块内按段落递归切分300-500 Token代码块特殊处理每个代码块单独成 chunk带上对应的说明文字overlap 设为 10-15%附加元数据文档路径、章节名、代码语言类型示例结构chunk-1: [API 概述] 300 字符chunk-2: [GET /users 参数说明] 400 字符 chunk-3: [GET /users 代码示例] 500 Token完整代码块 说明chunk-4: [POST /users 参数说明] 350 字符场景三法律/医疗等合规文档典型场景合同、法规条文、医疗指南推荐策略按条款/段落分片 大 overlap严格按照原文的结构单元切分不要破坏任何逻辑段落。合规文档对完整性要求极高。一段法律条文可能几十行才是一个完整的条款从中间切断后检索到的内容在法律上可能产生歧义。法律文档的措辞非常精确不能有任何增删或模糊。最佳实践按法律条文条款切分“第 X 条”、“第 X 款”overlap 设为 30% 甚至更高分片大小可以稍大800-1500 字符每个分片附加文档名、章节号、条款号不要使用语义分片——法律条文可能表面不相关但法律上紧密关联场景四学术论文 / 研究报告典型场景论文摘要、实验方法、结论分析推荐策略按章节粗切 段落细切 摘要独立论文本身有严格结构利用这个结构就行。最佳实践摘要单独作为一个 chunk——摘要包含论文的完整概览检索准确率极高按章节切分Introduction / Methods / Results / Discussion章节内部按段落递归分片200-400 字符图表引用需要保留上下文引用关系参考文献单独列出不参与向量检索场景五长文本对话 / 聊天记录典型场景客服聊天记录、社群讨论、会议纪要、多轮对话推荐策略按会话轮次分片 语义连贯性合并长文本对话的特点是信息密度波动大同一话题可能跨越多轮对话。最佳实践按会话轮次用户/助手对切分同一话题的多轮对话通过语义相似度合并到同一片段overlap 设为 15-20%——关键信息可能在对话边界附加元数据会话时间、参与者角色、话题标签长对话可以按时间窗口切分如每 30 分钟一段再在时间窗口内按话题合并场景六企业内部知识库混合场景典型场景同时包含产品文档、FAQ、技术规范、会议纪要推荐策略混合策略 分层索引不同性质的文档用不同策略最后统一到一个向量库但带不同标签。最佳实践给文档打上类型标签faq、technical、policy、meetingFAQ 类 → 问答对分片技术规范 → 结构感知 代码保护公司政策 → 条款级分片会议纪要 → 段落递归分片检索时先根据用户意图做文档类型过滤再在过滤结果中做向量检索这就是混合检索的思路场景策略速查表场景核心策略overlap分片大小关键技巧QA / FAQ问答对0-10%按需长答案补全父问题上下文技术文档结构感知 代码保护10-15%300-500 Token代码块独立成 chunk法律/医疗条款级30%800-1500 字符不破坏原文逻辑段落学术论文章节粗切 摘要独立15-20%200-400 字符摘要单独检索长文本对话会话轮次 语义合并15-20%按会话话题标签 时间窗口企业混合库混合策略 分层过滤10-20%按需先分类再检索七、主流开源方案直接用哪些工具/框架。LangChain RAG 框架的事实标准分片模块最成熟。核心组件RecursiveCharacterTextSplitter递归分片推荐首选MarkdownHeaderTextSplitterMarkdown 结构感知SemanticChunker语义分片实验性DirectoryLoaderLoader文件解析 分片一体化社区最大文档最全Star 30k生态最完善与向量数据库、LLM 生态无缝衔接支持几乎所有主流文档格式语义分片仍在实验阶段默认参数可能需要调优新手入门、已有 LangChain 生态的项目、通用场景首选。LlamaIndex 面向检索增强的专门框架分片策略更丰富。核心组件SentenceSplitter基于 NLP 的句子级分片SemanticSplitter基于语义相似度的分片TokenTextSplitterToken 级别的精确分片NodeParser结构感知解析语义分片实现比 LangChain 更成熟原生支持节点Node概念分片即节点对复杂文档结构解析能力更强社区相对 LangChain 较小学习曲线稍陡对语义分片有强需求、文档结构复杂的场景。RAGFlow 国内团队开发的开源 RAG 引擎2025-2026 年 GitHub 上关注量较高的 RAG 项目专注深度文档理解。核心能力基于深度文档理解的 RAG 引擎融合 Agent 能力可视化文本分片支持人工干预和调整分片策略支持 100 种文件格式Word、PPT、Excel、扫描件、图片、结构化数据等多模态解析支持 PDF/DOCX 中的图片理解自动识别文档结构标题、段落、表格、列表、代码块智能检索 重排序融合可追溯的引用来源支持引用溯源可视化分片效果展示——在界面上直观看到分片结果并手动调整一站式解决方案无需自己搭管道可视化分片调整适合需要精细控制的企业场景中文文档理解能力强支持飞书、Discord、Telegram 等多种聊天渠道接入开箱即用的企业团队、需要分片可视化调整的场景、中文文档为主的企业知识库。链接https://github.com/infiniflow/ragflowStar[1] 50kHaystackDeepset德国 AI 公司开发主打工业级部署。核心组件SentenceWindowRetriever基于窗口句子的检索DocumentSplitter多种分片策略EmbeddingRetriever嵌入 检索一体化工业级稳定性生产环境验证充分与 AWS Bedrock 等云服务商深度集成支持多跳检索Multi-hop Retrieval社区活跃度不如 LangChain文档质量相对一般需要工业级稳定性、已有 AWS 生态的团队。自建方案有特殊需求的场景可以选择基于 embedding 模型自建分片管道。完全可控可针对业务场景定制不依赖第三方框架开发和维护成本高需要持续的调优工作有定制分片逻辑需求、团队研发能力强的场景。其他值得关注的项目项目一句话介绍链接GraphRAGMicrosoft 开源基于知识图谱的 RAG用图谱关系增强检索github.com/microsoft/graphragDocling开源文档解析工具支持 PDF/Word/HTML 等格式的结构化提取github.com/docling-project/doclingMinerU开源文档解析工具专注高质量 PDF 解析支持表格/公式提取github.com/opendatalab/MinerUmarkitdown微软开源文档转 Markdown 工具支持 RAG-ready chunkinggithub.com/microsoft/markitdownGraphRAG用图谱结构替代简单向量检索能解决跨段落推理问题MinerU和Docling文档解析层面的新力量解析质量直接影响分片质量markitdown微软开源的轻量级文档转化工具支持 RAG-ready chunking八、进阶技巧1. 元数据增强分片时除了存文本内容还要附加元数据{ content: 分片文本内容, source: 文档路径, section: 章节标题, page: 12, chunk_index: 3, metadata: { doc_type: faq, language: zh, tags: [RAG, 分片] }}检索后可以按文档来源过滤、按章节聚合、排序重排。2. 混合分片策略组合使用效果更好大文档 → 先按章节粗切 → 再在章节内按语义细切技术文档 → 代码块单独成 chunk正文递归分片法律文档 → 按条款切分 overlap 30%3. 分片后验证分片完成后一定要验证随机抽查分片内容确认语义完整检查是否有过长的分片1000 字符需警惕检查边界处是否有信息丢失用少量查询做检索测试看检索质量4. 持续迭代分片不是一次性工作随着使用反馈持续优化用户经常问但回答不准确的 → 检查对应分片质量检索排名靠前的分片 → 分析为什么相关A/B 测试不同分片策略的效果九、常见误区❌ 误区一分片越大越好向量模型是为短文本优化的。过大的分片会导致向量表征模糊检索精度反而下降。❌ 误区二固定长度最简单直接用一刀切经常从句子中间断开丢失上下文。固定长度可以作为起点但生产环境建议至少用递归分片。❌ 误区三一次配置终身受用不同文档类型、不同业务场景需要不同的分片策略。FAQ 用问答对切分技术文档用结构感知切分没有万能方案。❌ 误区四overlap 越大越好overlap 有助于防止边界信息丢失但过大会导致大幅增加向量库存储成本引入大量重复内容影响检索排序 建议 10-20%不超过 30%。❌ 误区五分片是唯一重要的分片只是 RAG 的环节之一。后续的 embedding 模型选择、向量数据库配置、检索策略相似度 vs BM25、重排序Re-ranking同样重要。十、总结RAG 分片的核心原则语义优先——切分后每个分片应该是一个完整的语义单元粒度适中——太小丢失信息太大稀释精度场景适配——没有银弹根据文档类型和业务需求选择策略通用文档 → 递归分片LangChainoverlap 20%Markdown/结构化文档 → 结构感知 递归overlap 15-20%FAQ → 问答对分片overlap 0-10%高精度需求 → 语义分片overlap 10-15%技术/代码文档 → 代码块独立 正文递归overlap 10-20%法律/合规文档 → 条款级分片overlap 30%学术论文 → 章节粗切 摘要独立overlap 15-20%企业混合库 → 混合策略 分层过滤overlap 10-20%分片这件事看起来简单实际做深了非常考验功力。建议先跑通递归分片的 baseline然后根据检索效果的反馈逐步引入语义分片、混合策略等更高级的方案。迭代比完美更重要。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】