RAG文档处理与切分策略:6种分块方式对比,80%的检索问题从这里解决
上一篇我说过80%的RAG项目问题出在检索和文档处理而其中又有40%直接出在切分环节。你可能不信——切分不就是按字符数切嘛能有多大事我之前帮一个团队做法律知识库他们用的固定512字符切分结果一份合同里的甲方权利和甲方义务被切到了两个chunk里。用户问甲方有什么权利检索到的是义务那段模型回答完全跑偏。切分不对检索再准也没用——因为你存进去的东西就是残缺的。今天这篇专门讲文档处理和切分从PDF解析到6种切分策略我把踩过的坑全掏出来。先说PDF解析你以为的文本提取可能是错的如果你的知识库主要是PDF文档先别急着切分——PDF解析本身就是个大坑。常见问题表格丢失很多PDF解析器把表格变成一行行文本列关系全没了多栏排版混乱学术论文的双栏排版解析后左右两栏的文字交叉在一起图片中的文字扫描件PDF文字是图片不是文本普通解析器提取不了页眉页脚混入正文页码、章节标题等噪音被当作正文处理解析工具选型工具特点适用场景PyPDFLoader简单快速纯文本PDF结构简单的文档PyMuPDFLoader保留更多格式信息带表格、图片的PDFUnstructuredLoader支持复杂布局、表格识别复杂排版文档marker开源OCR布局识别扫描件PDFdoclingIBM开源多格式支持企业级文档处理# 简单PDFfrom langchain_community.document_loaders import PyPDFLoaderloader PyPDFLoader(contract.pdf)docs loader.load()# 复杂PDF带表格、多栏from langchain_community.document_loaders import UnstructuredLoaderloader UnstructuredLoader(report.pdf, modeelements)docs loader.load()# Unstructured会自动识别表格、标题、列表等元素我的建议别在PDF解析上省钱。解析质量直接决定后续所有环节的天花板。如果你的PDF很复杂表格多、排版乱用Unstructured或docling简单的用PyMuPDFLoader就行。6种切分策略从粗暴到精细策略1固定长度切分最基础按字符数或Token数切最简单但问题最多from langchain_text_splitters import CharacterTextSplittersplitter CharacterTextSplitter( chunk_size500, chunk_overlap50, separator\n\n, # 优先在段落处切)chunks splitter.split_documents(docs)问题可能在句子中间切断破坏语义。适合对精度要求不高的场景。策略2递归字符切分最常用LangChain的RecursiveCharacterTextSplitter按优先级尝试不同的分隔符from langchain_text_splitters import RecursiveCharacterTextSplittersplitter RecursiveCharacterTextSplitter( chunk_size500, chunk_overlap50, separators[\n\n, \n, 。, , , , , ],)chunks splitter.split_documents(docs)优先在段落→换行→句子→逗号→空格处切实在不行才在字符中间切。这是大部分项目的默认选择够用了。策略3语义切分更精准根据语义相似度来决定切分点——如果相邻两句话的语义差异很大就在那里切from langchain_experimental.text_splitter import SemanticChunkerfrom langchain_openai import OpenAIEmbeddingssplitter SemanticChunker( OpenAIEmbeddings(), breakpoint_threshold_typepercentile, # 用百分位数判断语义断点 breakpoint_threshold_amount75,)chunks splitter.split_documents(docs)优点每个chunk内的语义是连贯的。缺点慢要算Embedding贵每次切分都调API。适合对检索精度要求高、文档量不太大的场景。策略4按文档结构切分最推荐利用文档本身的标题、章节、段落结构来切分from langchain_text_splitters import MarkdownHeaderTextSplitter# Markdown文档按标题层级切分headers_to_split_on [ (#, Header 1), (##, Header 2), (###, Header 3),]splitter MarkdownHeaderTextSplitter(headers_to_split_onheaders_to_split_on)chunks splitter.split_text(markdown_text)# 每个chunk会自动携带标题元数据 plaintext # HTML文档按标签切分from langchain_text_splitters import HTMLSectionSplittersections_to_split_on [(h1, Header 1), (h2, Header 2)]splitter HTMLSectionSplitter(sections_to_split_onsections_to_split_on)这种方式最推荐因为文档的标题层级天然就是语义划分。切出来的chunk语义完整元数据也保留了后续检索时可以用元数据做过滤。策略5父文档检索切分大小块配合存两种粒度的chunk小块用于精确检索大块用于返回给模型from langchain.retrievers import ParentDocumentRetrieverfrom langchain_text_splitters import RecursiveCharacterTextSplitterfrom langchain_community.storage import InMemoryStore# 小块用于检索child_splitter RecursiveCharacterTextSplitter(chunk_size200)# 大块用于返回parent_splitter RecursiveCharacterTextSplitter(chunk_size1000)retriever ParentDocumentRetriever( vectorstorevectorstore, # 存小块的向量 docstoreInMemoryStore(), # 存大块的原文 child_splitterchild_splitter, parent_splitterparent_splitter,)用户检索到小块但返回给模型的是小块所属的大块。这样既保证了检索精度小块更精准又保证了上下文完整大块不丢信息。策略6自适应切分最前沿根据内容类型自动选择切分策略——表格用表格切分、代码用代码切分、文本用语义切分from unstructured.partition.auto import partitionfrom unstructured.staging.base import elements_to_chunks# 自动识别文档元素类型elements partition(filenamereport.pdf)# 表格、代码块、列表等不同元素用不同策略处理chunks elements_to_chunks(elements)复杂但效果最好适合文档类型杂、质量要求高的生产场景。chunk_size怎么选一个实用的调参方法chunk_size没有万能最优值但有一个系统化的调参方法Step 1从500字符开始试500-800字符是大部分中文场景的起点。Step 2评估检索效果用一组测试问题跑一遍看两个指标召回率该找到的chunk找到了没上下文完整率找到的chunk信息够不够回答问题Step 3根据结果调整现象原因调整方向找到了但信息不完整chunk太小上下文被切断调大chunk_size找到了但噪音太多chunk太大混入无关内容调小chunk_size根本找不到chunk切断了关键段落增加overlap或换切分策略找到了但答不对不是切分问题是检索或提示词问题别调chunk了查别的环节Step 4加入元数据给每个chunk加元数据后续检索时可以用元数据过滤from langchain_core.documents import Documentchunk Document( page_content公司年假政策入职满1年可享受5天带薪年假..., metadata{ source: 员工手册v3.2.pdf, page: 42, section: 假期管理, doc_type: policy, update_date: 2025-03-15, })检索时可以过滤只搜假期管理章节的、只搜2025年更新的文档。这样精确率直接上一个台阶。不同场景的推荐配置场景推荐切分chunk_sizeoverlap特殊处理法律合同按条款切分800-1200100保留条款编号技术文档按标题结构500-80050代码块单独切FAQ问答按问答对200-4000一个Q-A就是一个chunk论文按章节800-1000100摘要和结论单独存新闻资讯递归字符300-50030加时间元数据我踩过的切分坑1. chunk_overlap设太大overlap设100意味着每个chunk有100字符是跟相邻chunk重复的。如果你存10万个chunk相当于浪费了大量的存储和检索开销。overlap建议设chunk_size的5%-10%够防止关键信息被切断就行。2. 中文分词没考虑RecursiveCharacterTextSplitter的默认separators是英文优先的。中文文档建议加上。“”“”“”等中文标点separators[\n\n, \n, 。, , , , , , ]3. 元数据丢了有些切分器会把原文档的元数据丢掉。切分后一定要检查chunk.metadata里有没有source、page等信息。没有的话检索时就没法做过滤。4. 表格被切碎合同、财报里的表格按字符切分后完全不可用。要么用能识别表格的解析器要么把表格转成Markdown/HTML格式再存。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】