news 2026/8/14 6:53:32

RAG文档处理与切分策略:6种分块方式对比,80%的检索问题从这里解决

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RAG文档处理与切分策略:6种分块方式对比,80%的检索问题从这里解决

上一篇我说过,80%的RAG项目问题出在检索和文档处理,而其中又有40%直接出在切分环节。你可能不信——切分不就是按字符数切嘛,能有多大事?

我之前帮一个团队做法律知识库,他们用的固定512字符切分,结果一份合同里的"甲方权利"和"甲方义务"被切到了两个chunk里。用户问"甲方有什么权利",检索到的是"义务"那段,模型回答完全跑偏。切分不对,检索再准也没用——因为你存进去的东西就是残缺的。

今天这篇专门讲文档处理和切分,从PDF解析到6种切分策略,我把踩过的坑全掏出来。

先说PDF解析:你以为的文本提取可能是错的

如果你的知识库主要是PDF文档,先别急着切分——PDF解析本身就是个大坑。

常见问题

  • 表格丢失:很多PDF解析器把表格变成一行行文本,列关系全没了
  • 多栏排版混乱:学术论文的双栏排版,解析后左右两栏的文字交叉在一起
  • 图片中的文字:扫描件PDF,文字是图片不是文本,普通解析器提取不了
  • 页眉页脚混入正文:页码、章节标题等噪音被当作正文处理

解析工具选型

工具特点适用场景
PyPDFLoader简单快速,纯文本PDF结构简单的文档
PyMuPDFLoader保留更多格式信息带表格、图片的PDF
UnstructuredLoader支持复杂布局、表格识别复杂排版文档
marker开源OCR+布局识别扫描件PDF
doclingIBM开源,多格式支持企业级文档处理
# 简单PDFfrom langchain_community.document_loaders import PyPDFLoaderloader = PyPDFLoader("contract.pdf")docs = loader.load()# 复杂PDF(带表格、多栏)from langchain_community.document_loaders import UnstructuredLoaderloader = UnstructuredLoader("report.pdf", mode="elements")docs = loader.load()# Unstructured会自动识别表格、标题、列表等元素

我的建议:别在PDF解析上省钱。解析质量直接决定后续所有环节的天花板。如果你的PDF很复杂(表格多、排版乱),用Unstructured或docling;简单的用PyMuPDFLoader就行。

6种切分策略:从粗暴到精细

策略1:固定长度切分(最基础)

按字符数或Token数切,最简单但问题最多:

from langchain_text_splitters import CharacterTextSplittersplitter = CharacterTextSplitter( chunk_size=500, chunk_overlap=50, separator="\n\n", # 优先在段落处切)chunks = splitter.split_documents(docs)

问题:可能在句子中间切断,破坏语义。适合对精度要求不高的场景。

策略2:递归字符切分(最常用)

LangChain的RecursiveCharacterTextSplitter,按优先级尝试不同的分隔符:

from langchain_text_splitters import RecursiveCharacterTextSplittersplitter = RecursiveCharacterTextSplitter( chunk_size=500, chunk_overlap=50, separators=["\n\n", "\n", "。", "!", "?", ",", " ", ""],)chunks = splitter.split_documents(docs)

优先在段落→换行→句子→逗号→空格处切,实在不行才在字符中间切。这是大部分项目的默认选择,够用了。

策略3:语义切分(更精准)

根据语义相似度来决定切分点——如果相邻两句话的语义差异很大,就在那里切:

from langchain_experimental.text_splitter import SemanticChunkerfrom langchain_openai import OpenAIEmbeddingssplitter = SemanticChunker( OpenAIEmbeddings(), breakpoint_threshold_type="percentile", # 用百分位数判断语义断点 breakpoint_threshold_amount=75,)chunks = splitter.split_documents(docs)

优点:每个chunk内的语义是连贯的。缺点:慢(要算Embedding),贵(每次切分都调API)。

适合对检索精度要求高、文档量不太大的场景。

策略4:按文档结构切分(最推荐)

利用文档本身的标题、章节、段落结构来切分:

from langchain_text_splitters import MarkdownHeaderTextSplitter# Markdown文档:按标题层级切分headers_to_split_on = [ ("#", "Header 1"), ("##", "Header 2"), ("###", "Header 3"),]splitter = MarkdownHeaderTextSplitter(headers_to_split_on=headers_to_split_on)chunks = splitter.split_text(markdown_text)# 每个chunk会自动携带标题元数据 ``````plaintext # HTML文档:按标签切分from langchain_text_splitters import HTMLSectionSplittersections_to_split_on = [("h1", "Header 1"), ("h2", "Header 2")]splitter = HTMLSectionSplitter(sections_to_split_on=sections_to_split_on)

这种方式最推荐,因为文档的标题层级天然就是语义划分。切出来的chunk语义完整,元数据也保留了,后续检索时可以用元数据做过滤。

策略5:父文档检索切分(大小块配合)

存两种粒度的chunk:小块用于精确检索,大块用于返回给模型:

from langchain.retrievers import ParentDocumentRetrieverfrom langchain_text_splitters import RecursiveCharacterTextSplitterfrom langchain_community.storage import InMemoryStore# 小块:用于检索child_splitter = RecursiveCharacterTextSplitter(chunk_size=200)# 大块:用于返回parent_splitter = RecursiveCharacterTextSplitter(chunk_size=1000)retriever = ParentDocumentRetriever( vectorstore=vectorstore, # 存小块的向量 docstore=InMemoryStore(), # 存大块的原文 child_splitter=child_splitter, parent_splitter=parent_splitter,)

用户检索到小块,但返回给模型的是小块所属的大块。这样既保证了检索精度(小块更精准),又保证了上下文完整(大块不丢信息)。

策略6:自适应切分(最前沿)

根据内容类型自动选择切分策略——表格用表格切分、代码用代码切分、文本用语义切分:

from unstructured.partition.auto import partitionfrom unstructured.staging.base import elements_to_chunks# 自动识别文档元素类型elements = partition(filename="report.pdf")# 表格、代码块、列表等不同元素用不同策略处理chunks = elements_to_chunks(elements)

复杂但效果最好,适合文档类型杂、质量要求高的生产场景。

chunk_size怎么选?一个实用的调参方法

chunk_size没有万能最优值,但有一个系统化的调参方法:

Step 1:从500字符开始试

500-800字符是大部分中文场景的起点。

Step 2:评估检索效果

用一组测试问题跑一遍,看两个指标:

  • 召回率:该找到的chunk找到了没?
  • 上下文完整率:找到的chunk信息够不够回答问题?

Step 3:根据结果调整

现象原因调整方向
找到了但信息不完整chunk太小,上下文被切断调大chunk_size
找到了但噪音太多chunk太大,混入无关内容调小chunk_size
根本找不到chunk切断了关键段落增加overlap或换切分策略
找到了但答不对不是切分问题,是检索或提示词问题别调chunk了,查别的环节

Step 4:加入元数据

给每个chunk加元数据,后续检索时可以用元数据过滤:

from langchain_core.documents import Documentchunk = Document( page_content="公司年假政策:入职满1年可享受5天带薪年假...", metadata={ "source": "员工手册v3.2.pdf", "page": 42, "section": "假期管理", "doc_type": "policy", "update_date": "2025-03-15", })

检索时可以过滤:只搜"假期管理"章节的、只搜2025年更新的文档。这样精确率直接上一个台阶。

不同场景的推荐配置

场景推荐切分chunk_sizeoverlap特殊处理
法律合同按条款切分800-1200100保留条款编号
技术文档按标题结构500-80050代码块单独切
FAQ问答按问答对200-4000一个Q-A就是一个chunk
论文按章节800-1000100摘要和结论单独存
新闻资讯递归字符300-50030加时间元数据

我踩过的切分坑

1. chunk_overlap设太大

overlap设100意味着每个chunk有100字符是跟相邻chunk重复的。如果你存10万个chunk,相当于浪费了大量的存储和检索开销。overlap建议设chunk_size的5%-10%,够防止关键信息被切断就行。

2. 中文分词没考虑

RecursiveCharacterTextSplitter的默认separators是英文优先的。中文文档建议加上"。“”!“”?“”;"等中文标点:

separators=["\n\n", "\n", "。", "!", "?", ";", ",", " ", ""]

3. 元数据丢了

有些切分器会把原文档的元数据丢掉。切分后一定要检查:chunk.metadata里有没有source、page等信息。没有的话检索时就没法做过滤。

4. 表格被切碎

合同、财报里的表格,按字符切分后完全不可用。要么用能识别表格的解析器,要么把表格转成Markdown/HTML格式再存。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 6:50:47

Pynamical交互式学习:通过蛛网图动画理解初始条件敏感性

Pynamical交互式学习:通过蛛网图动画理解初始条件敏感性 【免费下载链接】pynamical Model, simulate, and visualize discrete nonlinear dynamical systems, chaos, and fractals 项目地址: https://gitcode.com/gh_mirrors/py/pynamical 在非线性动力学的…

作者头像 李华
网站建设 2026/8/14 6:46:59

Windows C盘空间告急?揪出PDApp.log元凶并彻底解决

1. 问题现象与初步排查:那个神秘的PDApp.log最近帮同事处理一台电脑,开机就弹磁盘空间不足的警告,C盘红得刺眼。用SpaceSniffer这类磁盘空间分析工具一扫,发现一个叫PDApp.log的文件赫然躺在C盘根目录下,体积竟然有几十…

作者头像 李华
网站建设 2026/8/14 6:46:42

郑州背调公司有哪些?本地企业如何选靠谱背调服务商

不少郑州企业在招聘用工过程中,都会疑惑郑州背调公司有哪些,该如何挑选适配自身发展的服务商。本地背调服务市场品类繁杂,既有传统线下人工背调机构,也有新型数字化智能背调平台,不同服务商的服务模式、覆盖场景差异极…

作者头像 李华
网站建设 2026/8/14 6:46:03

数字电路三分频原理与FPGA实现:从状态机到工程实践

1. 从“分频”说起:为什么我们需要三分频?在电子电路的世界里,“分频”这个词听起来有点抽象,但它的应用却无处不在。简单来说,分频就是把一个频率较高的信号,通过特定的电路处理,变成一个或多个…

作者头像 李华
网站建设 2026/8/14 6:45:59

VR-Reversal:3D视频转2D,普通设备看VR不再难

VR-Reversal:3D视频转2D,普通设备看VR不再难 【免费下载链接】VR-reversal VR-Reversal - Player for conversion of 3D video to 2D with optional saving of head tracking data and rendering out of 2D copies. 项目地址: https://gitcode.com/gh_…

作者头像 李华