1. 研究问题与动机核心痛点长文档RAG检索增强生成在检索时面临“粒度困境”——细粒度块如句子检索精确但容易丢失上下文破坏跨句语义关联粗粒度块如段落保留上下文但引入噪音稀释关键信息。现有方法缺陷现有方案要么依赖外部LLM进行昂贵过滤要么采用固定上下文扩展要么通过摘要进行层次化组织导致信息丢失。尤其缺乏一种在检索时无需额外LLM调用、且能同时兼顾精确性与上下文连贯性的方法。2. 核心方法SPROUTRAG本文提出一个端到端训练的分层RAG框架核心机制包括注意力引导的树索引离线阶段将文档拆分为句子级块作为叶子节点。使用SLLM句子级大语言模型编码获取句子嵌入和跨层/头的注意力矩阵。关键创新不采用均匀平均注意力而是学习可变的头-层聚合权重以强调更能反映语义共相关性的注意力头从而削弱“近邻偏差”避免过度关注局部句子。基于聚合后的相互注意力分数自底向上构建二叉树每次合并注意力分数最高的节点对父节点嵌入为子节点嵌入均值并采用单链接更新max继承与剩余节点的关联。内部节点存储渐进式嵌入代表更大语义单元。分层检索在线阶段查询编码后在二叉树上执行层次化束搜索Hierarchical Beam Search。从根节点开始每层扩展当前束中子节点保留top-b最相关节点。同时收集所有评分超过阈值的节点包括叶子、内部节点、子树。候选集包含多粒度证据从单句到多句语义单元最终经重排序后选top-k块送入生成器。端到端联合训练检索损失对比学习对齐查询与正段落区分困难负样本。结构损失正则化注意力矩阵鼓励共同支持查询的句子对获得高相互注意力从而塑造有利于检索的树结构。联合优化使SLLM嵌入和树结构共同改进且全程无外部LLM调用。3. 实验评估基准与任务涵盖科学SCI-DOCS、法律LegalBench-RAG、开放域MS MARCO、多领域Dragonball的检索任务以及HotpotQA、WebQuestions等端到端生成任务。对比基线包括平面/自适应分块方法Meta-Chunking, MoC、结构化检索RAPTOR, LightRAG, PropRAG、基于句子注意力的SAKI-RAG等。主要结果检索质量在信息效率IE 召回率×精确率上SPROUTRAG平均比最强基线提升6.1%且同时取得最优召回率和精确率证明其兼顾了召回广度和精确性。端到端生成在生成质量上接近或超越LLM重型系统如PageIndex但在线推理成本显著更低每查询仅4.38K tokens193ms延迟。消融研究训练目标移除检索损失或结构损失均导致性能下降两者互补。树与检索设计均匀注意力聚合、基于嵌入的树、仅叶子检索或贪心搜索均不如完整模型验证了学习聚合、内部节点检索和束搜索的必要性。超参数束宽b5和正则化权重λ0.1为最佳平衡。4. 贡献总结提出新框架首次将可学习的注意力聚合用于构建RAG的句子级层次树无需LLM辅助即可实现多粒度检索。解决近邻偏差通过可学习头-层权重让模型自动发现最利于文档结构建模的注意力头。联合训练机制同时优化嵌入和树结构避免有损摘要或外部过滤。性能验证在多个领域基准上取得SOTA检索效率并在生成质量与推理成本间达到优秀折中。5. 局限性与未来方向当前为二叉树可能不如多叉树适合多句同时成组的场景。需要一次性离线训练成本比零调整的现成检索器昂贵。树结构固定无法按查询动态调整未来可探索动态适应或查询依赖遍历策略。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要检索增强生成RAG系统必须在检索粒度与上下文连贯性之间取得平衡现有方法通过LLM引导的分块、单级上下文扩展或层次化摘要来解决这一挑战。这些方法分别依赖于索引或检索过程中昂贵的LLM调用将上下文聚合限制在单一粒度级别或通过摘要引入信息损失。我们提出了SPROUTRAG一个基于注意力引导的层次化RAG框架通过将句子级块组织成逐渐增大但语义连贯的单元利用学习到的句子间注意力来构建二叉分块树从而解决了这一权衡问题。与先前依赖外部LLM、固定上下文扩展或有损摘要的方法不同SPROUTRAG学习哪些注意力头和层最能捕捉语义文档结构从而实现无需额外LLM调用或压缩摘要的多粒度检索。在检索时SPROUTRAG使用层次化束搜索来检索多个粒度的候选捕获超越平面检索的多句相关性。该框架通过一个联合目标进行端到端训练同时改进嵌入和树结构。在涵盖科学、法律和开放领域设置的四个基准上的实验表明SPROUTRAG的信息效率IE平均比最强基线提高了6.1%6.1%。1 引言检索增强生成RAG已成为将大型语言模型LLM锚定于外部知识的主导范式有助于减少幻觉、支持特定领域推理并提高知识密集型任务的性能Lewis等人2020Augenstein等人2024。随着LLM越来越多地应用于涉及长文档的复杂任务Jin等人2025a由于上下文长度限制和长序列上注意力退化直接将整个文档作为输入变得不切实际Jin等人2025bLiu等人2024。因此RAG框架将文档分割成块并检索最相关的片段以构建用于生成的、聚焦且高质量的证据。检索步骤的有效性在很大程度上取决于文档如何被分割。大块保留了上下文连贯性但引入了稀释关键信息的冗余噪声而细粒度块虽然提供了精确性但遭受语义碎片化和块间关系断裂的问题Tao等人2025Zhao等人2025a。这个问题在跨段落检索中尤为突出因为回答查询需要综合分散在多个文档部分的信息如多跳推理和摘要任务Liu等人2025。近期工作从几个方向应对这一挑战。SAKI-RAGTao等人2025使用SLLMAn等人2024合并语义相关的句子对并依赖外部LLM来过滤检索候选。然而将这种成对扩展扩展到多块相关性会大大增加候选空间并使LLM过滤成本高昂。LLM引导的分块方法如Meta-ChunkingZhao等人2025b和MoCZhao等人2025a提高了分割质量但在分块后丢弃了跨块依赖关系。层次化方法如RAPTORSarthi等人2024通过聚类和摘要支持多粒度检索但聚类将块组内的块视为可互换的摘要可能丢失证据。基于图的方法如GraphRAGEdge等人2025建模实体关系但在细粒度块包含稀疏实体信息时效果较差。图1SPROUTRAG将长文档分割成句子级块利用SLLM注意力识别语义相关的句子并将它们组织成一个注意力引导的二叉树。检索随后从细粒度叶子、中层节点和更广泛的子树中选择证据在保持精确性的同时恢复连贯性。在本文中我们提出了SPROUTRAG一个基于注意力引导的层次化RAG框架它将句子级块组织成一个学习到的文档结构在避免检索期间LLM推理开销的同时保留跨块依赖关系。如图1所示这种结构支持在多个语义粒度上进行检索。SPROUTRAG使用SLLM以句子粒度编码文档并自底向上构建一棵二叉树其中合并顺序由跨Transformer头和层的句子间注意力的学习加权聚合决定。这种聚合取代了朴素的均匀平均我们证明后者引入了近邻偏差削弱了全局树索引相反可学习的标量权重允许模型发现哪些头类型最能反映文档结构的语义共相关性。每个内部节点存储一个渐进式嵌入组合表示其子树通过层次化束搜索从所有树层级收集候选从而实现多粒度检索。SPROUTRAG以端到端方式训练联合优化检索质量和树结构在任何阶段都不需要外部LLM调用。它捕获了成对或平面检索方法无法实现的、涌现的多句相关性同时保持足够高效以供部署。我们在涵盖科学、法律和开放领域设置的四个基准上评估了SPROUTRAG。平均而言SPROUTRAG的信息效率IE比最强基线提高了6.1%6.1%特别是在证据通常分散在段落间的情况下。一个渐进式嵌入组合表示其子树通过层次化束搜索从所有树层级收集候选从而实现多粒度检索。SPROUTRAG以端到端方式训练联合优化检索质量和树结构在任何阶段都不需要外部LLM调用。它捕获了成对或平面检索方法无法实现的、涌现的多句相关性同时保持足够高效以供部署。我们在涵盖科学、法律和开放领域设置的四个基准上评估了SPROUTRAG。平均而言SPROUTRAG的信息效率IE比最强基线提高了6.1%特别是在证据通常分散在段落间的情况下。总之本文的贡献如下1我们提出了SPROUTRAG一个基于注意力引导的层次化RAG框架它使用学习到的句子间注意力在句子级块上构建一棵二叉树在推理时不需任何LLM调用即可实现多粒度检索。2我们识别并解决了句子级Transformer中由均匀注意力平均引入的近邻偏差用学习到的加权聚合取而代之允许模型发现哪些注意力头最能反映文档结构的语义共相关性。3我们引入了一个联合训练目标同时改进检索质量和树结构消除了在任何流程阶段对外部LLM过滤或有损摘要的需求。2 相关工作分块与自适应检索。RAG的有效性在很大程度上取决于文档如何被分割成可检索单元。标准的RAG流程通常依赖于基于规则的分割器例如固定长度或基于分隔符的分块这些方法高效但对语义边界不敏感Team2024。近期方法旨在改进这种粒度选择。Late-ChunkingGünther等人2025在形成块嵌入之前对令牌表示进行上下文化而Meta-ChunkingZhao等人2025b和MoCZhao等人2025a使用基于LLM的信号或路由机制来产生更具适应性的块边界。Dense X RetrievalChen等人2024通过将文本分解为原子命题来朝着更细粒度迈进提高了精确性但削弱了更广泛的上下文连续性。其他方法在块形成后调整检索策略。结构化与层次化检索。除了平面块检索之外结构化的RAG方法将文档内容组织成更高级别的表示。RAPTORSarthi等人2024递归地聚类块并摘要每个聚类形成一棵树支持从多个级别检索然而其结构基于嵌入空间聚类并依赖LLM生成的摘要这可能会丢弃细粒度细节。基于图的方法如GraphRAGEdge等人2025和LightRAGGuo等人2025通过实体和关系表示文档支持基于遍历的检索但依赖于成功的实体提取和关系构建。PropRAGWang和Han2025用命题替换实体三元组并在命题路径上执行无LLM的束搜索而Beam RetrievalZhang等人2024展示了在多头跳转段落检索中维护多个检索假设的好处。PageIndexZhang等人2025a类似地探索了基于推理的、无向量的文档树结构检索但依赖于文档级结构组织而非学习到的句子级注意力。相比之下SPROUTRAG在句子级块上构建了一个注意力引导的二叉树具有组合性内部节点并对所有节点进行联合检索。这在没有有损摘要、以实体为中心的结构或外部LLM调用的情况下保留了跨句依赖关系。3 SPROUTRAG如图2所示SPROUTRAG用经过训练的、基于注意力引导的句子级块层次结构取代了平面块检索。在离线索引期间SLLM对文档进行编码并提供句子嵌入和句子间注意力信号。这些信号通过可学习的头-层权重进行聚合并用于构建一棵二叉树其中叶子代表细粒度块内部节点存储合并句子组的渐进式嵌入。在在线检索期间SPROUTRAG对查询进行编码并执行层次化束搜索从叶子、内部节点和子树中收集候选。如第3.3节所述该框架通过联合目标进行训练同时改进检索质量和树结构在检索期间无需外部LLM调用即可实现多粒度检索。3.1 注意力引导的索引图2SPROUTRAG概览。在离线索引阶段阶段1文档被分割成句子级块并使用SLLM进行编码以获得句子嵌入和句子间注意力。学习到的注意力头和层的聚合引导自底向上的树构建生成一棵注意力树叶子处为句子嵌入内部节点处为渐进式嵌入。在在线检索阶段阶段2查询被编码层次化束搜索遍历树从多个层级收集候选然后通过相似度重排序选出前 (k) 个块用于答案生成。这种单链接更新在层次结构增长时保留了长程语义连接。结果是一棵注意力树 T其叶子保留了句子级的精确性其内部节点代表了更广泛的语义单元。3.2 层次化检索给定一个查询 qSPROUTRAG首先使用与索引期间相同的SLLM对其进行编码以获得查询嵌入 e(q)。然后在注意力引导的二叉树上执行检索其中每个节点 v 代表一个特定粒度的文档跨度。叶子节点对应句子级块而内部节点代表逐渐增大的、语义相关的句子组。这使得SPROUTRAG能够以最适合查询的粒度检索证据而不是依赖固定的块大小。每个候选节点通过查询嵌入与节点表示之间的余弦相似度进行评分3.3 联合训练预训练的SLLM并非为检索或构建面向检索的文档结构而优化。因此我们使用联合目标对SPROUTRAG进行微调以同时改进嵌入空间和注意力树。4 实验与结果4.1 实验设置基准。我们在四个涵盖科学、法律和开放领域设置的检索基准上评估SPROUTRAGSCI-DOCSCohan等人2020、LegalBench-RAGPipitone和Alami2024、DragonballZhu等人2025和MS MARCONguyen等人2016。对于端到端答案生成我们进一步在HotpotQAYang等人2018、WebQuestionsBerant等人2013和Dragonball上进行评估。详见附录A.1。基线。我们与代表性的分块和结构化检索方法进行比较包括Dense X RetrievalChen等人2024、Meta-ChunkingZhao等人2025b、MoCZhao等人2025a、RAPTORSarthi等人2024、LightRAGGuo等人2025、PropRAGWang和Han2025和SAKI-RAGTao等人2025。GraphRAGEdge等人2025、ReflectiveRAGVerma等人2026、PageIndexZhang等人2025a和REFRAGLin等人2025仅报告最终任务性能因为它们主要涉及LLM繁重的推理、生成、摘要或解码时优化而非高效检索。为公平比较需要LLM或重排序器的方法使用相同的Qwen3-8BTeam2025生成器和Qwen3-Reranker-4BZhang等人2025b重排序器。除了统一生成器和重排序器外我们遵循每个基线原始论文中推荐的设置。详见附录A.2。4.2 检索质量表1报告了四个基准上的检索性能。SPROUTRAG在所有数据集上均实现了最高的IE相比最强基线在Dragonball上提高了8.06分在SCI-DOCS上提高了4.65分在LegalBench-RAG上提高了4.90分在MS MARCO上提高了6.83分。这些改进并非仅由召回率驱动SPROUTRAG在每个基准上也获得了最佳的精确率。这表明注意力引导的层次结构有助于检索更广泛的支撑上下文同时避免了过大或弱相关块引入的噪声。与SAKI-RAG的比较尤其具有参考价值。虽然SAKI-RAG实现了较高的精确率特别是在Dragonball和SCI-DOCS上但其成对扩展限制了证据聚合降低了召回率和IE。相比之下SPROUTRAG将句子级注意力转换为全局树结构能够检索单个块、内部节点和子树。这在保留SAKI-RAG精确率优势的同时提高了所有数据集的IE。结构化基线如RAPTOR、LightRAG、PropRAG和MoC在召回率上优于平面或基于边界的分块但其聚类、图、命题或路由结构并未显式建模学习到的多句组合。SPROUTRAG弥合了这一差距叶子保留了细粒度证据而内部节点恢复了连贯上下文从而实现了最强的召回率-精确率权衡。附录C提供了一个定性示例。4.3 端到端性能与效率接下来我们评估检索改进是否能转化为更优的最终答案。表2将SPROUTRAG与HotpotQA、WebQuestions和Dragonball上的系统级RAG方法进行了比较。PageIndex获得了最高的最终答案分数但由于其基于推理的搜索和证据构建需要更多的在线计算。REFRAG相较于重度反思或推理系统提高了效率但SPROUTRAG仍提供了最强的性能-效率权衡它在所有最终性能指标上均优于GraphRAG、ReflectiveRAG和REFRAG同时每个查询仅使用4.38K在线令牌和193毫秒延迟。报告的成本衡量的是在线每查询推理不包括离线训练和索引。SPROUTRAG确实需要一个前期训练阶段我们在CLaRa的30K示例子集上微调SLLM和注意力聚合权重。然而此成本是一次性支付的可跨数据集复用类似于其他具有离线准备或模型适应成本的系统。跨数据集结果表明学习到的注意力引导层次结构无需为每个基准重新训练即可泛化使得训练成本得以摊销而非查询时开销。表1四个基准上的检索性能。召回率、精确率和IE是在1、3和55上取平均值IE在每个截断点计算后再平均。数值报告了三次独立运行的平均值红色 ±± 值表示相应的标准差。阴影行标记SPROUTRAG。1、3和5的结果请参见附录B。接下来我们评估检索改进是否能转化为更优的最终答案。表2将SPROUTRAG与HotpotQA、WebQuestions和Dragonball上的系统级RAG方法进行了比较。PageIndex获得了最高的最终答案分数但由于其基于推理的搜索和证据构建需要更多的在线计算。REFRAG相较于重度反思或推理系统提高了效率但SPROUTRAG仍提供了最强的性能-效率权衡它在所有最终性能指标上均优于GraphRAG、ReflectiveRAG和REFRAG同时每个查询仅使用4.38K在线令牌和193毫秒延迟。报告的成本衡量的是在线每查询推理不包括离线训练和索引。SPROUTRAG确实需要一个前期训练阶段我们在CLaRa的30K示例子集上微调SLLM和注意力聚合权重。然而此成本是一次性支付的可跨数据集复用类似于其他具有离线准备或模型适应成本的系统。跨数据集结果表明学习到的注意力引导层次结构无需为每个基准重新训练即可泛化使得训练成本得以摊销而非查询时开销。4.4 消融研究训练目标。在表3的第一组中评估了训练目标的作用。“未训练”变体在所有数据集上表现最差表明预训练的SLLM注意力和嵌入不足以构建面向检索的树。移除 Lret 会显著降低召回率和IE因为查询和证据嵌入不再显式对齐。移除 Lattn 比移除检索损失的损害小但仍会导致持续的性能下降特别是在IE方面。这证实了嵌入质量和树质量需要互补的监督检索损失对齐查询-段落表示而注意力结构损失则塑造用于多粒度检索的层次结构。表2端到端答案质量与在线效率。HotpotQA和WebQuestions使用F1评估而Dragonball使用ROUGE-L (R-L)、METEOR (MTR)和BERTScore (BRT)。Tok/Q计算每个查询的在线模型输入令牌数不包括离线训练、索引和输出令牌Lat.报告在线每查询延迟。所有方法在适用时使用相同的生成器和重排序器。5 结论与未来工作我们提出了SPROUTRAG一个基于注意力引导的层次化RAG框架它将句子级块组织成一个学习到的树用于多粒度检索。SPROUTRAG不依赖于固定的块边界、成对上下文扩展、有损摘要或推理时的LLM过滤而是使用学习到的SLLM注意力聚合来构建面向检索的层次结构。在推理时层次化束搜索从句子叶子、内部节点和更广泛的子树中选择证据允许检索器在细粒度精确性和上下文连贯性之间取得平衡。在多个基准上SPROUTRAG将检索信息效率平均提高了 6.1%提供了接近LLM重型系统的强大性能-效率权衡同时使用的在线令牌和延迟远少于前者。虽然SPROUTRAG在一次训练后能很好地泛化但仍有几个方向有待探索。未来的工作可以探索超越均值池化的更丰富的节点组合函数例如门控或基于注意力的组合以及针对复杂多跳检索的动态树适应或查询依赖的遍历策略。局限性尽管SPROUTRAG在没有推理时LLM过滤的情况下改进了多粒度检索但它也存在一些局限性。首先层次结构目前是作为二叉树构建的这可能具有限制性因为当多个句子共同形成一个连贯的语义单元并应同时分组时二叉树可能无法很好地捕捉这种多对多依赖关系。多分支树可能能更好地捕捉此类依赖。其次SPROUTRAG需要对SLLM和注意力聚合权重进行前期训练。尽管在我们的实验中这是一次性成本可以跨数据集迁移但它仍然比使用未经适应的现成检索器更昂贵。最后树构建是离线的在检索期间是固定的。虽然这使得推理高效并避免了按查询重建索引但当查询需要按查询特定相关性重新组织证据时灵活性可能较低。