
论文提出了一种神经符号化Neuro-Symbolic的知识图谱KG构建方法旨在从非结构化文本中高效、准确地提取出符合给定本体Ontology约束的知识图谱。其核心创新在于“先提取后修正”的策略先用大语言模型LLM进行开放域ontology-free的KG抽取再通过符号规则检测并利用LLM进行有针对性的后期修正以解决抽取结果与本体约束如实体类型、谓词域范围等的冲突问题。这种方法在提高生成KG的语义一致性的同时显著降低了计算成本Token使用量并保证了其在检索增强生成RAG任务和符号化查询SPARQL中的实用性。1. 研究背景与问题挑战传统的基于文本的RAG方法在处理多跳推理、算术聚合、符号操作等复杂问答时存在困难。现有方案基于知识图谱KG的RAG方法Graph-based RAG通过结构化知识支持复杂推理。结构化KG若配有本体Ontology如Wikidata可实现高效、准确的符号化查询如SPARQL。现有瓶颈利用LLM从文本中构建符合本体的KG面临两难上下文约束将完整本体放入LLM上下文In-Context成本高昂且大上下文会降低提取性能。迭代对齐逐条对齐Iterative Alignment需要大量LLM调用Token消耗巨大。一致性问题LLM提取的开放域事实常违反常识性的本体约束。2. 本文贡献提出OAKMEND框架一个结合符号规则与LLM选择性调用的高效、可扩展的KG构建框架。高效的本体对齐方法OAK - Ontology-Aligned KG construction提取与本体解耦的开放域KG。利用文本嵌入相似度将开放域的类型和谓词批量映射到本体术语仅在歧义时调用LLM大幅减少Token开销。智能的后期修正方法MEND - Post-extraction Correction利用本体中的域范围约束Domain-Range和限定词约束Qualifier Constraints以符号方式精确检测不符合本体的三元组和限定词。针对检测出的违规项设计预定义的修正动作如交换主宾、替换谓词、添加类型并仅对这些错误项批量或单个地调用LLM进行修正而非重新提取。引入SPARQL图模式基准BGP Benchmark首次从符号查询可用性的角度评估KG质量使用h-index等指标衡量生成KG对SPARQL查询的支持程度。3. 技术方法OAKMEND流程开放域提取Step 1 - Open-domain Extraction输入文本使用一个简单的提示词让LLM提取三元组、实体类型和限定词Qualifiers完全不提供本体约束。这保证了提取的召回率和降低了提示词长度。类型与谓词规范化Step 2 - Canonicalization将步骤1中提取的开放域类型和谓词映射到目标本体。核心基于嵌入相似度进行映射相似度高度接近的候选集才触发LLM进行最终消歧否则自动选择最高相似度项。这避免了逐条处理的高昂成本。实体去重Step 3 - Deduplication利用嵌入聚类和LLM进行实体合并并利用类型信息如排除字面量优化聚类。符号化违规检测与修正Step 4 - Correction of Violations - MEND检测根据本体的域/范围规则符号化地标记所有违规三元组和限定词。三元组修正对违规三元组LLM从预设动作swap,replace_predicate,add_subject_type,add_object_type中选择组合进行修正。限定词修正对违规限定词LLM从预设动作replace_predicate,add_object_type中选择。优势修正提示词包含错误原因、源文本片段和候选动作LLM执行的是“选择与填充”任务而非“生成”因此更精确且高效。4. 实验评估数据集HotpotQA, MuSiQue多跳问答Wikidata本体片段。基线KGGen无本体、WIKONTIC迭代对齐、In-Context将本体放入上下文。评估维度一致性Consistency生成KG中符合本体约束的三元组和限定词的比例。效率Efficiency构建KG所消耗的Prompt和Completion Token数量。问答性能QA Performance将生成KG作为知识源执行多跳问答任务EM/F1分数。SPARQL查询可用性计算生成KG中包含的常见图模式BGP的数量h-index。主要结果一致性OAKMEND将三元组一致性从约63%-68%提升至96.8%-98.4%限定词一致性从约33%-36%提升至91.5%-96.8%远超In-Context基线与WIKONTIC持平或略优。效率相比WIKONTICOAKMEND节省了21%-41%的加权Token成本这是因为其减少了大量不必要的LLM调用。问答性能OAKMEND在QA任务上取得了与现有最佳方法KGGen, WIKONTIC相当甚至更优的结果且修正过程几乎没有造成性能损失证明了修正的有效性。SPARQL支持OAKMEND在BGP h-index指标上表现优异仅次于因过度提取冗余三元组而异常高分的In-Context基线。这表明OAKMEND生成的KG在支持结构化查询方面具有很高的潜力。5. 结论与局限性结论本文提出的OAKMEND方法成功实现了效率与质量的平衡。通过“先抽取后修正”的神经符号化策略它能够以较低的计算成本构建出高一致性、高语义保真度且适用于符号查询的KG为复杂问答系统提供了坚实的基础。局限性依赖本体方法需要详尽的本体约束特别是限定词约束在某些领域可能难以获得。LLM泛化性实验主要基于Wikidata和开源LLM对封闭或定制本体的泛化能力未充分验证。端到端SPARQL评估缺失受限于现有Text-to-SPARQL技术的不成熟未能直接比较通过SPARQL查询构建的KG进行QA的效果而是使用了BGP频率作为代理指标。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要问答QA是人工智能中的核心挑战特别是对于需要跨文档多跳推理或需要聚合、穷举列举等符号化操作的复杂查询。检索增强生成RAG已成为问答的主流方法近期的基于图的变体通过组织知识以更好地支持组合性问题部分解决了这些问题。然而大多数基于文本图的RAG方法仍然缺乏可靠回答复杂问题所需的符号化操作结构。这促使了基于符号图的方法的发展这些方法提取知识图谱KG其关系为逻辑谓词支持类似SQL的查询。然而这些流程通常使用LLM进行KG提取这可能引入一致性问题即提取的事实可能违反常识性的本体约束。我们提出了一个神经符号化框架用于基于本体的KG构建结合了开放域提取、基于嵌入的类型和谓词规范化以及针对本体违规的有针对性LLM校正。通过将校正推迟到后提取阶段我们的方法避免了重复的LLM调用显著减少了Token使用量同时提高了KG一致性并保持了下游问答质量。最后我们通过测量SPARQL图模式的出现频率证明了提取的KG非常适合符号化查询。1 引言人工智能中的一个重要挑战是基于新的或领域特定信息来回答用户问题这些信息通常以文本文档集合的形式提供Voorhees and Tice, 2000; Rajpurkar et al., 2016; Lewis et al., 2020a。问答QA最流行的方法是检索增强生成RAG它将任务分解为两个步骤检索与给定问题相关的文本片段并使用检索到的信息生成答案Chen et al., 2017; Lewis et al., 2020b。然而纯文本的QA方法通常难以处理需要在多个实体上进行多跳推理的复杂问题Yang et al., 2018; Trivedi et al., 2022以及算术或聚合等符号化操作例如返回最大化某一数量的答案Dua et al., 2019; Chen et al., 2021; Zhu et al., 2021或组合多个中间答案Ho et al., 2020。随着语料库规模的扩大检索相关文本的难度进一步加剧了回答这些问题的挑战Xiong et al., 2021; Weller et al., 2026。图1我们提出的基于本体的KG提取方法OAKMEND在捕捉文本语义以QA性能衡量上图和整体本体一致性以符合本体的三元组和限定词百分比衡量下图之间实现了更好的权衡同时在每个提取事实三元组或限定词的Token效率方面更高。我们与无本体的KGGENMo et al., 2025、WIKONTICChepurova et al., 2026——后者迭代地将每个三元组对齐到本体以及一个在KG提取期间将本体作为LLM上下文一部分插入的基线IN-CONTEXT进行了比较。为了解决这些问题近期工作提出了结构化索引通常是图结构它们能更好地捕捉文档与实体之间的全局连接支持多跳和组合推理Sarthi et al., 2024; Gutierrez et al., 2024; Gutierrez et al., 2025; Edge et al., 2025并且还能够实现代理化方法直接在图索引上进行探索与利用的平衡Gao and Metaxas, 2026; Du et al., 2026。在这些方法中知识图谱KG最为突出它将实体之间的直接关系编码为主语-谓语-宾语三元组Peng et al., 2023; Pan et al., 2023。KG提供了形式化的符号化关系结构支持多跳问题所需的高效遍历Ren et al., 2020; Arakelyan et al., 2021; Galkin et al., 2024; Gregucci et al., 2025。KG通常附带一个本体它指定了一个领域特定的模式包括谓词、实体类型以及每个谓词可以链接的实体类型约束。该本体能够验证编码信息的一致性并能指导约束违规的修正Ahmetaj et al., 2022; Ferranti et al., 2024; Lin et al., 2025。最重要的是它还使KG能够通过类似SQL的语言如SPARQLHarris et al., 2013进行高效检索SPARQL支持算术和聚合操作有助于回答具有挑战性的问题Gashkov et al., 2025; Perevalov and Both, 2025。近期研究表明LLM可以有效地从文本中提取KGZhu et al., 2023; Mo et al., 2025。然而提取符合现有本体的KG仍然具有挑战性因为它需要在问答的表述能力、约束满足和Token使用量之间取得平衡。一条研究路线通过在提取期间将本体约束包含在LLM上下文中来解决这一问题Mihindukulasooriya et al., 2023; van Cauter and Yakovets, 2024; Nie et al., 2024; Wang and Iwahara, 2025。然而对于像Wikidata这样的大型本体Vrandecic and Krotzsch, 2014由于需要较长的上下文长度这引入了大量的计算开销。此外提取的KG的一致性最终取决于所选LLM执行所提供约束的能力这使得较小的开源LLM表现更差。尽管我们可以利用专用模型为每个文本检索相关的本体片段但这些模型必须针对所考虑的特定本体进行训练Zhang and Soh, 2024。另一条研究路线使用LLM提取开放域三元组然后通过多次LLM调用将其迭代地对齐到本体Arun et al., 2025; Lu et al., 2025; Chepurova et al., 2026。虽然这提供了编码相关信息的灵活性但每个提取的三元组需要多次LLM调用导致显著的Token成本。贡献。(i) 我们提出了一种在文本中在本体约束下构建KG的高效方法该方法不将约束插入LLM上下文而是利用文本嵌入将提取的实体类型和谓词映射到本体。(ii) 我们符号化地检测违反本体的三元组和限定词并通过向LLM提供一组候选校正操作来有选择地校正每一个。这使我们能够通过单次LLM调用高效地校正一个或多个三元组或限定词。(iii) 实验表明我们的方法比现有基线更具Token效率同时三元组和限定词的本体一致性分别达到高达98.4%和96.8%。问答实验进一步表明我们的后提取校正保留了文本中的关键信息。然后为了评估提取的KG在通过SPARQL进行符号化查询方面的适用性(iv) 我们引入了一个基于图模式的基准测试。2 背景本体约束通过SPARQL进行符号化查询。上述定义的本体约束提供了编写类SQL查询进行符号化检索或问答所需的规则使用SPARQLHarris et al., 2013。例如考虑检索所有在2000年后获得诺贝尔奖的物理学家。这可以表示为以下查询。SELECT ?person WHERE { ?person instanceOf: Human . ?person occupation: Physicist . ?person awardReceived: ?stmt . ?stmt awardValue: NobelPrizePhysics . ?stmt pointInTime: ?date . FILTER ( ?date 2000-01-01 ) }在上述查询中第2行指定了对实体变量 ?person 的类型约束而在第3行中occupation 的范围约束告诉我们把 occupation Physicist 放在三元组的右侧。pointInTime 是 awardReceived 允许的限定词这一事实保证了我们可以使用它来访问奖项关系的额外时间信息如第5-7行所示使用遵循Wikidata数据模型的语句表达式Vrandecic and Krotzsch, 2014。在第3节中我们提出了一种KG提取方法将开放域类型和谓词映射到本体允许的类型和谓词。然后在第4节中我们开发了一种系统性地校正本体约束违规的方法。3 KG提取与规范化给定源文本 S我们的目标是提取一个KG G其中包含带类型的实体和限定词以编码 S 中实体之间的关系。在这里我们提出一种方法它1执行开放域KG构建以及2将提取的开放域类型或谓词映射或规范化到本体允许的类型或谓词即 T或 R。为了使2高效我们利用在类型和谓词标签上计算的嵌入而只在消歧时使用LLM。我们将此方法称为基于本体的KG构建OAK并将满足本体约束的问题推迟到第4节。在附录F中我们报告了所有提示词。3.1 开放域提取步骤1。我们使用单个提示词指示LLM从源文本 S 中提取三元组、实体类型以及可选地为每个三元组提取若干限定词。所有提取的元素都是开放域的本体不作为输入上下文的一部分提取的类型和谓词将在后续步骤中映射到本体见第3.2节。此KG提取步骤与Chepurova等人2026的不同之处在于我们还提取限定词对象的类型这是限定词约束所要求的见第2节。我们使用固定的上下文示例来提高对所需JSON输出格式的遵从性。开放域KG提取避免了首先需要识别哪些本体片段与输入文本相关并将其包含在LLM提示词中如Zhang和Soh2024以及Feng等人2024所做的那样。因此提示词更短减少了Token使用量同时也提高了前缀缓存命中率。此外正如我们在第5.1节和5.2节中所示在大型输入上下文中提供本体约束会减少推理模型提取的三元组数量从而降低问答性能。3.2 类型与谓词的规范化步骤2。我们将步骤1中提取的开放域类型和谓词分别映射或规范化到本体允许的类型和谓词。最近Chepurova等人2026提出对每个提取的三元组执行多次LLM调用以规范化主语和宾语实体类型然后规范化谓词使结果三元组满足域-范围约束。然而当应用于数千个三元组时这会产生显著的Token开销。我们通过做出以下简化假设来寻求更高效的Token方法。首先我们假设在步骤1中与相同开放域类型关联的实体应该具有来自本体的相同规范类型。其次我们假设共享相同开放域谓词的提取三元组表达相同的关系语义因此它们的谓词应以相同方式规范化。这些假设避免了多次执行LLM调用来规范化常见类型例如human类型或谓词。我们在接下来描述的利用嵌入相似度的规范化步骤中利用了这些假设。3.3 类型感知的实体去重步骤3。从语料库中提取KG的常见方法是将文本分割成块在每个块上运行KG提取方法然后合并获得的KGZhang and Soh, 2024; Mo et al., 2025。然而这通常会产生指向同一概念但标签不同的实体因此实体去重步骤是必要的。最近Mo等人2025提出了一种两步算法首先基于嵌入对实体进行聚类然后使用LLM在每类中迭代识别重复项。我们采用这种方法同时利用步骤2中的类型信息。特别是被类型化为字面量如数字或日历日期的实体被排除在去重之外从而减小了聚类大小。到目前为止我们讨论了OAK一种提取KG的方法使得实体类型和谓词被映射到给定本体中的类型和谓词。然而提取的KG可能仍然包含本体约束违规我们接下来将对其进行校正。4 本体违规的校正实体类型使我们能够符号化地检测哪些三元组和限定词违反了哪些本体约束。这与依赖LLM进行错误检测的方法形成对比例如检测不允许的类型Arun et al., 2025、分类类成员错误Allen and Groth, 2024以及支持人在回路验证Regino and dos Reis, 2025。在收集了违反本体的三元组和限定词之后我们提示LLM通过从一组句法变换中进行选择来校正它们。需要注意的是由于我们在KG提取之后校正本体违规我们的方法可以事后应用于任何KG提取方法。接下来我们描述校正不一致三元组的方法。4.1 校正三元组为了激发用于校正本体违规的句法变换集合我们识别了若干KG提取错误——每种错误都暗示了一个特定的校正操作。4.2 校正限定词5 实证评估我们回答以下问题Q1. 我们的方法提取的KG相对于本体的有多一致以及它的Token效率如何Q2. 我们校正本体违规的算法是否仍然保留问答任务所需的文本语义Q3. 提取的KG是否适合通过SPARQL查询进行符号化查询数据集和本体。遵循Gutierrez等人2024和Chepurova等人2026我们关注HotpotQAYang et al., 2018和MuSiQueTrivedi et al., 2022数据集的片段这些片段包含文本段落和自然语言问题。遵循Feng等人2024和Chepurova等人2026我们还使用了一个Wikidata本体片段包含类型层次结构、允许的谓词及相关约束Vrandecic and Krotzsch, 2014。我们在附录A中详细说明。基线。我们比较的对象包括KGGEN一种无本体的KG提取方法Mo et al., 2025WIKONTIC针对Wikidata类型层次结构和域-范围约束Chepurova et al., 2026以及一个定制的上下文内基线将第2节中定义的约束的口头化表述作为LLM上下文的一部分插入详情见附录D。尽管KGGEN不依赖现有本体我们仍就其效率和下游问答性能进行比较。据我们所知WIKONTIC是与我们的方法最接近的具有公开实现的方法。遵循WIKONTIC采用的问答设置我们保留了违反本体的三元组和限定词。我们还报告了基于文本的方法的结果例如向量RAGLewis et al., 2020a和HippoRAGv2Gutierrez et al., 2025。LLM。我们所有的实验使用指令微调的Qwen3-30B-A3B-INSTRUCT2507-FP8简称Qwen3-30B-A3B或推理模型GPT-OSS-120B以及用于文本嵌入的Qwen3-Embedding-0.6B。5.1 Q1. 一致性与效率在表1中我们展示了在HotpotQA上提取的三元组和限定词数量以及一致的三元组和限定词的比例。通过应用我们的后提取校正第4节称为OAKMEND我们提高了OAK第3节提取的三元组和限定词的本体一致性。即我们将有效三元组或限定词的百分比从使用Qwen3-30B-A3B时的63.4%或33.6%提高到96.8%或91.5%从使用GPT-OSS-120B时的67.9%或35.7%提高到98.4%或96.8%。当使用Qwen3-30B-A3B时实现的本体一致性高于IN-CONTEXT基线和WIKONTIC而在使用GPT-OSS-120B时仍具有可比性。然而我们的OAKMEND方法在提示词和完成Token方面更高效。我们通过对提示词和完成Token进行不同权重来展示这一点因为它们的开销不同。与WIKONTIC的Token成本归一化为100%相比OAKMEND在Qwen3-30B-A3B上的成本为59%在GPT-OSS-120B上为79%。附录E显示了在MuSiQue上的类似结果。5.2 Q2. 问答实验我们评估了我们的方法在编码对问答有用的知识方面的能力。对于所有方法我们采用了Chepurova等人2026设计的多步问答方法该方法将一个多跳问题迭代分解为更简单的单跳问题每个问题由LLM回答。在回答单跳问题时LLM被要求从问题中提取相关实体然后通过嵌入相似度将其链接到提取的KG中的实体。链接的实体用于检索相关的三元组和限定词这些提供了回答问题的上下文。重要的是对于每个问题我们不为其所支持的文本保留单独的KG相反我们在进行问答之前将从所有支持文本中提取的知识合并到一个统一的KG中。遵循问答文献的惯例在表2中我们报告了预测答案与真实答案之间的精确匹配EM和 F1F1 指标排除冠词。OAK取得了最好或第二好的问答结果因此与KGGEN、WIKONTIC和IN-CONTEXT基线相比具有竞争力。此外应用基于本体的校正导致问答性能几乎没有或没有损失这表明校正保留了三元组和限定词的语义。最后表E.2显示了关于限定词的消融实验进一步支持了Chepurova等人2026的发现即限定词提升了问答性能。5.3 Q3. 支持SPARQL查询的模式我们评估提取的KG在多大程度上适合SPARQL查询其中与底层本体的一致性至关重要见第2节。为了将我们的评估与自然语言到SPARQL翻译这一具有挑战性的任务解耦Gashkov et al., 2025; Perevalov and Both, 2025我们引入了一个基准测试用于测量基本图模式BGP的出现频率。BGP是抽象的子图定义为形成SPARQL查询中WHERE子句的三元组连接例如第2节中的查询。因此它们在提取的KG中的存在是执行SPARQL查询的必要条件。BGP数据集。我们从LSQ-2.0集合Saleem et al., 2015; Stadler et al., 2024中提取了在Wikidata端点上执行的查询的BGP数据集。这产生了数百个谓词上的数千个BGP。此外为了获得更大规模的模式集我们使用复杂查询回答文献中常见的模板从本体的域-范围约束中人工生成BGPGregucci et al., 2025。我们在附录B中详述了两个BGP数据集的过程和统计信息。指标。评估提取KG的一种方式是简单地比较BGP匹配的总频率。然而由于某些BGP出现的频率远高于其他BGP我们使用也考虑罕见BGP的指标。受h指数和i10指数指标的启发——这些指标奖励作者拥有一致的高被引论文产出——我们采用类似指标来奖励在多样化的模式集中以一致的高频率匹配许多BGP的方法。在表3中我们报告了在所有模式上计算的h指数和i100指数指标以及连接两个实体的链接平均数量边多重性和具有两个或更多链接的连接主语-宾语对的百分比。最后两个指标作为冗余三元组的合理性检查这些冗余三元组用不同的谓词编码相同的信息因为这种冗余可能以引入歧义为代价人为地提高BGP匹配数。结果。我们的OAKMEND在Qwen3-30B-A3B上仅次于IN-CONTEXT基线但后者具有较高的边多重性。如表E.5中详述这是因为IN-CONTEXT提取了实体对之间的高度冗余三元组编码相同信息但使用略有不同含义的不同谓词。而在GPT-OSS-120B上我们的OAKMEND取得了与WIKONTIC相似的性能远优于IN-CONTEXT且没有异常高的边多重性。在所有情况下我们的基于本体的校正都提高了h指数。在附录E和附录E中我们分别报告了仅在基于LSQ-2.0或人工模式上取得的结果。6 结论我们提出了一种基于本体的KG提取方法事后校正本体违规与基于重复LLM调用或长本体感知上下文的现有方法相比提高了Token效率。我们的方法得到了评估KG提取多个方面的实验支持本体一致性、问答性能、Token效率以及对符号化查询的适用性。特别是我们已经表明有针对性的LLM预测校正显著提高了本体一致性同时保留了语义准确性。据我们所知这是第一项通过如此广泛的实证评估来研究KG提取的工作同时也提供了对Wikidata本体的深入评估。最后我们相信我们的SPARQL图模式基准可以作为定量评估KG提取方法在多大程度上支持基于SPARQL查询的有用工具。局限性我们的实验集中在Wikidata中可用的通用本体上因为这是KG提取社区中的流行设置。然而也可以考虑针对特定领域构建的自定义本体例如生物医学KGWalsh et al., 2020。我们认为LLM所取得的性能是否能推广到自定义甚至闭源本体仍然是一个理解不足的问题。此外我们的方法需要详细的本体规范包括域-范围和限定词约束而这些可能并不可用。此外在我们的实验中我们仅限于开源权重的LLM。虽然这促进了可重复性和透明度但进一步利用闭源但更强大的LLM进行实验可以提供不同KG提取方法所取得性能的更详细概述。最后我们的工作缺乏通过在执行于提取KG上的SPARQL查询来测量问答性能的比较。这是因为这需要实验将自然语言问题转换为SPARQL查询的文本到SPARQL翻译技术Gashkov et al., 2025; Perevalov and Both, 2025。由于这已经是一个非常具有挑战性的开放问题在我们的工作中我们转而依赖基于SPARQL查询图模式出现频率的代理指标。