如何用DeepKE把杂乱文本变成知识图谱?4步入门攻略来了
如何用DeepKE把杂乱文本变成知识图谱4步入门攻略来了【免费下载链接】DeepKE[EMNLP 2022] An Open Toolkit for Knowledge Graph Extraction and Construction项目地址: https://gitcode.com/gh_mirrors/de/DeepKE假设你手头躺着几千篇行业新闻老板想让你把其中的人物、公司、合作事件全部整理成一张结构化的表。纯手工标注一个月都未必做得完更麻烦的是明天新来一篇文章又得重新来一遍。这种从非结构化文本里持续榨出结构化知识的活儿正是DeepKE这款开源知识抽取工具包的看家本领。它由浙江大学团队开发、入选 EMNLP 2022专门解决如何把文本变成知识图谱这个难题。先别急着学技术看看你正被什么问题卡住很多新手接触知识图谱构建时第一反应是好复杂要从零搭一套框架。其实真正的痛点在别处数据整理标注好的数据要反复清洗格式稍有出入就报错模型选择不知道实体识别、关系抽取该用哪个模型只好一个个试场景切换数据量少、数据量大、带图片的文档、跨句子的长文本每种情况要求都不一样。DeepKE 的设计思路很朴素把算法选型和工程细节尽量替你打包好让你把精力留给数据和业务本身。一句话看懂DeepKE 是什么能替你干什么可以把 DeepKE 想象成一台文字榨汁机——喂进去的是新闻报道、论文摘要、合同条款榨出来的不是果汁而是实体、关系、属性、事件这些知识颗粒。这些颗粒再拼装起来就是一张可查询的知识图谱。架构图里能看到它的组织方式底层负责数据的预处理和加载中间层封装各种编码器和模型模块顶层则是训练、评估、预测的标准流程。换句话说换数据、换模型、换场景你都不需要从零重写代码。最快上手3 分钟跑通一个实体识别 Demo别急着啃原理先让它跑起来。最短路径是这样克隆仓库git clone https://gitcode.com/gh_mirrors/de/DeepKE按 requirements.txt 安装依赖也可以直接pip install deepke进入example/ner/standard目录运行run_lstmcrf.py用自带示例数据完成一次训练。训练完成后再用predict.py对一句新文本做预测你会看到模型把句子里的实体一个个标了出来。整个过程不需要改任何代码跑通了再谈原理也不迟。一个新闻案例串起全部核心能力光说不练假把式下面用一句话把它拆解清楚李雷于2024年加入深蓝科技有限公司担任算法工程师公司成立于2019年总部位于杭州。第一步把谁和什么找出来实体识别这句话里有三种实体人名李雷、机构名深蓝科技有限公司、地名杭州。DeepKE 的实体识别模块做的就是这个事中文识别是其强项支持通用命名实体识别人名、地名、组织名以及你自定义的任意实体类别。如果你想自己定义类别用 example/ner/prepare-data 里的工具就能把原始语料整理成标准标注格式。想要更强效果还可以切换到 W2NER 等进阶模型第二步把关系串起来关系抽取找到实体只是第一步还得知道它们之间是什么关系。李雷—任职于—深蓝科技有限公司、深蓝科技有限公司—总部位于—杭州这两组关系一出来知识图谱的骨架就有了。DeepKE 的关系抽取模块支持定义关系类型集合并内置了 CNN、RNN、BERT、Transformer 等多种编码器你可以根据数据规模和精度要求自由切换。第三步补全属性与三元组再进一步成立于2019年是深蓝科技公司的属性而把前面两步组合DeepKE 还能直接输出(李雷, 任职于, 深蓝科技有限公司)这样的三元组。三元组正是知识图谱最基础的存储单元攒够一批一张图就成型了。新手最容易踩的 4 个坑标签对不齐序列标注数据里token 和标签必须一一对应多一个空格、少一个词训练时就会出现莫名其妙的报错预训练模型没提前下载BERT 类模型首次运行要联网下载权重建议先下载到本地并配置好路径否则卡在下载这步很磨人中英文混用配置中文用英文分词配置或者反过来效果会断崖式下跌注意按数据集选择匹配的配置一上来就跑大模型默认配置未必适合你的显存先拿 CPU 小模型跑通流程再逐步升级。进阶玩法从标准监督到少样本、多模态与大模型跑通基础功能之后你会发现 DeepKE 的想象力远不止于此少样本场景训练数据只有几十条few-shot 示例展示了如何用小样本训练出可用的抽取器多模态场景文本和图片一起出现比如带配图的新闻multimodal 目录下的方案能把图像信息也利用起来文档级关系抽取关系跨越多个句子时document 示例提供了跨句建模思路大语言模型路线仓库里的 OneKE 与 InstructKGC 示例演示了如何微调大模型来完成抽取任务代表了当前最前沿的玩法。常见疑问快问快答Q一定要有 GPU 吗A不一定。CPU 可以跑通全部流程只是训练慢小数据量、小模型在 CPU 上完全可接受。Q中文支持好吗A中文是它的重点场景示例数据、文档都有完整中文版本还附带了中文预训练模型指引。Q支持哪些数据格式AJSON、CSV、TXT 都可以不同任务配了对应的预处理工具pretrained 目录下还有模型下载说明。Q和直接用大模型对话有什么区别A大模型适合随手问一句DeepKE 更强调可复现、可评估、可部署的工程化能力训练出的模型可以稳定批量处理数据还能用 F1 等指标量化效果。下一步动手做点什么这篇攻略讲的所有能力都藏在example/和docs/两个目录里照着示例跑一遍比看十遍文档都管用。建议你的第一步clone 仓库跑通实体识别 demo然后用 docs/source 里的教程把预测脚本改成处理你自己的数据。等实体识别顺手了再依次上手关系抽取、属性抽取最后把三者拼成一张属于你自己的知识图谱。从一段文字到一张图DeepKE 能帮你把这件事变成日常流程——而你需要做的只是迈出跑通第一个 demo 的那一步。【免费下载链接】DeepKE[EMNLP 2022] An Open Toolkit for Knowledge Graph Extraction and Construction项目地址: https://gitcode.com/gh_mirrors/de/DeepKE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考