DoTAT标注结果导出完整指南JSON格式深度解读一步对接模型训练数据集【免费下载链接】MarkToolDoTAT 是一款基于web、面向领域的通用文本标注工具支持大规模实体标注、关系标注、事件标注、文本分类、基于字典匹配和正则匹配的自动标注以及用于实现归一化的标准名标注同时也支持迭代标注、嵌套实体标注和嵌套事件标注。标注规范可自定义且同类型任务中可“一次创建多次复用”。通过分级实体集合扩大了实体类型的规模并设计了全新高效的标注方式提升了用户体验和标注效率。此外本工具增加了审核环节可对多人的标注结果进行一致性检验、自动合并和手动调整提高了标注结果的准确率。项目地址: https://gitcode.com/gh_mirrors/ma/MarkToolDoTAT 文本标注工具是一款基于 Web 的通用标注平台支持实体标注、关系标注、事件标注、文本分类及自动标注。标注完成后你可以在任务列表中一键导出标注结果为 JSON 格式直接对接模型训练数据集。本文带你快速掌握 JSON 字段含义与转换技巧。一句话速览任务列表 → 下载 → 得到任务名.json→ 解析字段 → 喂给训练代码。第一步如何快速下载 DoTAT 标注结果 JSON导出入口非常简单三步完成步骤操作说明1️⃣进入任务列表展示所有项目任务名、任务类型2️⃣点击目标任务操作列的下载按钮触发结果导出请求3️⃣浏览器自动保存文件文件名格式为任务名.json前端实现位于 taskList.vue其中downloadResult方法会把后端返回的result_file字段格式化为带 2 空格缩进的 JSON 文本再保存为本地文件——这就是你拿到的标注数据集。导出接口与数据结构接口定义project.js 中的getannres请求地址为/api/projects/epoches/{epochid}/docs/annotationResults/状态分发project.js 中的getannresaction导出逻辑taskList.vue 第 205–221 行⚠️提示DoTAT 支持迭代标注多轮每一轮epoch的结果独立统计。导出时请以当前轮次的最终结果为准如需更高质量的数据建议先走审核环节再导出。二、JSON 标注结果字段深度解读拿到 JSON 后每一条标注记录实体/事件论元通常包含以下核心字段1. 字符偏移定位实体的身份证字段类型含义doc数字所属文档 IDstart_offset数字实体起始字符位置含end_offset数字实体结束字符位置不含content字符串实体原文文本关键约定DoTAT 采用左闭右开区间[start_offset, end_offset)即end_offset start_offset 实体长度。这一点在源码 labeling.vue 中标注提交逻辑处可以清楚看到约第 2179–2213 行与你训练代码中切分字符串的写法完全一致text[start:end]。2. 类型与归属字段字段含义使用场景entity_template实体类型 ID实体标注任务映射为类别编号event_group_annotation事件组标注 ID事件标注任务中标记论元所属事件user标注者 ID追溯标注来源支持多人数据合并role角色/来源编号区分标注来源如自动匹配标注来源为 23. 不同任务类型的差异DoTAT 是面向领域的通用标注工具不同任务导出的 JSON 字段略有差异️实体标注以entity_template为核心start_offset/end_offset定位实体关系标注额外包含两端实体引用转换为 (头实体, 关系类型, 尾实体) 三元组事件标注通过event_group_annotation把论元归组到事件支持嵌套事件标注标准名标注归一化附带标准名字段可直接用于实体链接任务三、对接模型训练数据集最快配置方法1. 实体识别NER数据转换思路以 BERT-CRF / 大模型微调为例转换只需三步读取 JSON按doc字段分组取出对应文档原文用content建立 实体类型 → 类别编号 的映射entity_template→ label_id按start_offset ~ end_offset为每个字符打标签BIO / BIOES 方案✏️小建议若你的训练框架要求按 token 索引对齐而 DoTAT 偏移是字符级的请对原文做 tokenizer 时保留offset_mapping再做映射避免空格/标点错位。2. 事件与关系数据事件论元先按event_group_annotation分组再抽取触发词 论元槽位结构即可匹配多数事件抽取数据集格式关系三元组按实体 ID 关联两端content直接生成 (head, relation, tail) 训练样本3. 质量保障建议 先审核后导出DoTAT 内置审核环节reviewing.vue支持多人标注一致性检验、自动合并和手动调整可显著提高标注准确率去重与冲突处理同一文本区间多人标注时以审核合并后的最终结果为准留验证集导出后再按文档切分训练/验证集防止同一文档跨集泄漏四、常见问题FAQQ1导出的 JSON 是格式化过的吗是。JSON.stringify(data, null, 2)生成 2 空格缩进肉眼可读JSON.parse可直接加载。Q2自动标注的结果也在导出文件里吗在。字典匹配、正则匹配自动标注产生的实体会携带role: 2等来源标记见 labeling.vue 中dicuse/regularuse提交逻辑你可以在转换脚本中按需过滤或保留。Q3迭代标注多轮该用哪一轮取最后一轮人工修正后的结果如需数据增强可保留各轮结果做训练数据扩充。Q4文件名能自定义吗默认以任务名命名row.name .json下载后自行重命名即可不影响内容。写在最后DoTAT 通过任务列表一键下载的方式把标注成果沉淀为标准 JSON 数据集字符偏移左闭右开的约定与主流 NLP 训练流程无缝衔接。无论是 NER、关系抽取还是事件抽取只需一层轻量转换即可投产。快去试试吧【免费下载链接】MarkToolDoTAT 是一款基于web、面向领域的通用文本标注工具支持大规模实体标注、关系标注、事件标注、文本分类、基于字典匹配和正则匹配的自动标注以及用于实现归一化的标准名标注同时也支持迭代标注、嵌套实体标注和嵌套事件标注。标注规范可自定义且同类型任务中可“一次创建多次复用”。通过分级实体集合扩大了实体类型的规模并设计了全新高效的标注方式提升了用户体验和标注效率。此外本工具增加了审核环节可对多人的标注结果进行一致性检验、自动合并和手动调整提高了标注结果的准确率。项目地址: https://gitcode.com/gh_mirrors/ma/MarkTool创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考