bert-portuguese-ner数据集指南如何获取与使用葡萄牙语NER标注数据【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-nerbert-portuguese-ner是基于neuralmind/bert-base-portuguese-cased模型微调的葡萄牙语命名实体识别NER模型专为档案文献设计可精准识别日期、职业、人物、地点和组织等实体。本文将详细介绍如何获取与使用该模型的标注数据帮助新手快速上手葡萄牙语NER任务。葡萄牙语NER数据集概述核心功能与标注类型该模型在葡萄牙语档案文献的NER任务上表现优异支持5种实体类型标注Date日期如15 de setembro de 2023Profession职业如engenheiro工程师Person人物如Maria SilvaPlace地点如Lisboa里斯本Organization组织如Universidade de Lisboa数据集来源与获取方式所有训练和评估数据可通过官方渠道获取http://ner.epl.di.uminho.pt/⚠️ 提示该数据集适用于学术研究和非商业用途使用前请遵守数据授权协议。模型性能与数据集质量关键评估指标在测试集上的表现如下数据来源于README.md准确率Accuracy97.00%精确率Precision91.47%召回率Recall94.83%F1分数93.12%训练数据规模模型在4个epochs内完成训练采用以下超参数配置文件training_args.bin学习率2e-05批次大小16训练/16评估优化器Adambetas(0.9,0.999)epsilon1e-08数据集使用步骤1. 准备工作环境确保安装以下依赖库版本信息来自README.mdTransformers 4.10.0.dev0PyTorch 1.9.0cu111Datasets 1.10.2Tokenizers 0.10.32. 获取模型与数据集# 克隆仓库 git clone https://gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner cd bert-portuguese-ner # 从官方地址下载数据集 wget http://ner.epl.di.uminho.pt/dataset.zip unzip dataset.zip -d data/3. 数据预处理使用模型配套的分词器处理文本数据配置文件tokenizer_config.json包含分词器参数如do_lower_case: falsespecial_tokens_map.json定义特殊符号[UNK],[SEP],[PAD]等示例预处理代码from transformers import BertTokenizer tokenizer BertTokenizer.from_pretrained(./) text João é engenheiro na Universidade de Lisboa desde 2010. inputs tokenizer(text, return_tensorspt, paddingTrue, truncationTrue)4. 实体识别应用加载模型进行预测from transformers import BertForTokenClassification model BertForTokenClassification.from_pretrained(./) outputs model(**inputs) predictions outputs.logits.argmax(dim-1)实际应用场景与案例档案文献分析该数据集特别适用于葡萄牙语历史档案的自动化处理例如从殖民时期文献中提取人物关系网络分析不同时期职业分布特征地理名称的历史变迁追踪学术研究支持根据论文NER in Archival Finding Aids: Extended该数据集已用于开发NERDI web平台推动档案文献的智能检索研究。常见问题解决数据格式转换若需将数据集转换为CoNLL格式可参考以下字段映射原始标注 → CoNLL格式Date → DATEProfession → MISCPerson → PERPlace → LOCOrganization → ORG模型微调建议如需使用自定义数据微调模型建议调整学习率1e-05 ~ 5e-05训练轮次3 ~ 5 epochs实体标签保持与原始数据集一致的标注体系总结bert-portuguese-ner数据集为葡萄牙语NER任务提供了高质量的标注资源结合预训练模型可快速实现实体识别功能。无论是学术研究还是实际应用该数据集都能为葡萄牙语文本分析提供有力支持。通过本文介绍的步骤您可以轻松获取并应用这些数据开启葡萄牙语命名实体识别的探索之旅。【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考