SampurNER_Bengali_MuRIL:终极孟加拉语细粒度命名实体识别模型全面解析
SampurNER_Bengali_MuRIL终极孟加拉语细粒度命名实体识别模型全面解析【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRILSampurNER_Bengali_MuRIL是一款基于Google MuRIL模型优化的孟加拉语细粒度命名实体识别工具通过EaMaTa框架在SampurNER数据集上训练而成能够精准识别文本中8大类、66小类实体类型为孟加拉语自然语言处理任务提供强大支持。 模型核心优势细粒度实体识别能力该模型采用Few-NERD细粒度标签体系将实体分为8个主类别和66个子类别实现更精准的语义理解Location包括GPE地理政治实体、水体、岛屿、山脉等7个子类Person涵盖演员、艺术家、运动员、政治家等8种人物类型ORG细分为公司、教育机构、政府组织、媒体等9类组织实体其他类别Building建筑、Art艺术作品、Product产品、Event事件和Misc其他卓越性能表现经过6轮训练优化模型达到行业领先水平Precision精确率66.54%Recall召回率70.08%F1分数68.26% 快速上手指南环境准备首先安装必要依赖pip install smolagents gradio_client基础使用示例通过AWED-FiNER工具调用模型进行实体识别from tool import AWEDFiNERTool tool AWEDFiNERTool( space_idprachuryyaIITG/AWED-FiNER ) result tool.forward( textজুড বেলিংহাম 2023 সালে রিয়াল ম্যাড্রিডে যোগ দিয়েছিলেন।, languageBengali ) print(result)⚙️ 技术细节解析模型架构基于BertForTokenClassification架构构建关键参数包括隐藏层维度1024注意力头数量16隐藏层数量24词汇表大小197285训练配置采用以下参数实现最佳性能学习率5e-5批处理大小64优化器AdamW权重衰减0.01训练轮次6 相关资源数据集模型训练基于SampurNER数据集该数据集采用EaMaTa框架构建是首个针对22种印度语言的细粒度命名实体识别资源。学术引用如果您在研究中使用此模型请引用以下论文inproceedings{kaushik2026sampurner, title{SampurNER: Fine-Grained Named Entity Recognition Dataset for 22 Indian Languages}, volume{40}, url{https://ojs.aaai.org/index.php/AAAI/article/view/40405}, DOI{10.1609/aaai.v40i37.40405}, number{37}, journal{Proceedings of the AAAI Conference on Artificial Intelligence}, author{Kaushik, Prachuryya and Anand, Ashish}, year{2026}, month{Mar.}, pages{31410-31418} } misc{kaushik2026awedfineragentswebapplications, title{AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers}, author{Prachuryya Kaushik and Ashish Anand}, year{2026}, eprint{2601.10161}, archivePrefix{arXiv}, primaryClass{cs.CL}, url{https://arxiv.org/abs/2601.10161}, } 部署与扩展SampurNER_Bengali_MuRIL作为AWED-FiNER框架的一部分可与其他语言专家模型协同工作支持多语言细粒度实体识别任务。项目完整代码和更多使用示例可通过以下方式获取git clone https://gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL 贡献者Prachuryya KaushikProf. Ashish AnandSampurNER_Bengali_MuRIL为孟加拉语NLP社区提供了强大的细粒度实体识别能力无论是学术研究还是工业应用都能显著提升文本理解的深度和准确性。通过结合先进的预训练模型和精心构建的本地数据集该工具为低资源语言的自然语言处理开辟了新的可能性。【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考