如何用SampurNER_Bengali_MuRIL快速实现孟加拉语NER任务?5分钟上手教程

发布时间:2026/8/8 12:40:47
如何用SampurNER_Bengali_MuRIL快速实现孟加拉语NER任务?5分钟上手教程 如何用SampurNER_Bengali_MuRIL快速实现孟加拉语NER任务5分钟上手教程【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRILSampurNER_Bengali_MuRIL是一个基于Google MuRIL模型微调的孟加拉语细粒度命名实体识别NER工具专为处理孟加拉语文本中的实体识别任务设计。它能够精准识别文本中的人名、地点、组织、事件等多种实体类型是孟加拉语自然语言处理项目的高效解决方案。 为什么选择SampurNER_Bengali_MuRIL 细粒度实体识别能力该模型采用Few-NERD标签集支持8大类别Location、Person、ORG、Building、Art、Product、Event、Misc和数十种子类别的识别例如LocationGPE国家/城市、水体、岛屿、山脉等Person演员、艺术家、运动员、政治家等ORG公司、教育机构、政府组织、媒体等完整标签映射可查看模型配置文件config.json中的id2label字段。 出色的性能表现经过在SampurNER数据集上的优化训练模型达到Precision: 66.54Recall: 70.08F1分数: 68.26训练参数包括6个epochs、AdamW优化器、5e-5学习率和64的批处理大小详细配置见项目README.md。 快速开始5分钟安装与使用1️⃣ 准备环境首先确保已安装Python 3.8然后通过以下命令安装必要依赖pip install transformers torch2️⃣ 获取模型通过Git克隆项目仓库git clone https://gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL cd SampurNER_Bengali_MuRIL3️⃣ 简单使用示例使用Hugging Face Transformers库加载模型和分词器快速实现NER功能from transformers import AutoTokenizer, AutoModelForTokenClassification import torch # 加载模型和分词器 tokenizer AutoTokenizer.from_pretrained(./) model AutoModelForTokenClassification.from_pretrained(./) # 孟加拉语文本示例 text আমি ঢাকায় বাস করি এবং বাংলাদেশ বিশ্ববিদ্যালয়ে পড়ি # 预处理文本 inputs tokenizer(text, return_tensorspt, paddingTrue, truncationTrue) # 模型预测 with torch.no_grad(): outputs model(**inputs) predictions torch.argmax(outputs.logits, dim2) # 解析结果 tokens tokenizer.convert_ids_to_tokens(inputs[input_ids][0]) labels [model.config.id2label[pred.item()] for pred in predictions[0]] # 打印实体识别结果 for token, label in zip(tokens, labels): if label ! O: # 仅显示非其他标签 print(fToken: {token}, Label: {label}) 进阶应用AWED-FiNER工具集成SampurNER_Bengali_MuRIL是AWED-FiNER框架的一部分可通过官方工具实现更强大的多语言NER功能pip install smolagents gradio_clientfrom tool import AWEDFiNERTool tool AWEDFiNERTool(space_idprachuryyaIITG/AWED-FiNER) result tool.forward( textমোহন বাজারে একটি নতুন রেস্টুরেন্ট খোলা হয়েছে, languageBengali ) print(result) 数据集与模型细节基础模型google/muril-large-cased训练数据集prachuryyaIITG/SampurNER基于EaMaTa框架构建许可证MIT标签集细粒度Few-NERD标签系统支持多级实体分类详细技术文档可参考项目README.md及相关论文。 引用与贡献如果您在研究中使用该模型请引用以下论文inproceedings{kaushik2026sampurner, title{SampurNER: Fine-Grained Named Entity Recognition Dataset for 22 Indian Languages}, volume{40}, url{https://ojs.aaai.org/index.php/AAAI/article/view/40405}, DOI{10.1609/aaai.v40i37.40405}, number{37}, journal{Proceedings of the AAAI Conference on Artificial Intelligence}, author{Kaushik, Prachuryya and Anand, Ashish}, year{2026}, month{Mar.}, pages{31410-31418} }项目由Prachuryya Kaushik和Ashish Anand开发维护更多信息请访问AWED-FiNER GitHub仓库。通过SampurNER_Bengali_MuRIL您可以轻松构建孟加拉语NER应用从新闻分析到社交媒体监控满足各种文本处理需求。立即尝试开启高效的孟加拉语实体识别之旅吧【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考