发布时间:2026/8/14 7:20:43
从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手 从0到1掌握bert-portuguese-ner葡萄牙语NER模型的安装与快速上手【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-nerbert-portuguese-ner是一个基于BERT架构的葡萄牙语命名实体识别NER模型专为处理葡萄牙语档案文献设计。它能够精准识别文本中的日期、职业、人物、地点和组织等关键实体为葡萄牙语文本分析提供强大支持。 模型核心优势高准确率的实体识别能力该模型在评估集上达到了97.00%的准确率和93.12%的F1分数能够有效识别以下5类实体B-Data日期和I-Data日期内部B-Local地点和I-Local地点内部B-Organizacao组织和I-Organizacao组织内部B-Pessoa人物和I-Pessoa人物内部B-Profissao职业和I-Profissao职业内部专为葡萄牙语优化基于neuralmind/bert-base-portuguese-cased预训练模型微调针对葡萄牙语语法特点和档案文献领域进行了专项优化词汇表规模达29794个支持葡萄牙语特有词汇和拼写。 快速安装指南1. 克隆项目仓库git clone https://gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner cd bert-portuguese-ner2. 安装依赖环境确保已安装Python 3.7然后安装必要依赖pip install transformers4.10.0.dev0 torch1.9.0cu111 datasets1.10.2 tokenizers0.10.3 模型使用教程加载模型和分词器from transformers import BertTokenizer, BertForTokenClassification tokenizer BertTokenizer.from_pretrained(./) model BertForTokenClassification.from_pretrained(./)实体识别示例text João Silva trabalhou na Universidade de Lisboa em 2020. inputs tokenizer(text, return_tensorspt) outputs model(**inputs) predictions outputs.logits.argmax(dim2) # 将预测结果转换为实体标签 id2label model.config.id2label tokens tokenizer.convert_ids_to_tokens(inputs[input_ids][0]) for token, prediction in zip(tokens, predictions[0]): if token not in [[CLS], [SEP], [PAD]]: print(f{token}: {id2label[prediction.item()]}) 模型性能表现关键评估指标准确率Accuracy97.00%精确率Precision91.47%召回率Recall94.83%F1分数93.12%训练过程表现训练轮次训练损失验证损失F1分数1-0.14380.914820.24540.12220.919630.05260.10980.931240.03720.11400.9312⚙️ 模型配置详解核心参数隐藏层大小768注意力头数12隐藏层层数12最大序列长度512优化器Adam学习率2e-05实体标签映射完整的实体标签定义可在config.json中查看包含11种标签类型其中以B-开头的表示实体开始I-开头的表示实体内部O表示非实体。 数据集来源模型训练数据来自葡萄牙档案文献标注语料库可通过http://ner.epl.di.uminho.pt/获取完整数据集。该语料库包含大量历史档案文献标注精细适合葡萄牙语NER任务训练。 引用与致谢如果使用本模型请引用以下论文Article{make4010003, AUTHOR {Cunha, Luís Filipe and Ramalho, José Carlos}, TITLE {NER in Archival Finding Aids: Extended}, JOURNAL {Machine Learning and Knowledge Extraction}, VOLUME {4}, YEAR {2022}, NUMBER {1}, PAGES {42--65}, DOI {10.3390/make4010003} }模型基于neuralmind/bert-base-portuguese-cased预训练模型开发感谢原作者团队的贡献。 应用场景葡萄牙语历史文献数字化处理档案管理系统实体提取葡萄牙语新闻自动摘要学术论文实体标注辅助工具多语言NER系统构建组件【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/14 7:15:42

OpenStack用户必看:Gimbal如何无缝连接私有云与容器集群

OpenStack用户必看:Gimbal如何无缝连接私有云与容器集群 【免费下载链接】gimbal Gimbal is an ingress load balancing platform capable of routing traffic to multiple Kubernetes and OpenStack clusters. Built by Heptio in partnership with Actapio. 项目…

2026/8/14 11:21:53

DuckDB 深度实战:用 C++ 在进程内跑一个「分析型数据库」

1. 一句话介绍:DuckDB 到底是什么DuckDB 是一个纯 C 实现的、进程内嵌入式的分析型(OLAP)SQL 数据库,采用 MIT 开源协议。你肯定听说过 SQLite——它把数据库"装进"你的程序里,不用装服务器,一个…

2026/8/14 11:21:53

一劳永逸的全网资源嗅探下载神器:res-downloader 快速上手全攻略

一劳永逸的全网资源嗅探下载神器:res-downloader 快速上手全攻略 【免费下载链接】res-downloader 视频号、小程序、抖音、快手、小红书、直播流、m3u8、酷狗、QQ音乐等常见网络资源下载! 项目地址: https://gitcode.com/GitHub_Trending/re/res-downloader …

2026/8/14 11:21:53

AI Agent长期记忆技术解析:从HRR编码到Hermes框架的工程实践

1. 从“金鱼脑”到“老专家”:为什么AI Agent需要长期记忆?如果你玩过早期的AI聊天机器人,或者用过一些基础的RAG应用,可能会有一个感觉:它们像是只有七秒记忆的金鱼。你告诉它“我叫张三”,三句话之后它可…

2026/8/14 4:27:24

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/14 4:27:24

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/14 0:00:09

Flutter与OpenHarmony实现剧本杀组队表单开发实战

1. 项目概述在移动应用开发领域,跨平台框架Flutter因其高效的开发体验和出色的性能表现,已经成为众多开发者的首选。而OpenHarmony作为新兴的操作系统平台,其开放性和灵活性为开发者提供了全新的可能性。本文将聚焦于一个实际应用场景——剧本…

2026/8/14 0:00:09

VSCode高效Git管理:从入门到实战技巧

1. 为什么选择VSCode进行Git代码管理作为微软推出的轻量级代码编辑器,Visual Studio Code(简称VSCode)已经成为全球开发者使用率最高的编辑器之一。根据2023年Stack Overflow开发者调查,VSCode的市场占有率高达74.48%。它内置的Gi…

2026/8/14 4:27:24

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/14 4:27:24

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/14 4:27:24

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…