Avaliação da influência do uso de embeddings no reconhecimento de entidades nomeadas para o português
| dc.contributor.advisor1 | Silva, Nádia Félix Felipe da | |
| dc.contributor.advisor1Lattes | http://lattes.cnpq.br/7864834001694765 | |
| dc.contributor.referee1 | Silva, Nádia Félix Felipe da | |
| dc.contributor.referee1Lattes | http://lattes.cnpq.br/7864834001694765 | |
| dc.contributor.referee2 | Moura Júnior, José dos Reis Vieira de | |
| dc.contributor.referee3 | Cordeiro, Douglas | |
| dc.creator | Gomes Junior, Carlos Silvio | |
| dc.creator.Lattes | http://lattes.cnpq.br/5883330816583160 | |
| dc.date.accessioned | 2026-10-08T13:27:25Z | |
| dc.date.available | 2026-10-08 | |
| dc.date.issued | 2023-08-31 | |
| dc.description.abstract | Named Entity Recognition (NER) is a crucial task in today's context, as there is an increasing demand for automated tools capable of extracting information from texts. Although NER is a widely studied area, it remains complex and requires a high cost in terms of time and computational resources, especially in languages with few resources, such as Portuguese, which lacks annotated data and high- performance trained models. In order to contribute to the development of this task in Portuguese language, this work applied the Deep Learning (DL) architecture, BiLSTM-CRF, using the FlairNLP Framework, testing different types of Word Embeddings, Static Embeddings, Contextualize Embeddings, and their concatenations, to analyze their influence on the results obtained. The trained models showed a significant gain in the use of Contextualize Embeddings and Embeddings concatenation, achieving a new state of the art with an F1 score of 98.88% for the general domain in the MultiWikiNER multilingual corpus, in the legal domain 89.31% for the LeNER-Br Corpus and 86.86% for the Pl-Corpus, which is part of the UlyssesNER-Br. | |
| dc.description.resumo | O Reconhecimento de Entidades Nomeadas (REN) é uma tarefa crucial no contexto atual, uma vez que há uma crescente demanda por ferramentas automatizadas capazes de extrair informações de textos. Embora seja uma área amplamente estudada, a REN ainda é complexa e exige um alto custo de tempo e recursos computacionais, especialmente em línguas com poucos recursos, como o português, que carece de dados anotados e modelos treinados com alto desempenho. Com o objetivo de contribuir para o desenvolvimento dessa tarefa na língua portuguesa, este trabalho aplicou a arquitetura de Aprendizado Profundo (AP), BiLSTM-CRF, a partir do Framework FlairNLP, testando diferentes tipos de Vetores de Palavras, Vetores Estáticos e Vetores de Contexto, bem como suas concatenações, para analisar a influência de cada um nos resultados obtidos. Os modelos treinados mostraram um ganho expressivo no uso de Vetores de Contexto e concatenação de vetores, atingindo um novo estado da arte com uma média F1 de 98,88% para o domínio geral no Corpus multilíngue MultiWikiNER, no domínio legal 89,31% para o Corpus LeNER-Br e 86,86% para o Pl- Corpus, que faz parte do UlyssesNER-Br. | |
| dc.description.sponsorship | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) | |
| dc.identifier.uri | https://repositorio.ufcat.edu.br/handle/123456789/12275 | |
| dc.language | por | |
| dc.publisher | Universidade Federal de Catalão | |
| dc.publisher.country | Brasil | |
| dc.publisher.department | Instituto de Matemática e Tecnologia | |
| dc.publisher.initials | UFCAT | |
| dc.publisher.program | Programa de Pós-Graduação em Gestão Organizacional | |
| dc.rights.access | Acesso aberto | |
| dc.subject | REN | |
| dc.subject | Aprendizado profundo | |
| dc.subject | BiLSTM-CRF | |
| dc.subject | Vetores de palavras | |
| dc.subject.cnpq | CIENCIAS EXATAS E DA TERRA | |
| dc.subject.en | NER | |
| dc.subject.en | Deep learning | |
| dc.subject.en | BiLSTM-CRF | |
| dc.subject.en | Word embeddings | |
| dc.title | Avaliação da influência do uso de embeddings no reconhecimento de entidades nomeadas para o português | |
| dc.title.alternative | Evaluation of the Influence of embedding usage on named entity recognition for portuguese | |
| dc.type | Dissertação |