Avaliação da influência do uso de embeddings no reconhecimento de entidades nomeadas para o português

dc.contributor.advisor1Silva, Nádia Félix Felipe da
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/7864834001694765
dc.contributor.referee1Silva, Nádia Félix Felipe da
dc.contributor.referee1Latteshttp://lattes.cnpq.br/7864834001694765
dc.contributor.referee2Moura Júnior, José dos Reis Vieira de
dc.contributor.referee3Cordeiro, Douglas
dc.creatorGomes Junior, Carlos Silvio
dc.creator.Latteshttp://lattes.cnpq.br/5883330816583160
dc.date.accessioned2026-10-08T13:27:25Z
dc.date.available2026-10-08
dc.date.issued2023-08-31
dc.description.abstractNamed Entity Recognition (NER) is a crucial task in today's context, as there is an increasing demand for automated tools capable of extracting information from texts. Although NER is a widely studied area, it remains complex and requires a high cost in terms of time and computational resources, especially in languages with few resources, such as Portuguese, which lacks annotated data and high- performance trained models. In order to contribute to the development of this task in Portuguese language, this work applied the Deep Learning (DL) architecture, BiLSTM-CRF, using the FlairNLP Framework, testing different types of Word Embeddings, Static Embeddings, Contextualize Embeddings, and their concatenations, to analyze their influence on the results obtained. The trained models showed a significant gain in the use of Contextualize Embeddings and Embeddings concatenation, achieving a new state of the art with an F1 score of 98.88% for the general domain in the MultiWikiNER multilingual corpus, in the legal domain 89.31% for the LeNER-Br Corpus and 86.86% for the Pl-Corpus, which is part of the UlyssesNER-Br.
dc.description.resumoO Reconhecimento de Entidades Nomeadas (REN) é uma tarefa crucial no contexto atual, uma vez que há uma crescente demanda por ferramentas automatizadas capazes de extrair informações de textos. Embora seja uma área amplamente estudada, a REN ainda é complexa e exige um alto custo de tempo e recursos computacionais, especialmente em línguas com poucos recursos, como o português, que carece de dados anotados e modelos treinados com alto desempenho. Com o objetivo de contribuir para o desenvolvimento dessa tarefa na língua portuguesa, este trabalho aplicou a arquitetura de Aprendizado Profundo (AP), BiLSTM-CRF, a partir do Framework FlairNLP, testando diferentes tipos de Vetores de Palavras, Vetores Estáticos e Vetores de Contexto, bem como suas concatenações, para analisar a influência de cada um nos resultados obtidos. Os modelos treinados mostraram um ganho expressivo no uso de Vetores de Contexto e concatenação de vetores, atingindo um novo estado da arte com uma média F1 de 98,88% para o domínio geral no Corpus multilíngue MultiWikiNER, no domínio legal 89,31% para o Corpus LeNER-Br e 86,86% para o Pl- Corpus, que faz parte do UlyssesNER-Br.
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
dc.identifier.urihttps://repositorio.ufcat.edu.br/handle/123456789/12275
dc.languagepor
dc.publisherUniversidade Federal de Catalão
dc.publisher.countryBrasil
dc.publisher.departmentInstituto de Matemática e Tecnologia
dc.publisher.initialsUFCAT
dc.publisher.programPrograma de Pós-Graduação em Gestão Organizacional
dc.rights.accessAcesso aberto
dc.subjectREN
dc.subjectAprendizado profundo
dc.subjectBiLSTM-CRF
dc.subjectVetores de palavras
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA
dc.subject.enNER
dc.subject.enDeep learning
dc.subject.enBiLSTM-CRF
dc.subject.enWord embeddings
dc.titleAvaliação da influência do uso de embeddings no reconhecimento de entidades nomeadas para o português
dc.title.alternativeEvaluation of the Influence of embedding usage on named entity recognition for portuguese
dc.typeDissertação

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
Dissertação - Carlos Silvio Gomes Junior.pdf
Size:
1.16 MB
Format:
Adobe Portable Document Format

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.72 KB
Format:
Item-specific license agreed upon to submission
Description: