Avaliação da influência do uso de embeddings no reconhecimento de entidades nomeadas para o português
Loading...
Date
Authors
Journal Title
Journal ISSN
Volume Title
Publisher
Universidade Federal de Catalão
Abstract
O Reconhecimento de Entidades Nomeadas (REN) é uma tarefa crucial no contexto atual, uma vez que há uma crescente demanda por ferramentas automatizadas capazes de extrair informações de textos. Embora seja uma área amplamente estudada, a REN ainda é complexa e exige um alto custo de tempo e recursos computacionais, especialmente em línguas com poucos recursos, como o português, que carece de dados anotados e modelos treinados com alto desempenho. Com o objetivo de contribuir para o desenvolvimento dessa tarefa na língua portuguesa, este trabalho aplicou a arquitetura de Aprendizado Profundo (AP), BiLSTM-CRF, a partir do Framework FlairNLP, testando diferentes tipos de Vetores de Palavras, Vetores Estáticos e Vetores de Contexto, bem como suas concatenações, para analisar a influência de cada um nos resultados obtidos. Os modelos treinados mostraram um ganho expressivo no uso de Vetores de Contexto e concatenação de vetores, atingindo um novo estado da arte com uma média F1 de 98,88% para o domínio geral no Corpus multilíngue MultiWikiNER, no domínio legal 89,31% para o Corpus LeNER-Br e 86,86% para o Pl- Corpus, que faz parte do UlyssesNER-Br.