Reconhecimento de entidades nomeadas para o português usando redes neurais

Santos Neto, Joaquim Francisco dos

Por favor, use este identificador para citar o enlazar este ítem: https://hdl.handle.net/10923/16456

Registro completo de metadatos

Campo DC	Valor	Idioma
dc.contributor.advisor	Vieira, Renata
dc.contributor.author	Santos Neto, Joaquim Francisco dos
dc.date.accessioned	2020-01-03T12:01:36Z	-
dc.date.available	2020-01-03T12:01:36Z	-
dc.date.issued	2019	pt_BR
dc.identifier.uri	http://hdl.handle.net/10923/16456	-
dc.description.abstract	Abordagens modernas para o Reconhecimento de Entidades Nomeadas (REN) utilizam Redes Neurais para automaticamente extrair features de textos e as incorporar no processo de classificação. Word Embeddings, que é um tipo de Modelo de Linguagem (ML), é um ingrediente chave para melhorar a performance dos sistemas de REN. Mais recentemente, ML Contextualizados, que se adaptam de acordo com o contexto em que a palavra aparece, também se mostraram indispensáveis. Nessa dissertação, mostra-se como diferentes combinações de Word Embeddings e ML Contextualizados impactam na tarefa de REN em língua portuguesa. Foi explorado como a diversidade textual e o tamanho do corpus de treino usado nos ML impactam nos resultados dessa tarefa. Também, é apresentado um estudo comparativo de 16 combinações de diferentes ML entre contextualizados e Word Embeddings. As avaliações foram realizadas no corpus Mini-HAREM, amplamente adotado neste tema. O melhor resultado alcançado nesta pesquisa, ultrapassa a abordagem estado-da-arte em 5,99%, em um cenário de cinco categorias, e 4,31% quando são consideradas as dez categorias do HAREM. Além das avaliações no HAREM, também foram estudados domínios específicos dessa tarefa. Os resultados nestes casos, foram avaliados nos corpora de contexto Clínico, Policial e Geológico. Em todos, foram obtidos resultados superiores ou competitivos em relação a outras abordagens.	pt_BR
dc.description.abstract	Modern approaches to Named Entity Recognition (NER) use Neural Networks to automatically extract text features and incorporate them into the classification process. Word Embeddings, a type of Language Model (LM), are a key ingredient for improving the perfor- mance of NER systems. More recently, Contextualized LM, which adapt according to the context in which the word appears, have also proved indispensable. This master’s thesis shows how different combinations of Word Embeddings and Contextualized LM impact the NER task in Portuguese. The impact of textual diversity and size of the training corpus used in the construction of LMs were explored by the results of this task. Also, a compar- ative study of 16 combinations of different LMs, contextualized and Word Embeddings, is presented. Evaluations were performed in the Mini-HAREM corpus, widely adopted in the Portuguese NER task. The best result achieved in this research surpasses the state-of- the-art approach by 5.99% in a five-category scenario and 4.31% when considering the ten HAREM categories. In addition to the HAREM assessments, specific domains of this task were also studied. The results in these cases were evaluated in Clinical, Police and Geolog- ical context corpora. Superior or competitive results were obtained for all corpora in relation to other approaches.	en_US
dc.language.iso	Português	pt_BR
dc.publisher	Pontifícia Universidade Católica do Rio Grande do Sul	pt_BR
dc.rights	openAccess	en_US
dc.subject	LINGUAGEM	pt_BR
dc.subject	REDES NEURAIS (COMPUTAÇÃO)	pt_BR
dc.subject	INFORMÁTICA	pt_BR
dc.title	Reconhecimento de entidades nomeadas para o português usando redes neurais	pt_BR
dc.type	masterThesis	pt_BR
dc.degree.grantor	Pontifícia Universidade Católica do Rio Grande do Sul	pt_BR
dc.degree.department	Faculdade de Informática	pt_BR
dc.degree.program	Programa de Pós-Graduação em Ciência da Computação	pt_BR
dc.degree.level	Mestrado	pt_BR
dc.degree.date	2019	pt_BR
dc.publisher.place	Porto Alegre	pt_BR
Aparece en las colecciones:	Dissertação e Tese

Ficheros en este ítem:

Fichero	Descripción	Tamaño	Formato
000497219-Texto+completo-0.pdf	Texto completo	1,95 MB	Adobe PDF	Abrir Ver

Mostrar el registro sencillo del ítem Ver estatísticas Busque otras versiones de este texto através de SFX

Todos los ítems en el Repositorio de la PUCRS están protegidos por derechos de autor, con todos los derechos reservados, y están bajo una licencia de Creative Commons Reconocimiento-NoComercial 4.0 Internacional. Sepa más.