Logo PUCPR

GRANDES MODELOS DE LINGUAGEM NA EXTRAÇÃO DE TERMOS CLINICOS DE TEXTOS EM PORTUGUÊS

NOGUEIRA, Karen Cristini¹; BARRA, Claudia Maria Cabral Moro³
Curso do(a) Estudante: Ciência da Computação – Escola Politécnica – Câmpus Curitiba
Curso do(a) Orientador(a): Engenharia de Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: A extração de informações de narrativas clínicas é fundamental para a estruturação de dados em saúde. No entanto, o formato não estruturado dos textos e a escassez de corpora anotados em português brasileiro limitam o uso de técnicas automatizadas. Grandes Modelos de Linguagem (LLMs) têm demonstrado capacidade de generalização para novas tarefas com poucos exemplos, o que os torna alternativas promissoras para o Reconhecimento de Entidades Nomeadas (NER) clínico. OBJETIVOS: Este estudo avaliou e comparou o desempenho de dois LLMs de código aberto: LLaMA 3.1 (8B), modelo de propósito geral, e Gemma-Gaia (4B), adaptado ao português clínico, na extração de entidades em narrativas cardiológicas. MATERIAIS E MÉTODO: Foram selecionadas aleatoriamente 100 narrativas da especialidade cardiologia a partir do corpus SemClinBr, contendo 2.446 entidades anotada, que foram utilizadas na avaliação do NER. O pipeline foi executado em duas configurações: na primeira, o LLaMA atuou como extrator e o Gemma-Gaia como juiz; na segunda, os papéis foram invertidos. Ambos os modelos foram executados localmente via Ollama. Para a extração, os parâmetros de inferência foram: temperatura 0.2, top-p 0.9, número máximo de tokens 32768 e penalidade de repetição 1.1. O modelo juiz (temperatura 0.0) foi utilizado para classificar expansões de abreviações e mapeamentos terminológicos. Um pipeline de validação semântica consolidou entidades, expandiu abreviações, mapeou termos para SNOMED CT e CID, e avaliou os resultados contra gold standard RESULTADOS: O LLaMA 3.1 alcançou F1 de 0.731, superior ao Gemma-Gaia (0.490), com diferença expressiva no Recall (0.641 contra 0.350). Ambos os modelos apresentaram Precisão elevada (0.850 e 0.816). O mapeamento para SNOMED CT e CID apresentou precisão de 50.23% e 45.31% para o LLaMA 3.1, e 52.88% e 46.58% para o Gemma-Gaia, considerando apenas os termos que receberam código. A expansão de abreviações apresentou altas taxas de aprovação pelo modelo juiz (97% para o LLaMA 3.1 e 95% para o Gemma-Gaia). CONSIDERAÇÕES FINAIS: Os resultados indicam que o modelo geral superou o adaptado na tarefa avaliada, sugerindo que a especialização linguística não garante ganhos automáticos de desempenho. O estudo contribui com uma avaliação empírica da extração de entidades clínicas por LLMs em português, oferecendo subsídios para a adoção dessas tecnologias em sistemas de informação em saúde no Brasil.

PALAVRAS-CHAVE: Natural Language Processing; Large Language Models; Electronic Health Records; Information Storage and Retrieval; Medical Informatics.

APRESENTAÇÃO EM VÍDEO

Esta pesquisa foi desenvolvida com bolsa CNPq no programa PIBITI.
Legendas:
  1. Estudante
  2. Orientador
  3. Colaborador

QUERO VOTAR NESTE TRABALHO

Votação encerrada.