Logo PUCPR

GRANDES MODELOS DE LINGUAGEM PARA TEXTOS CLÍNICOS EM PORTUGUÊS: ANONIMIZAÇÃO E ABREVIATURAS

NEVES, Gustavo Melo de Oliveira Barbosa¹; BARRA, Claudia Maria Cabral Moro³
Curso do(a) Estudante: Medicina – Escola de Medicina e Ciências da Vida – Câmpus Curitiba
Curso do(a) Orientador(a): Engenharia de Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: A proteção de dados sensíveis na saúde é regulamentada pela Lei Geral de Proteção de Dados (LGPD) e pela HIPAA, tornando a anonimização de textos clínicos imprescindível para resguardar a privacidade dos pacientes e viabilizar o compartilhamento seguro de informações para pesquisas. A utilização de Grandes Modelos de Linguagem (LLMs) executados localmente desponta como uma alternativa viável para evitar a transmissão e o vazamento de dados em infraestruturas na nuvem. OBJETIVOS: O trabalho visou explorar LLMs compactos operando em ambiente local, integrados a Expressões Regulares (Regex), para identificar e anonimizar informações pessoais sensíveis contidas em prontuários eletrônicos em português brasileiro MATERIAIS E MÉTODO: Foram avaliados dois modelos de linguagem executados via Ollama: o Llama-3.1-8b e o Gemma-3-Gaia-PT-BR-4b-it. A amostragem foi composta por 60 textos clínicos sintéticos obtidos do corpus AnonyMED-BR. Esses textos foram anonimizados manualmente por anotadores com base em um guideline específico para gerar um gabarito de referência com placeholders. Foi construído um pipeline automatizado de processamento e pós-processamento determinístico com Regex. O desempenho dos modelos foi mensurado utilizando as métricas de precision, recall e F1-score para oito categorias distintas de entidades sensíveis RESULTADOS: A inclusão do refinamento com Regex promoveu um ganho substancial no recall e no F1-score de ambos os modelos. O pipeline baseado no Llama 3.1 8b associado ao Regex apresentou a melhor performance global, alcançando Micro F1-score de 0,851 e Micro Recall de 0,870, superando o arranjo Gaia + Regex, que obteve Micro F1-score de 0,776 e Micro Recall de 0,802. A camada de Regex demonstrou elevada eficácia no resgate de dados numéricos padronizados, como datas e telefones, embora tenha provocado um leve acréscimo de falsos positivos, reduzindo pontualmente a precision CONSIDERAÇÕES FINAIS: A solução híbrida (LLM local + Regex) mostrou-se promissora para a desidentificação automatizada de textos clínicos em português, sem expor informações confidenciais à nuvem. Conclui-se que o modelo Llama 3.1 8b integrado ao Regex foi a abordagem mais robusta empregada nessa pesquisa.

PALAVRAS-CHAVE: Anonimização de dados; Modelos de Linguagem de Grande Escala; Registros Eletrônicos de Saúde; Processamento de Linguagem Natura; HIPAA.

APRESENTAÇÃO EM VÍDEO

Esta pesquisa foi desenvolvida com bolsa PUCPR no programa PIBITI.
Legendas:
  1. Estudante
  2. Orientador
  3. Colaborador

QUERO VOTAR NESTE TRABALHO

Votação encerrada.