ESPECIALIZAÇÃO DE UMA LLM PARA O CONTEXTO DA MEDICINA BRASILEIRA EM LÍNGUA PORTUGUESA POR MEIO DE FINE-TUNING
INTRODUÇÃO: Os grandes modelos de linguagem apresentam potencial para apoiar a educação médica e o raciocínio clínico, porém grande parte das evidências disponíveis deriva de avaliações em língua inglesa e do contexto norte-americano. OBJETIVOS: Esse trabalho tem o objetivo de avaliar o desempenho de modelos de linguagem em benchmarks médicos brasileiros e internacionais, investigar os efeitos do idioma e da tradução e desenvolver uma inteligência artificial especializada na medicina brasileira, denominada Charcot. MATERIAIS E MÉTODO: A metodologia foi dividida em duas etapas. Na primeira,modelos proprietários e abertos já existentes foram avaliados em questões do Revalida e da prova de título da Sociedade Brasileira de Cardiologia. Em seguida,foram construídos benchmarks com questões do Revalida e do USMLE, em seus idiomas originais e em versões traduzidas. A fidelidade das traduções foi avaliada pelo BERTScore, enquanto as diferenças de desempenho foram analisadas pelo teste de McNemar e por bootstrap. Na segunda etapa, foi desenvolvido o Charcot por meio de uma abordagem híbrida de fine-tuning e arquitetura de agentes. O modelo foi então comparado a outras LLMs nas 99 questões válidas do ENAMED 2026, em cinco execuções independentes. RESULTADOS: Diversos modelos apresentaram desempenho satisfatório no Revalida, mas nenhum atingiu a nota de corte da avaliação especializada em cardiologia. Nos benchmarks cruzados, a acurácia foi geralmente maior no USMLE, e as questões no idioma original apresentaram pequena vantagem sobre as versões traduzidas, apesar da elevada preservação semântica. No ENAMED, o Charcot obteve a maior acurácia média, com 96,97%, seguido pelo GPT-5, com 94,34%, e pelo Gemini 2.5 Pro, com 93,94%. Seu desempenho foi comparável ao dos principais modelos comerciais e superior ao dos modelos de abertos avaliados. Os resultados demonstram que idioma, contexto nacional e grau de especialização influenciam o desempenho das LLMs. CONSIDERAÇÕES FINAIS: O Charcot apresentou resultados promissores para a medicina brasileira, embora avaliações em questões de múltipla escolha não substituam validações em cenários clínicos reais nem a supervisão profissional.
PALAVRAS-CHAVE: inteligência artificial; grandes modelos de linguagem; medicina brasileira; Charcot; benchmarks médicos.
Votação encerrada.