ANÁLISE COMPARATIVA DAS RESPOSTAS DE CHATGPT E GEMINI ÀS DÚVIDAS DE PACIENTES DO SUS SOBRE HPB
INTRODUÇÃO: A inteligência artificial (IA) tem sido cada vez mais utilizada pela população como fonte de informação acerca de informações sobre saúde, o que levanta preocupações quanto à veridicidade e segurança do conteúdo, sobretudo em pacientes com condições urológicas prevalentes como a hiperplasia prostática benigna (HPB). OBJETIVOS: analisar comparativamente a qualidade, coerência e acurácia das respostas geradas pelas inteligências artificiais ChatGPT e Gemini, sobre hiperplasia prostática benigna de pacientes atendidos no SUS, com base na avaliação de médicos especialistas MATERIAIS E MÉTODO: estudo observacional, transversal e comparativo, de abordagem quantitativa e qualitativa, conduzido no Ambulatório de Urologia do Hospital Universitário Cajuru (Curitiba, PR). As questões foram coletadas por meio de inquérito com duas perguntas abertas, transcritas e uniformizadas. Foram registradas 109 amostras, das quais se agruparam em um total de 33 perguntas, após revisões e exclusões. Dentre este grupo, 83 das 109 ocorrências, resumiram as 15 perguntas mais frequentes, sendo estas submetidas ao ChatGPT e ao Gemini (versões gratuitas), em um novo chat para cada dúvida em cada software. As respostas foram avaliadas por dois urologistas, ambos com experiência na área, utilizando escalas Global Quality Scale (GQS), DISCERN e Likert, além de questionar se a resposta apresentaria risco ao paciente. Resultando em um nível de significância de 5% ao aplicar o teste de Shapiro-Wilk, teste de Wilcoxon (para amostras pareadas) e teste exato de McNemar para avaliação do risco. RESULTADOS: Para ambas as plataformas de inteligência artificial, as medianas de GQS e DISCERN foram 4, e 3 para as de Likert. A grande maioria das respostas foram classificadas como satisfatórias, porém foram identificadas respostas não adequadas e conteúdos com possível risco aos pacientes. Não foram observadas diferenças estatisticamente significativas em nenhum dos quatro desfechos avaliados: GQS (p=0,272), DISCERN (p= 0,426), escala Likert (p=0,565) e risco (p=0,625). Houve uma variação de nula a moderada, quanto à concordância entre os observadores. CONSIDERAÇÕES FINAIS: As inteligências artificiais escolhidas para análise apresentaram um desempenho satisfatório, sem diferença estatística significativa entre elas, porém não foi comprovada equivalência. Deve-se ter cautela ao interpretar os achados, devido à amostra reduzida, mas reforçam que esta tecnologia pode auxiliar no acesso inicial à informação, mas sem substituir a avaliação médica.
PALAVRAS-CHAVE: Inteligência Artificial; Hiperplasia Prostática Benigna; Sistema Único de Saúde; Informação em Saúde; Chatbots.
Votação encerrada.