Benchmarking de grandes modelos de linguagem para extração de dados clínicos de prontuários médicos em português brasileiro em um hospital universitário

Conteúdo do artigo principal

Breno Gabriel Araújo Sampaio de Jesus
Tomaz Castrillon Figueiredo
Clariele de Almeida Pereira
Bruno Henrique Lira Anjos
Ney Cristian Amaral Boa Sorte
André Rodrigues Durães
Carlos Brites
Eduardo Martins Netto
Leandro Maciel Almeida
Cleber Zanchettin
Vinícius de Oliveira Menezes
Marcos Antônio Dórea Machado

Resumo:

O acesso a dados estruturados de prontuários eletrônicos de saúde (PES) continua sendo um grande desafio, particularmente em sistemas de saúde com recursos limitados e em idiomas diferentes do inglês. Este estudo realiza benchmarking de múltiplos grandes modelos de linguagem (LLMs) para a extração automatizada de variáveis clínicas estruturadas a partir de anotações médicas em português brasileiro em um ambiente com recursos computacionais limitados. Avaliamos cinco LLMs (GPT-4o mini, DeepSeek-V3, Mixtral-8x7B, LLaMA 8B e Qwen-32B) em relação a um conjunto de dados anotado e validado manualmente, composto por prontuários de pacientes ambulatoriais de cardiologia e infectologia. Os modelos foram implementados em versões quantizadas para otimizar a eficiência computacional. As respostas (outputs) dos modelos foram comparadas com anotações humanas utilizando F1-score, acurácia balanceada e sensibilidade (recall). Entre os modelos testados, o Qwen-32B alcançou o melhor desempenho tanto no domínio clínico da infectologia (acurácia balanceada = 0,91 [0,07]) quanto no domínio clínico da cardiologia (acurácia balanceada = 0,89 [0,07]). O desempenho dos modelos variou de acordo com a variável clínica, com melhores resultados para condições frequentemente e consistentemente documentadas (p.ex.: diabetes) e menor acurácia para variáveis complexas ou infrequentes (p.ex.: tumores). O tempo de extração variou de 0,9 a 24,2 minutos por paciente, dependendo do domínio clínico e do modelo de LLM. Esses achados indicam a viabilidade da implementação de ferramentas de processamento de linguagem natural baseadas em LLMs em cenários de saúde com recursos limitados e em idiomas diferentes do inglês. Pesquisas futuras devem avaliar modelos emergentes de grande porte e explorar domínios clínicos adicionais.

Palavras-chave:
Modelos de Linguagem de Grande Escala; Registros Eletrônicos de Saúde; Benchmarking
Biografia do Autor

Breno Gabriel Araújo Sampaio de Jesus, Digital Health Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Data curation and preprocessing; Software development and validation; Statistical analysis; Clinical evaluation and interpretation; Manuscript drafting; Manuscript revision and editing; Final approval of the manuscript.

Tomaz Castrillon Figueiredo, Digital Health Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Data curation and preprocessing; Software development and validation; Statistical analysis; Manuscript revision and editing; Final approval of the manuscript.

Clariele de Almeida Pereira, Digital Health Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Software development and validation; and Statistical analysis.

Bruno Henrique Lira Anjos, Nuclearis, Recife-PE, Brazil

Software development and validation; Statistical analysis; Final approval of the manuscript.

Ney Cristian Amaral Boa Sorte, Digital Health Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Clinical evaluation and interpretation; Manuscript revision and editing; Final approval of the manuscript.

André Rodrigues Durães, Department of Cardiology, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Clinical evaluation and interpretation; Manuscript revision and editing; Final approval of the manuscript: All authors.

Carlos Brites, Infectious Disease Research Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Clinical evaluation and interpretation; Final approval of the manuscript.

Eduardo Martins Netto, Infectious Disease Research Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Clinical evaluation and interpretation; Final approval of the manuscript.

Leandro Maciel Almeida, Centro de Informática, Universidade Federal de Pernambuco (CIn-UFPE), Recife-PE, Brazil

Software development and validation; Final approval of the manuscript.

Cleber Zanchettin, Centro de Informática, Universidade Federal de Pernambuco (CIn-UFPE), Recife-PE, Brazil

Software development and validation; Final approval of the manuscript.

Vinícius de Oliveira Menezes, Hospital das Clínicas da Universidade Federal de Pernambuco (HC/UFPE–Ebserh), Recife-PE, Brazil

Conceptualization; Software development and validation; Final approval of the manuscript.

Marcos Antônio Dórea Machado, Digital Health Laboratory, Hospital Universitário Professor Edgard Santos (HUPES-UFBA-Ebserh), Salvador-BA, Brazil

Conceptualization; Study design and supervision; Software development and validation; Statistical analysis; Manuscript drafting; Manuscript revision and editing; Funding acquisition; Project administration; Final approval of the manuscript.