Les LLMs rivalisent avec les modèles EHR spécialisés pour la prédiction clinique
Une étude publiée dans npj Digital Medicine démontre que les grands modèles de langage (LLMs) généralistes, en convertissant les codes médicaux en texte naturel, produisent des embeddings capables de rivaliser avec CLMBR-T-Base, un modèle fondation EHR spécialisé, sur 15 tâches cliniques du benchmark EHRSHOT. Validés sur la UK Biobank, les embeddings LLM surpassent même le modèle spécialisé sur certaines tâches grâce à une meilleure couverture du vocabulaire médical (84% des codes UK Biobank étaient invisibles pour CLMBR-T-Base). L'approche évite l'accès aux données médicales privées pour l'entraînement.