IA médicale : l'échec surprenant des LLM comme assistants grand public
Une étude randomisée sur 1 298 participants révèle que les grands modèles de langage (GPT-4o, Llama 3, Command R+), pourtant performants seuls sur les tâches médicales (94,9% de réussite diagnostique), échouent à améliorer les performances du public : moins de 34,5% de diagnostic correct avec assistance IA vs contrôle. L'interaction humain-IA identifiée comme obstacle majeur au déploiement médical grand public.