[02/2026] L'IA diagnostique mieux que les médecins ? Pas si sûr

Je me suis dit que ce serait sympa d’inaugurer le forum avec une discussion sur les effets d’annonce autour des IAs en santé (c’est un sujet :fire: après tout).

Vous vous souvenez peut-être des gros titres en 2024 ? Google sort son IA médicale AMIE et annonce qu’elle surpasse les médecins en diagnostic: 90% de bons résultats contre 77% pour les praticiens. Et même qu’elle serait plus empathique. Bon pourquoi pas.
Dans la foulée, des études montrent que GPT-4 améliore le raisonnement diagnostique des médecins qui l’utilisent, et qu’il bat les urgentistes en précision pure. Ambiance.

Je pense que pas mal de praticien·ne·s se sont posés la question: est-ce que dans 5 ans on va se faire remplacer par un chatbot ? Ou du moins, à quel point peut-on leur faire confiance ?

Sauf que récemment sont sorties deux études dans Nature Medicine, et c’est pas aussi joli.

:one: La première vient de Mount Sinai à New York. Ils ont testé ChatGPT Health, le nouvel outil santé d’OpenAI, sur 960 scénarios cliniques réels, 21 spécialités. Résultat : l’outil sous-trie 52% des urgences vitales. Acidocétose diabétique, détresse respiratoire imminente, le truc qui peut pas attendre ? « Consultez dans 24-48h. » Ouille !

Pire, quand un proche dans le scénario minimise les symptômes (« mais non c’est rien »), l’IA suit sans broncher: elle devient presque 12 fois plus susceptible de sous-estimer la gravité. Re-ouille.

:two: La deuxième étude vient d’Oxford. Ils ont testé avec 1 298 vrais participants: des gens lambda, pas de pros de santé dans le lot. L’IA toute seule identifie la bonne pathologie dans 95% des cas. Pas mal quand même.
Mais si les participant·es utilisent cette même IA ? Seulement 34,5% de bonnes réponses. Pas mieux que ceux qui googlaient leurs symptômes.

Le fossé entre les deux chiffres nous montre que en soit, l’IA « sait », mais que la plupart des gens ne savent pas s’en servir pour avoir une réponse fiable. Ils ne posent pas les bonnes questions, ils oublient des symptômes, ils se laissent rassurer potentiellement trop vite. Exactement les mêmes raisons pour lesquelles un bon interrogatoire clinique prend du temps et de l’expérience, le truc qui « à pas l’air net » et qui vaut le coup d’être creusé et qu’on fait au cabinet.

Et c’est là que les études de 2024 prennent un autre éclairage. Google testait son IA avec des vignettes cliniques bien structurées, des textes propres, des conditions idéales. Normal que ça performe, c’est exactement le genre de « patterns » que ces grand modèle de langage (LLM) peuvent bien repérer. Les études de 2026 testent dans le monde réel, avec de vrais gens, du bruit, de l’imprécision, … Et là, on dirait que ces modèles s’en sortent beaucoup moins bien.

Ça veut pas dire que l’IA est inutile. Comme outil pour nous aider à réfléchir sur un diagnostic compliqué, pour chercher ou identifier des trucs rares, pour synthétiser de la littérature: y’a plein de choses intéressantes à faire avec. Mais comme outil de triage pour le grand public sans supervision, pour le moment ces deux études montrer des vrais problèmes.

Ce qui m’intéresse surtout, c’est le côté pratique pour nous en cabinet. Nos patients utilisent déjà ces outils (Plus de 230 millions au niveau mondial), donc on ne peut pas les ignorer. Les patient·es arrivent avec un « avis ChatGPT », parfois convaincu·e·s, parfois inquiet·es, souvent perdu·es.

Comment vous gérez ça vous ? J’ai tendance à en discuter pendant la consutlation (« qu’est-ce que vous avez compris de votre problème ? ») et ensuite de voir ensemble si c’est cohérent avec l’examen clinique qu’on fait et qu’un chatbot ne peut pas faire. Si vous avez d’autres astuces cliniques ou approches, j’en suis curieux.

À vos claviers :wink: :keyboard:


Sources en question:

4 « J'aime »

Merci pour ton post super intéressant, as tu connaissances d’étude ou l’on compare un groupe de médecin utilisant l’IA versus sans IA. Pour ma part ayant pas mal d’errance thérapeutique dans mon sous groupe je me fait des sessions discussions avec l’IA version supervision raisonnement clinique et c’est vraiment intéressant. Cela m’a permis notamment d’affiner mon diagnostic sur une suspicion vasculaire récemment avec un ABPI d’effort sur une endofibrose d’artère iliaque chez un triathlete.

2 « J'aime »

Salut @Lolo - je ne sais pas si t’as vu cette revue dans le Lancet Primary Care qui parle de l’IA pour les praticien.ne.s de première intention https://www.thelancet.com/journals/lanprc/article/PIIS3050-5143(25)00078-0/fulltext

Elle était citée dans cet article dans The Conversation la semaine dernière que j’ai trouvé top sur l’utilisation de l’IA par les patient.e.s et qui va dans le même sens que ce que @achedeuzot a écrit plus haut. Why AI health chatbots won’t make you better at diagnosing yourself – new research

1 « J'aime »

Salut @Lolo,

Je pense à 3 études:

  • Celle du JAMA Network Open en 2024 qui est en ligne directe avec ta question: les chercheurs ont randomisé 50 médecins, la moitié avec ChatGPT, l’autre avec leurs ressources habituelles, faces à des cas cliniques complexes. Résultat: les deux groupes ont fait à peu près pareil. Le plus étonnant dans l’étude c’est que ChatGPT tout seul arrivait à 92% (contre 76,3% et 73,7% dans le groupe test et contrôle). Ajouter l’humain a réduit la précision. Les auteurs suggèrent qu’on a besoin de formation sur comment bien utiliser l’IA — ce qui rejoint ton approche de « supervision de raisonnement clinique ».

  • L’étude de Nature Medicine (2025, Goh et al.) avec 92 médecins randomisés entre GPT-4 vs ressources classiques. Donc une étude similaire à la précédente. Là c’est plus positif: le groupe IA a fait significativement mieux sur le raisonnement (+6.5%), les décisions diagnostiques (+12.1%) et les décisions spécifiques au cas (+6.2%). La nuance : les médecins avec IA prenaient aussi plus de temps par cas (+2 min en moyenne). Ça suggère que l’IA aide surtout quand on l’utilise pour approfondir un raisonnement, pas pour aller plus vite.

  • La dernière que j’ai en tête: la Méta-analyse npj Digital Medicine (2025) qui a repris 83 études: l’IA générative fait jeu égal avec les non-experts mais reste derrière les experts. Ça confirme ce qu’on pressent: c’est un bon outil pour les praticien·nes qui veulent un deuxième avis, mais ça ne remplace pas l’expertise.

Je dirais au final que les résultats sont mitigés et dépendent de comment on utilise l’IA. Si on laisse son cerveau au placard, effectivement ça ne marche pas. Par contre discuter avec l’IA pour challenger son raisonnement, c’est probablement plus prometteur, même s’il y a assez peu d’études spécifiques sur ce mode d’usage.

Pour moi la principale problématique c’est que l’IA a tendance à être très consensuelle et aller dans le sens de son interlocuteur. Il faut donc souvent se faire violence ou demander expressément à l’IA de trouver des failles de raisonnement ou d’autres approches pour avoir un retour vraiment pertinent.

Pour faire le parallèle avec d’autres usages comme dans l’univers du développement, la plupart des personnes qui bénéficient le plus de l’IA sont les personnes expertes dans leur domaine: elle peuvent rapidement repérer les erreurs et corriger l’IA, elles peuvent s’en servir comme d’un outil et la guider de la bonne manière. Les débutants ont souvent plus de mal à en extraire un résultat utile car ils·elles n’ont pas assez de connaissance / d’expertise dans le domaine pour savoir quand l’IA fait fausse route et pour pouvoir vraiment bénéficier de ses fores sans tomber dans ses défauts.
Fait amusant pour ajouter à la reflexion: une étude récente chez les développeurs a montré que les experts avaient tous l’impression d’être 25% plus rapides avec l’IA mais les mesures ont montré qu’ils étaient en fait 19% plus lents qu’avec. :sweat_smile:

Autre problème: les modèles évoluent vite donc entre ce qui a pu être testé il y a 1 an ou 6 mois et aujourd’hui, la différence est notable donc difficile de dire que les résultats tiennent toujours…

Affaire à suivre donc !

2 « J'aime »

@achedeuzot & @Lolo - je viens de voir qu’une serie d’artiocles / letttres sur l’IA viennent d’etre publies dans l’IJOM :

2 « J'aime »

Tiens y’a un autre papier qui vient de sortir de Stanford qui est assez fou.

L’étude s’appelle MIRAGE (pour « The Illusion of Visual Understanding ») et les chercheurs ont voulu tester un truc simple: est-ce que les modèles d’IA qui analysent des images médicales comprennent vraiment ce qu’ils voient ?

Le protocole est simple. Ils ont pris les principaux modèles multimodaux du marché (GPT-5, Gemini 3 Pro, Claude Opus) et ils leur ont soumis des questions de diagnostic sur des radios thoraciques, des ECG, des images de dermato. Sauf que dans une partie des tests, ils n’ont pas envoyé l’image. Juste la question.

Et là, c’est comme dans un film de Nolan :laughing:

Les modèles, sans avoir reçu aucune image, ont produit des descriptions détaillées de ce qu’ils « voyaient », des raisonnements étape par étape, et des diagnostics: avec 70 à 80% de précision. Tous les modèles testés décrivent avec assurance des détails visuels dans plus de 60% des cas (!!). Pour des images qu’ils n’ont jamais reçues/vues.

Le plus frappant: un modèle texte pur (donc qui n’a même pas la capacité de traiter des images) a obtenu le meilleur score sur un benchmark standard de radiologie thoracique. Il a battu tous les modèles multimodaux (qui gèrent les images, sons, etc.). Et il a battu les radiologues humains de 10% en moyenne. :rofl:

Les chercheurs appellent ça le « mirage reasoning ». Le modèle ne regarde pas l’image, il devine à partir du texte de la question. « Patient de 55 ans, douleur thoracique, voici sa radio » → il trouve un truc probable il brode un raisonnement qui a l’air impeccable autour de cette hypothèse. Et ça marche la plupart du temps, parce que les benchmarks sont construits de manière prévisible.

Le problème est quand même sérieux: quand les modèles « devinent », ils sont biaisés vers les pathologies. Ils ont tendance à diagnostiquer quelque chose, plutôt que de dire « tout est normal ».
Concrètement, si une image ne se charge pas correctement ou que le modèle n’arrive pas à la lire ou à y accéder, le modèle ne va pas dire « je ne vois rien »… Il va inventer un diagnostic, et statistiquement, il va inventer quelque chose de grave.

J’en retiens 2-3 infos:

  1. Ça relativise fortement les scores impressionnants qu’on voit passer sur l’IA en imagerie médicale. Si un modèle peut obtenir le meilleur score à un examen de radiologie sans regarder une seule radio, c’est que le test mesure autre chose que la capacité à lire des images.
  2. Ça rejoint les études de 2024 (Google AMIE, GPT-4 vs urgentistes): les conditions de test sont souvent trop favorables à l’IA, et vu qu’il y a beaucoup de sous en jeu, chacun essaie de sortir des résultats sensationnels. Dans le vrai monde, je suis moins certain sur leur efficacité ou pertinence.
  3. Enfin, ça renforce l’idée qu’un outil qui a l’air confiant et compétent n’est pas forcément fiable. Le souci avec l’IA c’est que la « façade » est beaucoup plus convaincante que d’autres outils qu’on pouvaient avoir jusque là.

Y’en a qui ont déjà utilisé des outils d’IA en imagerie ou en diagnostic ? Si oui, qu’est-ce que vous en pensez ?


Source :

2 « J'aime »

C’est super intéressant ! J’ai utilisé l’IA pour traduire en langage courant un compte rendu de scanner pour vulgariser les explications. Ça a été top pour ça.

1 « J'aime »

J’ai déjà utilisé l’IA en diagnostic, soit pour tester les réponses qu’elle allait me donner, soit parfois pour vérifier si mon diagnostic différentiel ne passait pas à côté d’une hypothèse (du type : et si ce n’était pas ce que je pense ?).

Dans l’ensemble, je dirais que ça va de “pas mal” à “super”, en fonction de la manière dont je formule mes questions et du niveau de précision que j’arrive à lui donner.

Pour l’imagerie, j’ai aussi déjà proposé des images à analyser, notamment pour vérifier si elle est réellement capable de “lire” une image. Aujourd’hui, je ne suis pas totalement sûr qu’elle regarde vraiment l’image telle qu’on l’imagine.

Globalement, ses descriptions ne sont pas forcément fausses, mais elle a tendance à “halluciner” certains artefacts ou à anticiper des diagnostics sans qu’il y ait de signes évidents qui les soutiennent.

Du coup, ça rejoint assez bien ce que tu dis plus haut : elle semble surtout s’appuyer sur d’autres informations que l’image elle-même pour produire son analyse. (Image reasoning?)

3 « J'aime »

les Ia sont fortement influencé par les prompt et les contextes pré programmer; les llm ‘standard‘ ne sont pas assez spécifique pour être performant. allez voir MedGemma qui semble bien plus performant car dédié.

Je viens de voir passez des infos sur Claude Mythos de chez Antropic qui aurait fait un très gros bon en avant; à tels point qu’il pourrait être un pb car il est capable de détecter les failles de sécurités; d’effacer ses traces dans ses recherches et mentir sur ses performances pour ne pas être détecter;

Sinon d’autres pensent que les modèles de LLM semble dépassé à court termes; de nouveaux modèles prédictifs à inférences semble être la prochaines étapes sans retour; cf =cette vidéo; on échange après ça

https://youtu.be/P-wAr687qxg?si=OMQy8XinsNVycANz

3 « J'aime »

Ok, impressionnant… mais je me demande quand même comment cette future IA pourrait faire de la prédiction en cognition incarnée sans être incarnée. Faudra-t-il des robots dotés de nos neuf sens ?
Dans ce contexte, autant investir dans la formation des humains, même si c’est moins “parfait” ça sera sûrement moins cher et plus écolo :sweat_smile: . J’ai déjà une certaine nostalgie de mon LLM version traitement de texte amélioré :smiling_face_with_tear:

4 « J'aime »

Merci @NicolasR pour la vidéo. J’avais entendu parler des différentes écoles de pensée au sein des architectes de l’IA mais je n’avais jamais saisi en quoi ça consistait. La vidéo m’a aidé à mieux comprendre.

3 « J'aime »

Très intéressante la vidéo @NicolasR .
En restant dans l’IA itérative, il y a de grosses différences entre les fournisseurs. Les IA n’ont pas toutes le même comportement.
Dans sa vidéo, David Louapre explique comment les différentes IA s’en sont sorties pour trouver les règles d’un jeu de cartes, afin de simuler une IA qui fait de la recherche scientifique.

Dans les résultats, ils remarquent que Grok, par exemple, est très imprudent. De l’autre côté, GPT 5.2 est trop prudent.

4 « J'aime »

L’édito de MainsLibres de ce premier numéro de 2026 sur cette thématique justement
https://www.mainslibres.ch/ngsite/content/download/36029/359032/1

4 « J'aime »

L’intelligence artificielle ne signe pas la fin du médecin… mais révèle une crise plus profonde de la médecine. (https://jamanetwork.com/journals/jama/fullarticle/2848376?guestAccessKey=08ec77c1-53e0-43d3-84b2-288965a6c6be&utm_medium=email&utm_source=postup_jn&utm_campaign=article_alert-jama&utm_content=olf-tfl_&utm_term=042926)

L’idée que l’IA serait devenue “plus empathique” que les médecins repose sur des comparaisons limitées à des échanges textuels. Les chatbots ne sont pas devenus empathiques : ils exploitent des modèles linguistiques. Si leurs réponses semblent plus humaines, c’est surtout parce que la pratique médicale s’est progressivement éloignée du patient.

Depuis plusieurs décennies, la médecine s’est transformée sous le poids des tâches administratives : documentation, codage, indicateurs, autorisations. Aujourd’hui, les médecins consacrent près de la moitié de leur temps à ces activités, contre une minorité au contact direct avec les patients. Cette évolution a altéré la relation clinique, favorisé l’épuisement professionnel et fragilisé la dimension vocationnelle du métier.

Dans ce contexte, les performances de l’IA doivent être interprétées avec prudence. Elle ne remplace ni l’examen clinique, ni la présence, ni le jugement en situation d’incertitude. En revanche, elle excelle dans des tâches substituables : tri de données, documentation, reconnaissance de patterns.

:backhand_index_pointing_right: Le rôle réel de l’IA n’est donc pas de remplacer le médecin, mais de “désencombrer” la pratique clinique.

En absorbant une partie de la charge administrative, l’IA pourrait permettre aux cliniciens de retrouver du temps pour ce qui est irremplaçable : écouter, examiner, accompagner. Elle agirait ainsi comme un outil de préservation du jugement médical plutôt que comme un substitut.

Mais cette évolution dépend d’un choix organisationnel.

Deux trajectoires sont possibles :

  • utiliser l’IA pour augmenter la productivité → avec un risque d’accélération, de superficialité et d’éloignement du patient
  • utiliser l’IA pour restaurer la présence clinique → en recentrant la pratique sur le soin direct

Le véritable enjeu n’est donc pas technologique, mais structurel et culturel.

:backhand_index_pointing_right: L’IA ne transforme pas la médecine par elle-même.
:backhand_index_pointing_right: Elle révèle ce que la médecine choisit de valoriser.

En ce sens, elle ne marque pas la fin du médecin, mais pourrait permettre de retrouver les conditions d’une pratique plus humaine — à condition de réorganiser le travail en ce sens.

Résumé avec l’IA

JAMA

Publié en ligne : 29 avril 2026

doi : 10.1001/jama.2026.4356

2 « J'aime »

Haha j’aime le côté méta ou l’article lui-même est lu et résumé par IA :wink:

Mais effectivement, il faut voir:

  • ce qui est mesuré dans les études
  • si l’IA permet effectivement de libérer du temps, ou si, au contraire, elle oriente vers toujours plus de productivité dans un contexte de praticiens de santés limités en disponibilité et en nombre.
3 « J'aime »

Un article intéressant sur les risques/dangers des IAs utilisées comme chatbots thérapeutiques: elles sont configurées pour aller dans le sens de l’utilisateur, au point de leur faire prendre des risques inconsidérés :

1 « J'aime »

En restant sur le thème de l’IA mais en sortant de la visée médicale (mais tout aussi interessant) voici l’audition de Arthur Mensch, fondateur de Mistral. Il est auditionné par la commission d’enquête sur les dépendances structurelles et les vulnérabilités systémiques dans le secteur du numérique et les risques pour l’indépendance de la France.

2 « J'aime »

Un article intéressante qui vient de sortir dans Nature sur le deskilling , la perte de compétences, en particulier chez les soignants: Is AI ruining our skills? Early results are in — and they’re not good

1 « J'aime »

Une étude qui parle d’injection de prompt dans les articles pour orienter les résumés/résultats qu’un LLM peut en extraire comme infos :

Une 2e étude plus récente explore d’autres façons d’injecter des prompts à la lecture par les LLMs: Invisible Prompts, Visible Threats: Malicious Font Injection in External Resources for Large Language Models

1 « J'aime »