Un jour, un ami radiologue m'a montré deux clichés côte à côte sur son écran. Le premier, une radiographie pulmonaire qu'il avait lue en quarante secondes. Le second, la même, avec un cercle rouge dessiné par un logiciel. Il avait raté le nodule. Moi aussi, d'ailleurs, quand il me l'a fait chercher. Et là, il a lâché cette phrase que je n'ai pas oubliée : « Le problème, ce n'est pas que l'IA soit meilleure que moi. C'est qu'elle ne se fatigue jamais. »
Depuis, je regarde l'intelligence artificielle appliquée à la médecine avec un mélange d'enthousiasme et de méfiance, et j'aimerais vous expliquer pourquoi les deux sont justifiés.
Points clés à retenir
- L'IA en médecine est aujourd'hui utile surtout sur des tâches étroites : analyser une image, trier un flux de patients, détecter une anomalie sur un signal.
- Une grande partie de ces logiciels sont juridiquement des dispositifs médicaux. Le marquage CE n'est pas un détail administratif, c'est ce qui conditionne leur usage réel.
- Les meilleurs résultats s'obtiennent quand l'algorithme travaille avec le médecin, pas à sa place.
- Les biais de données sont le talon d'Achille : un modèle entraîné sur une population donnée se comporte moins bien ailleurs.
- Beaucoup d'outils « gratuits » que l'on trouve en ligne ne sont ni certifiés, ni adaptés à un usage médical réel.
L'IA médicale, concrètement, ça ressemble à quoi ?
Oubliez les robots-chirurgiens et les diagnostics en trois secondes. Ce qui marche aujourd'hui, c'est beaucoup plus modeste, et c'est justement pour ça que ça marche.
La radiologie reste le terrain de jeu numéro un
L'imagerie, c'est le cas d'usage le plus mature. Pourquoi ? Parce que les données sont déjà numériques, abondantes, et que la tâche est visuellement cadrée : repérer une lésion sur des pixels. Un algorithme de détection de nodules pulmonaires ou d'hémorragie cérébrale a un terrain favorable. Sur ce type de mission précise, certains systèmes atteignent une sensibilité comparable à celle d'un radiologue expérimenté. Pas sur tout. Sur un type de lésion, dans des conditions d'acquisition données.
Et là, il faut que je sois honnête sur un truc que j'ai mal compris pendant longtemps.
L'aide à la décision, moins visible, souvent plus utile
Ce dont on parle moins, c'est le tri. Un service d'urgences qui reçoit cent passages par nuit, quelqu'un doit décider qui voit un médecin en premier. Des outils de priorisation existent, basés sur les constantes vitales et le motif d'entrée. Ils ne posent aucun diagnostic. Ils rangent une file d'attente. C'est ingrat, invisible, et ça peut changer une nuit.
Troisième famille : la prédiction sur dossiers structurés. Un modèle qui croise antécédents, biologie et traitements pour signaler un risque de réadmission. Ça fonctionne sur des données propres et standardisées. Ça s'effondre dès que les dossiers sont en texte libre mal rempli.
Et en médecine générale ?
C'est là que je tempère l'enthousiasme. La consultation de ville, c'est du texte, de l'ambigu, du contexte social, des patients qui minimisent ou dramatisent. Les modèles de langage sont impressionnants sur des cas d'école. Sur un motif flou (« je suis fatigué depuis deux mois »), ils racontent n'importe quoi avec beaucoup d'aplomb. J'ai testé plusieurs assistants de rédaction de compte-rendu : le gain de temps est réel pour la mise en forme, illusoire pour le raisonnement clinique.
Trois exemples qui disent mieux que n'importe quel discours
Ce qui manque partout, ce sont des cas précis. En voici quelques-uns, du plus connu au plus révélateur.
- La rétinopathie diabétique : un algorithme qui lit un fond d'œil et détecte les lésions. Utile là où il n'y a pas d'ophtalmologue à proximité. Le dépistage passe par une machine, pas par une file d'attente de six mois.
- L'analyse des signaux cardiaques : des modèles capables de repérer une fibrillation auriculaire sur un enregistrement, y compris quand le cardiologue la trouve discrète.
- Le repli d'un outil commercial : un logiciel de détection avait été déployé dans plusieurs hôpitaux, puis retiré. Motif : sur la population locale, il signalait trop de faux positifs, et les équipes passaient leur temps à vérifier des alertes inutiles. Pas un bug. Un problème de généralisation.
Ce dernier point mérite qu'on s'y attarde, parce qu'il est rarement raconté.
Le vrai talon d'Achille s'appelle le biais de données
Un modèle apprend ce qu'on lui montre. S'il n'a vu que des clichés pris sur un type d'appareil, dans un type d'hôpital, sur une population donnée, il devient très fort là-dessus et médiocre ailleurs. Le passage d'un jeu de test propre à la vraie vie est le moment où beaucoup de projets cassent. J'ai vu une équipe fêter des résultats excellents en interne, puis découvrir trois mois plus tard que l'imagerie d'un autre centre était trop différente pour le modèle. Personne n'avait envisagé ce scénario.
Quels sont les inconvénients de l'IA dans la médecine ?
La liste est plus longue qu'on ne le dit dans les communiqués.
La fatigue d'alerte. Si un outil signale dix faux positifs pour un vrai, le soignant finit par ignorer le signal. L'outil devient du bruit, et on a dépensé un budget pour ajouter du bruit.
Le déplacement de responsabilité. Qui est responsable quand un algorithme conseille et que le médecin suit à tort ? La question n'est pas tranchée. Dans les faits, la responsabilité reste sur le praticien. Ce qui crée une situation bizarre : on lui demande d'utiliser un outil dont il ne maîtrise pas les limites internes.
La donnée de santé. Ce sont des données parmi les plus sensibles qui existent. Héberger, entraîner, partager : chaque étape a des obligations lourdes. Un projet qui néglige cette partie ne verra jamais le jour en vrai.
Le coût d'entrée. Intégrer un outil certifié dans un logiciel métier déjà ancien, c'est des mois de travail informatique et de formation. Le coût réel n'est presque jamais le prix de la licence.
Un point juridique que tout le monde saute
Un logiciel qui aide à poser un diagnostic n'est pas une application comme les autres. En Europe, il relève de la réglementation sur les dispositifs médicaux. Concrètement : documentation technique, évaluation clinique, surveillance après mise sur le marché. Un éditeur qui n'a pas franchi ces étapes vend un produit qu'aucun service hospitalier sérieux ne devrait acheter. Quand vous voyez une « IA médicale gratuite » en ligne, posez-vous une seule question : qui a évalué ça, et sur quelles données ? La réponse est souvent personne, et nulle part.
Comparer les approches : ce qui tient, ce qui ne tient pas
Plutôt qu'un long discours, un tableau. Il résume ce que j'ai fini par comprendre après avoir discuté avec des radiologues, des urgentistes et deux ingénieurs qui développent ce genre d'outils.
| Type d'usage | Maturité réelle | Ce qui bloque |
|---|---|---|
| Lecture d'imagerie sur une lésion précise | Élevée | Variabilité des appareils, généralisation hors du centre d'entraînement |
| Tri et priorisation aux urgences | Moyenne | Intégration au logiciel existant, acceptation par les équipes |
| Compte-rendu et saisie assistée | Moyenne à bonne | Qualité des données en entrée, vérification humaine obligatoire |
| Aide au raisonnement en médecine générale | Faible | Cas flous, risque d'hallucination, responsabilité |
| Détection sur signaux (ECG, sommeil) | Bonne | Validation clinique, faux positifs mal tolérés |
Le motif est clair : plus la tâche est étroite et les données standardisées, mieux ça marche. Plus on s'approche du raisonnement complet, plus ça se complique.
Ce qui change vraiment dans la pratique
Voici mon avis, et je l'assume : l'apport principal de ces outils n'est ni le diagnostic ni la prédiction. C'est le temps.
Un radiologue qui délègue le dépistage des cas normaux à une machine ne devient pas plus intelligent. Il devient disponible pour les cas difficiles. Un urgentiste qui n'a plus à trier manuellement peut passer cinq minutes de plus avec un patient qui en a besoin. Le gain n'est pas dans la performance brute, il est dans la redistribution de l'attention humaine. C'est moins spectaculaire qu'un algorithme qui bat un champion, et c'est beaucoup plus utile.
Cela suppose une condition non négociable : le soignant doit comprendre ce que l'outil fait et ne fait pas. Un algorithme présenté comme une boîte noire qui « donne la réponse » est dangereux. Un algorithme qui dit « voici la zone suspecte, voici pourquoi, à vous de juger » est un collègue.
La formation, pas l'option
Il existe aujourd'hui des formations courtes — quelques dizaines d'heures, souvent en présentiel et à distance — destinées aux professionnels de santé qui veulent comprendre ces outils sans devenir informaticiens. C'est probablement la brique la plus sous-estimée de tout l'édifice. Un médecin qui sait ce qu'est un jeu d'entraînement, un biais de sélection et un faux positif utilisera ces logiciels dix fois mieux qu'un médecin à qui on a livré un bouton.
J'ai vu l'inverse aussi : un service équipé d'un bel outil, personne formé, l'outil éteint au bout de deux mois. Ça arrive plus souvent qu'on ne l'imagine.
Faut-il s'y mettre, et par où commencer ?
Si vous êtes soignant, la réponse est oui, mais pas n'importe comment.
- Commencez par identifier une tâche précise et répétitive qui vous coûte du temps chaque semaine.
- Cherchez si un outil certifié existe pour cette tâche. S'il n'y en a pas, la réponse est non, pas « je vais bricoler ».
- Testez sur votre propre population avant tout déploiement large. Regardez les faux positifs, pas seulement les bons résultats.
- Gardez la main. Aucun outil ne devrait décider seul.
- Formez-vous, même une vingtaine d'heures. C'est le meilleur rapport temps/valeur de tout le processus.
Si vous êtes patient, sachez que la question à poser n'est pas « est-ce que c'est de l'IA ? » mais « est-ce que ce truc a été évalué, et par qui ? ». Un diagnostic assisté par machine n'a de valeur que si quelqu'un a vérifié ce que la machine raconte sur des gens qui vous ressemblent.
Reste une question que je n'arrive pas à trancher, même après tout ce temps. Si un algorithme détecte un jour une anomalie que le médecin n'aurait jamais vue, et qu'il la signale, la médecine aura gagné. Mais le jour où il la rate et que personne ne vérifie, qui portera ça ? La réponse n'est pas technique. Elle est humaine, et elle n'est pas encore écrite.