Publications · Résumé détaillé

IA et préconisations médicales

Une étude expérimentale sur la relecture de préconisations médicales assistée par l’IA, publiée par l’INRS en juin 2026. Cette page en présente la méthode, les résultats et les limites.

INRS · Étude expérimentale · Juin 2026

L’intelligence artificielle en santé au travail : évaluation de son potentiel pour renforcer la précision et la clarté des préconisations médicales.

Pourquoi étudier la relecture des préconisations ?

Une préconisation peu précise peut être mal comprise ou difficile à appliquer. Le travail antérieur du Dr N’Guessan avait recueilli 4 217 préconisations issues de douze SPSTI des Hauts-de-France. Parmi les 3 776 ayant fait l’objet d’un consensus multidisciplinaire, 2 947, soit 78 %, comportaient au moins un défaut selon les critères retenus. Ce constat concerne ce corpus ; il ne constitue pas une estimation nationale.

L’étude cherche à déterminer si le modèle de raisonnement o1 peut aider à repérer ces défauts de formulation en confrontant ses analyses à cette référence humaine.

La méthode

Les instructions données au modèle ont été affinées en cinq itérations sur une centaine de préconisations, puis retestées sur 50 nouvelles. Le prompt final a ensuite été appliqué à un nouvel échantillon de 385 préconisations tirées au sort dans la base. Les données transmises ne permettaient pas d’identifier les salariés, les entreprises, les employeurs, les médecins ni les SPSTI.

Chaque préconisation a été examinée selon cinq catégories :

  1. Imprécision ou difficulté de compréhension et d’application.
  2. Doute sur le caractère obligatoire de l’avis.
  3. Informations ne relevant pas du document de préconisations.
  4. Changement de poste ou inaptitude déguisée.
  5. Rupture du secret médical ou atteinte à la vie privée.

Les désaccords ont été réexaminés par l’auteur avec l’aide d’un professeur en santé au travail, afin de distinguer les alertes pertinentes, les signalements excessifs, les défauts manqués et les hallucinations.

Les résultats

Le tableau II de l’article rapporte la répartition suivante, agrégée sur les cinq critères. Il s’agit d’évaluations par critère, et non du pourcentage de préconisations entièrement correctes.

Répartition des évaluations — 385 préconisations, cinq critères
RésultatProportionInterprétation
Concordance74,60 %Accord avec le consensus multidisciplinaire.
Discordance justifiée10,54 %Désaccord validé comme pertinent après réexamen.
Discordance par excès13,20 %Signalement jugé trop sévère.
Discordance par défaut1,45 %Défaut identifié par la référence mais non repéré par le modèle.
Hallucination observée0 %Aucune détectée dans le cadre de cette expérimentation.

Les performances varient selon le critère. La concordance atteint 96,1 % pour le secret médical, avec un kappa de Cohen de 0,82, contre 45,5 % pour le doute sur l’obligation et 61,3 % pour l’imprécision. Le modèle a tendance à signaler davantage de défauts que les évaluateurs humains, surtout pour les critères laissant une place à l’interprétation.

Ce que l’étude permet de conclure

Ces résultats soutiennent l’intérêt d’un second lecteur capable d’attirer l’attention sur des formulations à réexaminer. Certains désaccords ont fait apparaître des défauts initialement non repérés par le consensus. En revanche, un taux d’accord élevé ne suffit pas à faire du modèle un validateur autonome : ses alertes doivent être confrontées au contexte et au jugement du professionnel.

Les limites et les suites

Le modèle et les évaluateurs ne disposaient pas des détails du poste ni de toutes ses contraintes. La cotation comporte une part d’interprétation. Les résultats concernent un modèle, un prompt et un corpus précis ; ils ne sont pas extrapolables automatiquement à d’autres systèmes. L’absence d’hallucination observée dans l’étude ne garantit pas leur absence dans d’autres usages.

L’étude évalue la détection de défauts rédactionnels, pas une amélioration démontrée du maintien en emploi ou de la santé. Elle ouvre la voie à des évaluations dédiées à la santé au travail, à répéter lorsque les modèles et leurs conditions d’usage évoluent.

À retenir

Une aide à la relecture qui peut renforcer l’attention portée aux préconisations, avec une décision finale qui reste celle du médecin du travail.

Source : article intégral TF 335, notamment méthode, tableaux I–II et limites, p. 55–58.