Des développeurs qui finissent par tenir un code pour correct parce qu’il passe les tests. D’autres qui considèrent le plan annoncé par l’agent comme une description fidèle de ce qu’il fera réellement. Des utilisateurs qui, à force de voir surgir des demandes d’autorisation, cliquent sur « accepter » sans plus lire. Ces situations, documentées dans les travaux que cite l’article, décrivent concrètement ce que devient souvent le « humain dans la boucle » que réclament les chartes d’entreprise, les fournisseurs et le règlement européen sur l’IA.

Margaret Mitchell, Avijit Ghosh et Samir Passi en tirent une thèse nette : la manière dont les agents IA sont aujourd’hui conçus et déployés ne soutient pas la supervision humaine, elle la dégrade. D’abord parce que le volume et le rythme des validations dépassent ce qu’une personne peut réellement examiner. Ensuite parce que l’usage prolongé de ces systèmes érode la vigilance, le jugement et les compétences métier dont le superviseur a besoin pour repérer une erreur.

Pour la santé au travail, la conséquence est directe : superviser un agent n’est pas une garantie abstraite, c’est une tâche confiée à un salarié, avec une charge, des contraintes et une responsabilité. Cette lecture l’examine à travers les facteurs de risques psychosociaux, montre en quoi la santé du superviseur conditionne la sécurité du système, puis propose des questions à poser et un outil pour évaluer ces risques avant le déploiement.

Superviser dégrade le superviseur

Un agent IA ne se contente pas de produire une réponse. Il enchaîne des étapes, choisit des outils, modifie des fichiers, envoie des messages ou déclenche des transactions. À chaque étape, il génère des traces : raisonnements, plans, appels d’outils, échanges avec d’autres agents. Les auteurs montrent que ce flux est trop volumineux, trop rapide et trop dispersé pour être réellement compris par la personne censée le contrôler.

Cette personne doit en outre tenir plusieurs rôles à la fois : utiliser l’agent pour atteindre son propre objectif, accorder des autorisations au fil de l’exécution, juger la pertinence de chaque étape, anticiper les conséquences. En pratique, les demandes de validation se succèdent et les utilisateurs finissent par ne plus lire ce qu’ils approuvent. Les auteurs parlent de fatigue d’approbation.

Le second mécanisme est plus préoccupant encore. L’usage prolongé de ces systèmes érode les capacités mêmes qu’exige la supervision : déqualification, intuition professionnelle qui « rouille », baisse de la vigilance et de la capacité à repérer une anomalie, surconfiance. S’y ajoutent des biais bien documentés : biais d’automatisation, ancrage sur la proposition de la machine, complaisance. L’article cite notamment une étude multicentrique publiée en 2025 dans The Lancet Gastroenterology & Hepatology, qui suggère une perte de performance d’endoscopistes après une période d’exposition à l’IA en coloscopie.

Les auteurs relient ce constat à un texte fondateur de l’ergonomie, les « ironies de l’automatisation » de Lisanne Bainbridge (1983) : plus un système automatisé est performant, moins l’opérateur est entraîné à intervenir, et moins il est prêt au moment précis où l’on a besoin de lui. Ils résument cette ironie en une formule :

“Oversight degrades the overseer.”

Dans sa présentation de l’article, Avijit Ghosh décrit le point d’arrivée de cette pente : un humain qui appose machinalement son tampon, le regard vide, au lieu de constituer un véritable contrôle des erreurs de l’agent.

Une activité de travail à part entière

Pour l’ergonomie et la santé au travail, la situation n’est pas nouvelle. Elle rappelle la surveillance de processus automatisés en salle de contrôle, en aéronautique ou dans le nucléaire : une activité longtemps passive, puis la nécessité d’intervenir vite et bien sur un événement rare. C’est le problème dit de l’opérateur « hors de la boucle », décrit dès les années 1990 et repris par les auteurs.

Ce qui change, c’est l’échelle. Cette configuration, autrefois réservée à quelques secteurs à haut risque dotés d’opérateurs formés, de procédures, de temps de pause organisés et de retours d’expérience, se diffuse dans le travail de bureau : développeurs, juristes, gestionnaires, fonctions RH, soignants, et bientôt professionnels des services de santé au travail eux-mêmes. Souvent sans aucune des protections organisationnelles que ces secteurs ont mis des décennies à construire.

L’article souligne aussi que la charge de la supervision repose presque entièrement sur l’utilisateur. Les interfaces lui demandent de « vérifier les informations importantes », mais ne lui donnent pas les moyens de le faire. En langage de santé au travail, c’est une prescription sans moyens : le travail prescrit exige de contrôler chaque action, le travail réel rend ce contrôle matériellement impossible. L’écart n’est pas individuel, il est structurel.

Une lecture par les facteurs de risques psychosociaux

La grille des six familles de facteurs de risques psychosociaux issue du rapport Gollac (2011) permet d’organiser ce que décrit l’article. Cinq d’entre elles sont directement concernées.

Intensité et exigences cognitives

Le superviseur doit traiter un volume d’information qu’il ne maîtrise pas, à un rythme fixé par l’agent, tout en poursuivant sa propre tâche. La situation combine paradoxalement surcharge (tout lire, tout suivre) et monotonie (valider des dizaines de fois des étapes qui se ressemblent). Les auteurs rappellent qu’en situation de stress ou de surcharge, le raisonnement bascule vers les raccourcis rapides et intuitifs, au détriment de l’analyse délibérée dont la supervision a précisément besoin.

Autonomie et utilisation des compétences

Relégué au rôle d’approbateur, le professionnel décide moins, fait moins et apprend moins. Or l’utilisation et le développement des compétences font partie de la latitude décisionnelle au sens du modèle de Karasek. La combinaison d’exigences élevées et d’une latitude qui s’érode correspond à la configuration classique de job strain. L’article insiste sur le cas des novices, qui risquent de ne jamais acquérir les compétences nécessaires pour juger le travail de l’agent, ni pour reprendre la main lorsqu’il échoue. C’est une question de santé, mais aussi de parcours professionnels et de transmission des métiers.

Conflits de valeurs et qualité empêchée

Valider ce que l’on n’a pas pu vérifier, c’est engager son nom sur un travail que l’on ne reconnaît pas comme bien fait. Les témoignages cités par les auteurs, principalement de développeurs, décrivent une boucle devenue abrutissante et le sentiment de n’être plus que la nounou des productions de la machine. On retrouve là les ressorts de la qualité empêchée et de la perte de sens du travail : non pas l’absence de travail, mais l’impossibilité de le faire comme on l’estime nécessaire.

Responsabilité et insécurité

L’humain reste formellement responsable, au regard de l’organisation comme du droit, alors que sa maîtrise réelle diminue. On peut rapprocher cette situation, au-delà de l’article, de la notion de « zone d’écrasement moral » (moral crumple zone) proposée par Madeleine Clare Elish en 2019 : dans un système automatisé, l’opérateur humain absorbe la responsabilité des défaillances qu’il n’avait pas les moyens de prévenir. Une responsabilité sans maîtrise est une source bien connue de tension psychique.

Reconnaissance et rapports au travail

Le travail de supervision est invisible dans les indicateurs. Les auteurs notent que les agents sont évalués sur la vitesse, la précision et le débit, rarement sur la qualité du contrôle humain qu’ils rendent possible. Celui qui prend le temps d’examiner un plan et de refuser une action apparaît alors moins productif que celui qui valide vite. L’article recommande explicitement de supprimer les objectifs de productivité qui découragent l’examen attentif et de valoriser une supervision de qualité : autrement dit, une question de reconnaissance.

Quand la santé des superviseurs devient une variable de sécurité

L’article décrit ensuite un mécanisme de rétroaction. Les validations et les évaluations des utilisateurs servent souvent à mesurer, voire à entraîner, les systèmes. Un superviseur attentif examine, repère une information manquante, refuse. Un superviseur fatigué valide vite, accepte une justification fluide et juge l’interaction satisfaisante. Si ces validations sont interprétées comme des succès, le système peut apprendre à produire ce qui se valide facilement : des résumés assurés, des plans simplifiés, moins de frictions. Les auteurs évoquent aussi des travaux montrant que des agents peuvent dissimuler leurs échecs lorsqu’ils anticipent qu’ils ne seront pas contrôlés.

Pour la santé au travail, la conséquence est importante. La fatigue, la surcharge et la déqualification des superviseurs ne sont plus seulement des enjeux de santé individuelle : elles deviennent une variable de fiabilité du système, et potentiellement de son apprentissage.

Volume et rythme imposés par l’agent → fatigue d’approbation et surcharge cognitive → validations rapides, vérifications abandonnées → compétences moins mobilisées, déqualification → supervision encore moins effective → erreurs non détectées dont l’humain reste responsable → tension psychique, perte de sens, conflits de valeurs.

Prévenir les risques psychosociaux des personnes qui supervisent l’IA, c’est donc aussi protéger la sécurité de l’organisation et des tiers. Les deux questions ne peuvent plus être traitées séparément.

Des solutions qui relèvent largement de l’organisation du travail

Les auteurs proposent une double réponse. Côté concepteurs : introduire des frictions utiles, comme demander à l’utilisateur de formuler son propre avis avant de voir la proposition de l’agent, lui laisser choisir s’il veut la consulter, poser des questions réflexives aux moments à fort enjeu, exiger une validation explicite pour les actions lourdes de conséquences, délimiter à l’avance ce que l’agent peut faire seul, regrouper les validations par lots cohérents et confier à des contrôles automatiques ce qui ne demande pas de jugement.

Côté organisations qui déploient : former à la lecture critique des productions de l’IA, maintenir les compétences par une pratique régulière sans assistance, imposer des pauses, organiser des rotations, confier la supervision à des personnes réellement compétentes, séparer le rôle de superviseur de celui qui bénéficie de la validation, et aligner les objectifs sur la qualité du contrôle plutôt que sur le débit.

Cette seconde liste est presque mot pour mot le vocabulaire de la prévention organisationnelle : charge de travail, pauses, rotation des tâches, formation, définition des rôles, objectifs. En droit français, elle relève de l’obligation de sécurité de l’employeur et des principes généraux de prévention, qui imposent notamment d’adapter le travail à l’homme et de planifier la prévention en y intégrant la technique et l’organisation du travail (articles L. 4121-1 et L. 4121-2 du Code du travail). Côté européen, l’AI Act exige des déployeurs de systèmes à haut risque qu’ils confient la supervision humaine à des personnes disposant des compétences, de la formation, de l’autorité et du soutien nécessaires (article 26). Ces exigences ne sont atteignables que si les conditions de travail le permettent. Voir les repères juridiques →

Une nuance s’impose toutefois. Parmi les mesures proposées figure une formation à l’auto-surveillance, pour apprendre à repérer sa propre baisse d’attention. Elle peut être utile, mais elle ne doit pas redevenir le moyen de reporter sur l’individu une charge que l’article attribue justement à la conception et à l’organisation. La prévention primaire (périmètre d’autonomie de l’agent, volume de validations, durée des sessions, rôles, objectifs) doit primer sur l’adaptation de la personne.

Un point de vigilance : surveiller la vigilance

L’article propose de mesurer la qualité de la supervision : temps passé à examiner une action rapporté au taux d’approbation, évolution des désaccords avec l’agent, fréquence des demandes d’information lorsque l’enjeu augmente. Il suggère même d’insérer dans le flux de travail des tâches dont la bonne réponse est connue à l’avance, pour détecter une baisse du jugement et déclencher une pause, une rotation ou une formation. Les auteurs reconnaissent eux-mêmes que ces dispositifs posent une question de surveillance.

Du point de vue de la santé au travail, la vigilance doit être forte. Ces indicateurs portent sur l’activité des salariés. Mal employés, ils peuvent se transformer en outils d’évaluation individuelle, de pression et de défiance, soit exactement l’inverse de l’effet recherché. En France, un dispositif de contrôle de l’activité suppose l’information préalable des salariés (article L. 1222-4) et la consultation du CSE (article L. 2312-38).

Une ligne de conduite possible : des indicateurs collectifs, discutés avec les représentants du personnel, utilisés pour ajuster l’organisation (volume de validations, périmètre de l’agent, pauses) et non pour juger les personnes. Un signal de supervision dégradée devrait interroger le travail, pas le travailleur.

Que peuvent regarder les professionnels de la santé au travail ?

  1. Identifier qui supervise quoi.
    Repérer les postes où une personne valide les actions d’un agent, et estimer le nombre de validations demandées par jour ou par heure.
  2. Confronter le prescrit et le réel.
    Le superviseur dispose-t-il du temps, de l’information et de l’autorité nécessaires pour refuser une action ? Peut-il bloquer l’agent sans être pénalisé sur ses objectifs ?
  3. Rechercher la fatigue d’approbation.
    Validations à la chaîne, lecture en diagonale, sentiment de « cliquer sur oui » sans savoir vraiment ce que l’on accepte sont des signaux à entendre.
  4. Protéger les compétences, en particulier celles des débutants.
    Prévoir des temps de pratique sans IA, du compagnonnage et des mises en situation de reprise en main manuelle.
  5. Organiser la vigilance comme une activité de surveillance.
    Durée des sessions, pauses, rotations, alternance entre travail assisté et non assisté : les enseignements des salles de contrôle sont transposables.
  6. Clarifier la responsabilité.
    Qui répond d’une erreur passée entre les mailles ? La répartition est-elle écrite, connue et cohérente avec les moyens réellement donnés au superviseur ?
  7. Encadrer les indicateurs de supervision.
    S’ils existent, ils doivent être collectifs, transparents, discutés avec le CSE et orientés vers l’amélioration de l’organisation.
  8. Inscrire la supervision d’agents au DUERP.
    Il s’agit d’une situation de travail exposant à des facteurs de risques psychosociaux identifiables, qui doit être évaluée comme telle, avant le déploiement puis dans la durée.

Pour passer à l’évaluation : le questionnaire d’évaluation des risques d’un projet d’IA avant son déploiement (18 items) permet de repérer en amont ces effets psychosociaux potentiels, dont l’autonomie, la charge et la responsabilité. Une fois l’agent en service, l’outil Évaluer le déploiement aide à confronter les effets anticipés au travail réellement observé.

Ces questions valent aussi pour nos propres services. Lorsqu’un médecin ou un infirmier en santé au travail relit une synthèse, un courrier ou une préconisation préparés par une IA, c’est lui l’humain dans la boucle. Les mêmes mécanismes s’appliquent, en particulier pour les internes et les professionnels en début d’exercice. IA en SPST →

Limites

Il s’agit d’un position paper : un texte d’argumentation appuyé sur la littérature, pas une nouvelle étude empirique. Une partie des données mobilisées provient du développement logiciel assisté par agents, d’études menées auprès d’étudiants ou de travaux encore en prépublication. L’ampleur et la durabilité des effets cognitifs restent discutées ; les auteurs examinent d’ailleurs l’objection selon laquelle les utilisateurs finiraient par s’adapter. Enfin, la transposition à des situations de travail françaises, dans d’autres métiers et d’autres organisations, reste à observer sur le terrain. C’est précisément ce que la santé au travail peut apporter : regarder le travail réel de ceux qui supervisent.

La question à poser lors du déploiement d’agents n’est donc peut-être pas seulement « Y a-t-il un humain dans la boucle ? »

Il faudrait aussi se demander « Dans quelles conditions de travail cet humain peut-il encore exercer un jugement ? »

Un humain fatigué, pressé, progressivement déqualifié et seul responsable n’est pas une garantie de sécurité. C’est un risque supplémentaire, pour lui comme pour le système qu’il est censé contrôler.