« IA » ne désigne pas un outil unique.
Générer un texte, attribuer un score et répartir des tâches sont trois fonctions différentes, avec des risques différents.
Comprendre · Repères essentiels
Distinguer les systèmes, savoir comment un modèle de langage est fabriqué et produit une réponse, lire ses performances sans leur faire dire plus qu’elles ne disent, puis situer ses risques et l’objectif d’AGI.
Générer un texte, attribuer un score et répartir des tâches sont trois fonctions différentes, avec des risques différents.
Il calcule des probabilités à partir du contexte ; il ne vérifie pas spontanément la vérité ni la conformité de sa réponse.
Le modèle compte, mais aussi la tâche, les données, les personnes, les règles de décision et l’organisation.
01 / Nommer le système
Le terme « IA » rassemble des systèmes qui ne produisent pas le même résultat. Pour comprendre un usage professionnel, commencez par identifier ce que l’outil fait réellement.
Elle crée ou transforme du texte, des images, du son ou du code à partir d’une consigne. Un assistant conversationnel fondé sur un LLM appartient à cette famille.
Elle estime une probabilité, attribue un score ou classe un cas à partir de données passées : risque de défaut, priorité d’un dossier, aide au diagnostic.
Elle répartit des tâches, fixe un ordre de traitement, mesure l’activité ou influence une décision de management. Elle peut intégrer ou non de l’IA générative.
02 / À l’intérieur d’un LLM
Un grand modèle de langage — ou LLM — est un réseau de neurones entraîné à prévoir la suite d’un texte. Il ne cherche pas une réponse toute faite dans une base de données : il la compose, unité après unité.
La consigne et les documents fournis sont découpés en petites unités : mots, morceaux de mots ou signes.
Chaque jeton est converti en une représentation numérique qui encode les régularités apprises pendant l’entraînement.
Le Transformer examine les relations entre les jetons pour déterminer quels éléments du contexte comptent le plus à cet instant.
Le modèle calcule une distribution de probabilités. Les réglages de génération influencent le choix et sa variabilité.
Le jeton choisi rejoint le contexte, puis le calcul recommence jusqu’à la fin de la réponse.
Texte déjà présent dans le contexte« Le salarié décrit des douleurs persistantes au niveau du ▯ »
« dos » est choisi presque à chaque fois : réponses stables, parfois répétitives.
« bas » ou « poignet » sortent plus souvent : plus de variété, plus d’écarts.
« …au niveau du dos » → « , » → « aggravées » → « par »… chaque jeton ajouté relance le calcul.
03 / Entraînement
Les capacités d’un LLM ne sont pas programmées règle par règle. Elles se forment au cours d’un entraînement en plusieurs étapes, et chacune laisse des traces dans le comportement final, y compris dans ses défauts.
01Pré-entraîner
02Ajuster
03Renforcer
04Raisonner
05Évaluer, déployer
↺ Les défauts repérés en test ou après le déploiement alimentent l’entraînement de la version suivante.
Les performances s’améliorent de façon assez prévisible avec la quantité de calcul, de données et de paramètres : ce sont les « lois d’échelle ». Selon Epoch AI, le calcul consacré à l’entraînement des modèles d’IA marquants est multiplié par environ 4,5 chaque année depuis 2010, et par environ 5 pour les grands modèles de langage de pointe depuis 2020.
Laisser le modèle travailler plus longtemps avant de répondre améliore les résultats en mathématiques, en programmation et en sciences. Le Rapport international sur la sûreté de l’IA 2026 en fait l’une des principales sources des progrès récents.
| Modèle | Date | Calcul (FLOP) | Statut |
|---|---|---|---|
| AlexNet | sept. 2012 | 4,7 × 10¹⁷ | Publiée |
| Transformer | juin 2017 | 7,4 × 10¹⁸ | Publiée |
| GPT-2 | févr. 2019 | 1,9 × 10²¹ | Estimation |
| GPT-3 | mai 2020 | 3,1 × 10²³ | Publiée |
| PaLM | avr. 2022 | 2,5 × 10²⁴ | Publiée |
| GPT-4 | mars 2023 | 2,1 × 10²⁵ | Estimation |
| Llama 3.1 405B | juil. 2024 | 3,8 × 10²⁵ | Publiée |
| GPT-4.5 | févr. 2025 | 3,8 × 10²⁶ | Estimation |
| Grok 4 | juil. 2025 | 5,0 × 10²⁶ | Estimation |
| GPT-6 Astra | sept. 2026 | 1,0 × 10²⁷ | Estimation |
04 / Du modèle au système
Un assistant professionnel assemble un modèle, des consignes, des documents, des outils et parfois une mémoire. Chaque couche modifie le résultat, et donc ce qu’il faut vérifier avant de lui confier une tâche.
Avant votre première question, le fournisseur ou l’organisation a fixé un rôle, un ton, des interdits et des règles de format. Deux outils fondés sur le même modèle peuvent donc répondre très différemment.
Le modèle ne « voit » que sa fenêtre de contexte : la conversation, les documents fournis et les extraits retrouvés dans une base documentaire (RAG). Ce qui n’y figure pas n’existe pas pour lui, et un document très long peut être exploité de façon inégale.
Recherche web, exécution de code, messagerie, agenda ou dossier : le modèle peut appeler des outils par des connecteurs, par exemple ceux du protocole MCP. Il ne se contente plus de proposer, il agit.
Un agent planifie, agit, observe le résultat et recommence, parfois pendant des heures, avec une supervision humaine intermittente. Une erreur commise au début peut se propager à toute la chaîne d’actions.
Les modèles fermés, comme GPT, Claude ou Gemini, ne s’utilisent qu’à distance, sur l’infrastructure du fournisseur. Les modèles à poids ouverts, comme Llama, Qwen, DeepSeek ou certains modèles de Mistral, peuvent être installés sur des serveurs maîtrisés, avec en général un léger retard sur les meilleurs modèles fermés.
Les modèles récents traitent aussi des images, des documents scannés, de l’audio et de la vidéo. La transcription et la synthèse automatiques d’entretiens, parfois appelées « scribes » médicaux, en sont l’usage le plus visible en santé.
05 / Capacités et limites
Les capacités dépendent du modèle, de sa version, de la langue, des documents fournis, des outils auxquels il a accès et de la façon dont la tâche est formulée.
| Type de tâche | Ce que le modèle peut apporter | Ce qui ne peut pas être présumé |
|---|---|---|
| 01Lire et rédiger | Résumer, reformuler, traduire, extraire des informations, comparer des documents ou préparer un premier texte. | Exhaustivité, fidélité à la source, mise à jour des informations et adéquation au contexte professionnel. |
| 02Raisonner sur un problème | Décomposer une question, proposer des hypothèses, appliquer une procédure décrite et expliquer les étapes d’un calcul. | Justesse constante. Une explication convaincante peut accompagner une réponse fausse. |
| 03Écrire du code et traiter des données | Produire, expliquer ou corriger du code ; préparer une requête ou une analyse exploratoire. | Sécurité, robustesse et bon fonctionnement sur les cas non testés. L’exécution et les tests restent indispensables. |
| 04Utiliser des outils | Avec une application adaptée, rechercher sur le web, consulter une base documentaire, appeler un logiciel ou enchaîner plusieurs actions. | Qualité des sources, autorisation d’agir et maîtrise des conséquences. Les droits d’accès doivent être limités. |
| 05Traiter plusieurs médias | Selon le modèle : décrire une image, transcrire un son, analyser un document ou répondre à partir d’une vidéo. | Perception complète des détails, compréhension de la situation et respect des règles propres au métier. |
Réussir souvent une catégorie de tâches ne permet pas de prévoir chaque réponse. Il faut tester les erreurs qui comptent dans votre usage.
Le fournisseur peut modifier le modèle, ses réglages, ses filtres ou ses outils. Une évaluation utile mentionne la version et la date.
Ces limites ne sont pas de simples défauts de réglage. Elles découlent de la manière dont les modèles sont entraînés, évalués et intégrés aux outils. Les connaître aide à placer les contrôles au bon endroit.
Le pré-entraînement n’apprend pas à distinguer un fait rare d’une invention vraisemblable. Les évaluations qui ne notent que l’exactitude récompensent ensuite la réponse au hasard plutôt que l’abstention.
Au travailRéférences, articles de loi ou chiffres inventés, présentés avec assurance.
Kalai et al., OpenAI, 2025 ↗L’ajustement sur les préférences humaines peut favoriser l’approbation au détriment de l’exactitude. En avril 2025, OpenAI a retiré une mise à jour de GPT-4o jugée excessivement flatteuse.
Au travailL’outil tend à confirmer l’hypothèse contenue dans la question posée.
OpenAI, 2025 ↗Les capacités ne suivent pas la difficulté perçue par un humain. Auprès de 758 consultants, l’IA améliorait vitesse et qualité sur les tâches à sa portée, mais réduisait la justesse des réponses sur une tâche située juste au-delà.
Au travailLa confiance acquise sur une tâche ne se transfère pas à la tâche voisine.
Dell’Acqua et al., Harvard Business School, 2023 ↗Le raisonnement qu’affiche un modèle ne reflète pas fidèlement ce qui a déterminé sa réponse. Dans une étude d’Anthropic, les modèles testés ne signalaient un indice qu’ils avaient utilisé que dans 25 à 39 % des cas.
Au travailUne justification convaincante ne prouve pas que la réponse est fondée.
Chen et al., Anthropic, 2025 ↗Le modèle ne sépare pas de façon fiable les instructions de l’utilisateur et le texte qu’il lit : une page web, un courriel ou un PDF peuvent contenir des consignes cachées. C’est le premier risque du classement OWASP des applications fondées sur des LLM.
Au travailLe risque augmente dès que l’outil peut envoyer, modifier ou supprimer.
OWASP, LLM01:2025 ↗La génération est probabiliste et sensible à la formulation, à l’ordre des documents et à la version du modèle. Ses connaissances s’arrêtent à une date de coupure, sauf s’il peut consulter des sources en direct.
Au travailTester plusieurs fois, dater les essais et consigner la version utilisée.
06 / Lire les benchmarks
Un benchmark mesure une performance sur un jeu de tâches, avec une consigne, une métrique et des conditions précises. Changez l’un de ces éléments et le classement peut changer.
Les pages ci-dessous sont maintenues par leurs auteurs. Elles permettent de consulter les derniers résultats disponibles sans figer ici un palmarès qui serait rapidement dépassé. L’instantané ci-dessous montre seulement que le premier change selon le test.
Epoch AI · agrège plusieurs dizaines de tests
Claude Opus 5.5 pas encore classé
Artificial Analysis · score Elo, comparaisons par paires
ARC Prize · scores vérifiés
07 / Suivre la trajectoire
Pour anticiper les effets sur le travail, la question utile n’est pas « quel modèle est le meilleur ? » mais « qu’est-ce qui devient faisable, à quel rythme et à quelles conditions ? ». Quatre repères datés, avec leurs limites.
| Modèle | Sortie | Horizon à 50 % | IC 95 % |
|---|---|---|---|
| GPT-2 | févr. 2019 | 3 s | 1 s – 8 s |
| GPT-3 | mai 2020 | 8 s | 5 s – 13 s |
| GPT-3.5 | mars 2022 | 36 s | 16 s – 1 min |
| GPT-4 | mars 2023 | 4 min | 2 min – 8 min |
| GPT-4 (nov.) | nov. 2023 | 4 min | 2 min – 8 min |
| GPT-4o | mai 2024 | 7 min | 4 min – 13 min |
| Claude 3.5 Sonnet (juin) | juin 2024 | 11 min | 5 min – 22 min |
| o1-preview | sept. 2024 | 20 min | 12 min – 33 min |
| Claude 3.5 Sonnet (oct.) | oct. 2024 | 21 min | 10 min – 41 min |
| o1 | déc. 2024 | 39 min | 21 min – 1 h 05 |
| Claude 3.7 Sonnet | févr. 2025 | 1 h 00 | 33 min – 1 h 44 |
| o3 | avr. 2025 | 2 h 00 | 1 h 15 – 3 h 11 |
| GPT-5 | août 2025 | 3 h 23 | 1 h 53 – 6 h 46 |
| Gemini 3 Pro | nov. 2025 | 3 h 44 | 2 h 20 – 6 h 19 |
| Claude Opus 4.5 | nov. 2025 | 4 h 53 | 2 h 42 – 10 h 24 |
| GPT-5.2 | déc. 2025 | 5 h 52 | 3 h 18 – 13 h 35 |
| Claude Opus 4.6 | févr. 2026 | 11 h 59 | 5 h 17 – 60 h 34 |
| Claude Mythos Preview | avr. 2026 | 17 h 25 | 8 h 29 – 55 h 04 |
| GPT-5.6 Sol (hors modèles de pointe) | juin 2026 | ≈ 11 h 18 | 5 h 00 – 40 h 00 |
Des systèmes capables de résoudre des problèmes de niveau expert échouent sur des tâches simples de perception ou d’adaptation. Le Rapport international sur la sûreté de l’IA (février 2026) juge plausibles, d’ici 2030, aussi bien un plafonnement qu’une forte accélération.
Un métier combine des tâches, des relations, des responsabilités et des imprévus. Ces repères indiquent quelles portions du travail deviennent automatisables, pas ce que deviendra le travail : cela dépend aussi des choix d’organisation.
08 / Risques des systèmes
Le Rapport international sur la sûreté de l’IA, rédigé par plus de 100 experts sous la présidence de Yoshua Bengio, distingue les usages malveillants, les dysfonctionnements et les risques systémiques. Les effets sur le travail et la santé sont détaillés dans le parcours Risques.
Fraudes et escroqueries, hypertrucages, manipulation, aide à des cyberattaques. Les laboratoires évaluent aussi l’aide que leurs modèles pourraient apporter à la conception d’armes biologiques ou chimiques.
Au travailHameçonnage ciblé, usurpation de l’identité d’un dirigeant, atteintes à la réputation.
Contenus fabriqués, code défectueux, agents qui échouent ou détournent l’objectif fixé. En conditions de test, certains modèles ont exploité les failles de leur système de notation ou adopté des stratégies trompeuses pour atteindre un but.
Au travailActions non souhaitées d’un agent, contrôle humain réduit à une validation de façade.
Automatisation de tâches intellectuelles, affaiblissement de l’esprit critique par excès de confiance dans la machine, dépendance affective à des compagnons conversationnels utilisés par des dizaines de millions de personnes.
Au travailDéqualification, intensification, perte d’autonomie et de sens du métier.
Les tests réalisés avant la mise sur le marché prédisent mal l’utilité et les risques en conditions réelles, et certains modèles détectent désormais qu’ils sont évalués. Le suivi après déploiement, y compris dans les organisations de travail, devient indispensable.
Les principaux laboratoires publient des cadres de sécurité, comme la Responsible Scaling Policy d’Anthropic, le Preparedness Framework d’OpenAI ou le Frontier Safety Framework de Google DeepMind, qui associent des seuils de capacités à des mesures renforcées. La recherche en interprétabilité tente de lire les mécanismes internes des modèles plutôt que leurs seules réponses. Ces engagements restent largement volontaires et évalués par les entreprises elles-mêmes.
Depuis le 2 août 2025, l’AI Act impose aux fournisseurs de modèles d’IA à usage général une documentation technique et une politique de respect du droit d’auteur. Les modèles présentant un risque systémique doivent en outre être évalués, faire l’objet d’une gestion des risques et d’un signalement des incidents graves. Voir le parcours Gouvernance →
09 / L’objectif d’AGI
Plusieurs entreprises déclarent chercher à construire une intelligence artificielle générale, ou AGI. Il n’en existe ni définition partagée, ni test qui permettrait de constater son arrivée. Trois manières de la définir éclairent ce qui est en jeu pour le travail.
La charte d’OpenAI (2018) vise des « systèmes hautement autonomes » qui surpassent les humains dans la plupart des travaux économiquement utiles. La définition est explicitement économique : elle se mesure à la substitution du travail humain.
Charte d’OpenAI, 2018 ↗Google DeepMind croise le niveau de performance, d’« émergent » à « surhumain », et l’étendue des tâches couvertes. Le degré d’autonomie laissé au système est traité à part : il relève d’un choix de déploiement, pas seulement d’une capacité.
Morris et al., Levels of AGI, 2023 ↗Un collectif de chercheurs mesure les modèles sur dix grandes aptitudes de la cognition humaine (modèle CHC). GPT-4 obtenait 27 % et GPT-5 57 %, avec un profil très irrégulier : connaissances étendues, mémoire à long terme quasi nulle.
Hendrycks, Bengio et al., 2025 ↗Dans le contrat entre Microsoft et OpenAI, la déclaration d’AGI avait des conséquences financières ; sa vérification a été confiée en octobre 2025 à un panel d’experts indépendants, avant qu’un avenant d’avril 2026 ne vide largement la clause de sa portée en dissociant les paiements des progrès technologiques.
Plusieurs dirigeants de laboratoires évoquent publiquement une échéance de quelques années. Ces déclarations émanent d’acteurs engagés dans une course au financement ; les indicateurs mesurés et datés sont plus informatifs que les dates annoncées.
L’enjeu n’est pas de parier sur une date. Il s’agit de suivre, tâche par tâche, ce qui devient automatisable, à quel rythme et sous quel contrôle, et d’anticiper les effets sur la charge, l’autonomie, les compétences et l’emploi avant qu’ils ne s’imposent. Voir les enjeux économiques et sociaux →
10 / Revenir au travail réel
Le benchmark décrit le comportement d’un modèle dans un test. Le déploiement doit aussi être évalué dans la tâche réelle, avec ses contraintes, ses responsabilités et ses effets sur les personnes.
On n’évalue pas seulement un modèle. On évalue le système de travail formé par l’outil, la tâche, les données, les personnes qui l’utilisent et les règles de l’organisation.
11 / Avant un usage professionnel
Ces questions évitent de partir du produit ou de sa réputation. Elles obligent à décrire l’usage concret et les moyens nécessaires pour le maîtriser.
Décrire la situation actuelle, le résultat attendu, les personnes concernées et les moments où une erreur aurait des conséquences importantes. « Gagner du temps » n’est pas une tâche.
Identifier les données personnelles, confidentielles ou couvertes par un secret ; vérifier le lieu de traitement, la durée de conservation et les usages prévus par le fournisseur.
Nommer la personne compétente, intégrer la relecture à la charge de travail et préciser les sources auxquelles elle pourra comparer la réponse.
Distinguer la proposition de l’outil, la décision humaine et la responsabilité de l’organisation. Prévoir un moyen de contester, corriger ou suspendre l’usage.
Choisir avant le test quelques indicateurs utiles : qualité, erreurs, temps de contrôle, charge, autonomie, compétences, entraide et difficultés signalées.
Pour aller plus loin
Une sélection courte, issue d’organismes publics ou de projets de recherche qui expliquent leur méthode. Le niveau et la langue sont indiqués.
Une définition courte pour poser le vocabulaire sans entrer dans les détails techniques.
CNIL ↗Sept vidéos courtes sur le fonctionnement, les forces, les limites, les consignes et l’usage d’outils.
Inria ↗Jetons, contexte, paramètres, attention, limites et adaptation des modèles.
Google for Developers ↗Bénéfices, résultats inexacts, données personnelles et premières précautions de déploiement.
CNIL ↗Cadre, ressources et profil consacré aux risques propres à l’IA générative.
NIST ↗La synthèse de plus de 100 experts sur les capacités, les risques et les protections des systèmes d’IA généralistes.
Rapport international ↗Relier un protocole d’évaluation aux connaissances du métier et aux erreurs réellement importantes.
IA & Santé au Travail ↗Relier la compréhension des modèles, les risques, les usages en SPSTI, l’évaluation, la prévention et le droit.
IA & Santé au Travail →