Comprendre · Repères essentiels

Comprendre l’intelligence artificielle au travail.

Distinguer les systèmes, savoir comment un modèle de langage est fabriqué et produit une réponse, lire ses performances sans leur faire dire plus qu’elles ne disent, puis situer ses risques et l’objectif d’AGI.

Lecture en 25 minutesSources sélectionnées et datéesMis à jour en septembre 2026
01

« IA » ne désigne pas un outil unique.

Générer un texte, attribuer un score et répartir des tâches sont trois fonctions différentes, avec des risques différents.

02

Un LLM produit une suite plausible.

Il calcule des probabilités à partir du contexte ; il ne vérifie pas spontanément la vérité ni la conformité de sa réponse.

03

Le bon niveau d’analyse est le travail réel.

Le modèle compte, mais aussi la tâche, les données, les personnes, les règles de décision et l’organisation.

01 / Nommer le système

D’abord, de quelle intelligence artificielle parle-t-on ?

Le terme « IA » rassemble des systèmes qui ne produisent pas le même résultat. Pour comprendre un usage professionnel, commencez par identifier ce que l’outil fait réellement.

01 · Produire

IA générative

Elle crée ou transforme du texte, des images, du son ou du code à partir d’une consigne. Un assistant conversationnel fondé sur un LLM appartient à cette famille.

RésultatUn contenu nouveau
VigilanceExactitude, sources, données saisies
02 · Estimer

IA prédictive

Elle estime une probabilité, attribue un score ou classe un cas à partir de données passées : risque de défaut, priorité d’un dossier, aide au diagnostic.

RésultatUn score ou une catégorie
VigilanceBiais, seuil, faux positifs et faux négatifs
03 · Organiser

Gestion algorithmique

Elle répartit des tâches, fixe un ordre de traitement, mesure l’activité ou influence une décision de management. Elle peut intégrer ou non de l’IA générative.

RésultatUne consigne ou une décision
VigilanceAutonomie, recours, intensification

02 / À l’intérieur d’un LLM

Comment un modèle de langage fabrique une réponse.

Un grand modèle de langage — ou LLM — est un réseau de neurones entraîné à prévoir la suite d’un texte. Il ne cherche pas une réponse toute faite dans une base de données : il la compose, unité après unité.

01 · Découper

Le texte devient des jetons

La consigne et les documents fournis sont découpés en petites unités : mots, morceaux de mots ou signes.

02 · Représenter

Les jetons deviennent des nombres

Chaque jeton est converti en une représentation numérique qui encode les régularités apprises pendant l’entraînement.

03 · Mettre en relation

L’attention pondère le contexte

Le Transformer examine les relations entre les jetons pour déterminer quels éléments du contexte comptent le plus à cet instant.

04 · Prédire

Le prochain jeton est choisi

Le modèle calcule une distribution de probabilités. Les réglages de génération influencent le choix et sa variabilité.

05 · Recommencer

La réponse se construit pas à pas

Le jeton choisi rejoint le contexte, puis le calcul recommence jusqu’à la fin de la réponse.

Figure 1 · Exemple illustratif

À chaque pas, chaque suite possible reçoit une probabilité.

Texte déjà présent dans le contexte« Le salarié décrit des douleurs persistantes au niveau du »

Température basse

« dos » est choisi presque à chaque fois : réponses stables, parfois répétitives.

Température élevée

« bas » ou « poignet » sortent plus souvent : plus de variété, plus d’écarts.

Puis on recommence

« …au niveau du dos » → « , » → « aggravées » → « par »… chaque jeton ajouté relance le calcul.

Exemple illustratif : les probabilités sont fictives. Un jeton n’est pas toujours un mot entier (« bas » peut amorcer « bas du dos »). Le modèle choisit ce qui est probable dans ce contexte, pas ce qui est vrai pour ce salarié.

03 / Entraînement

Comment un modèle est fabriqué, puis ajusté.

Les capacités d’un LLM ne sont pas programmées règle par règle. Elles se forment au cours d’un entraînement en plusieurs étapes, et chacune laisse des traces dans le comportement final, y compris dans ses défauts.

Figure 2 · Schéma

De la masse de textes au modèle déployé : cinq étapes.

  1. 01Pré-entraîner

    ReçoitTextes du web, livres, code : des milliers de milliards de jetons
    FaitPrédire le jeton suivant, comparer avec la vraie suite, corriger les paramètres. Des milliards de fois.prédirecomparercorriger
    ObtientModèle de baseComplète du texte sans suivre de consignes. Savoir figé à une date de coupure.
  2. 02Ajuster

    ReçoitDialogues exemplaires rédigés ou validés par des personnes
    FaitImiter ces réponses modèles : suivre une consigne, un ton, un format.
    ObtientAssistantRépond aux demandes, refuse certaines d’entre elles.
  3. 03Renforcer

    ReçoitRéponses comparées par des personnes, ou par une IA guidée par des principes écrits
    FaitUn modèle de récompense note chaque réponse ; l’assistant s’ajuste pour être mieux noté.
    ObtientAssistant alignéPlus utile et plus prudent, mais ce qui plaît peut l’emporter sur ce qui est exact.
  4. 04Raisonner

    ReçoitProblèmes à solution vérifiable : mathématiques, code, tests automatiques
    FaitEssayer de nombreuses pistes, vérifier le résultat, renforcer les raisonnements qui aboutissent.
    ObtientModèle de raisonnementCalcule plus longtemps avant de répondre, en étapes intermédiaires.
  5. 05Évaluer, déployer

    ReçoitTests de capacités et de risques, équipes chargées d’attaquer le modèle
    FaitMesurer, ajouter des protections, décider de la mise sur le marché.
    ObtientModèle déployéMis à jour et surveillé : chaque version est un objet daté.
Ordre de grandeurLlama 3.1 405B (Meta, 2024) : 15 600 milliards de jetons, 31 millions d’heures de calcul sur processeurs graphiques, jusqu’à 16 000 puces en parallèle.
Étapes 02 à 05Beaucoup moins de données, mais plus coûteuses : chaque exemple est rédigé, comparé ou vérifié. La part du calcul consacrée au renforcement augmente depuis l’arrivée des modèles de raisonnement.

↺ Les défauts repérés en test ou après le déploiement alimentent l’entraînement de la version suivante.

Schéma simplifié : l’ordre et le poids des étapes varient d’un laboratoire à l’autre, et certaines sont répétées. Sources : Ouyang et al., 2022 (ajustement et renforcement par retours humains) ; Bai et al., 2022 (retours d’une IA guidée par des principes) ; Meta, « The Llama 3 Herd of Models », 2024 (ordres de grandeur).
L’échelle a longtemps été le principal moteur des progrès.

Les performances s’améliorent de façon assez prévisible avec la quantité de calcul, de données et de paramètres : ce sont les « lois d’échelle ». Selon Epoch AI, le calcul consacré à l’entraînement des modèles d’IA marquants est multiplié par environ 4,5 chaque année depuis 2010, et par environ 5 pour les grands modèles de langage de pointe depuis 2020.

Un second levier : le calcul au moment de la réponse.

Laisser le modèle travailler plus longtemps avant de répondre améliore les résultats en mathématiques, en programmation et en sciences. Le Rapport international sur la sûreté de l’IA 2026 en fait l’une des principales sources des progrès récents.

Figure 3 · Données

Le calcul consacré à l’entraînement a été multiplié par plus de deux milliards en quatorze ans.

10¹⁷10¹⁹10²¹10²³10²⁵10²⁷20122014201620182020202220242026FLOP d’entraînement · échelle logarithmique, chaque ligne = × 100× 2 milliards de calcul en 14 ansentre AlexNet (2012) et GPT-6 Astra (2026)AlexNetTransformerGPT-2GPT-3PaLMGPT-4Llama 3.1 405BGPT-4.5Grok 4GPT-6 Astravaleur publiéeestimation Epoch AI
Source : Epoch AI, base « AI Models », mise à jour le 26 septembre 2026. Les fournisseurs ne publient plus le calcul de leurs modèles phares : les valeurs récentes sont des estimations (GPT-6 Astra : au moins 100 000 puces GB200 selon Epoch). Aucune estimation n’est encore publiée pour Claude Opus 5.5, Fable 5.1 ou Gemini 3.x. Un FLOP est une opération de calcul élémentaire.
Voir les données
ModèleDateCalcul (FLOP)Statut
AlexNetsept. 20124,7 × 10¹⁷Publiée
Transformerjuin 20177,4 × 10¹⁸Publiée
GPT-2févr. 20191,9 × 10²¹Estimation
GPT-3mai 20203,1 × 10²³Publiée
PaLMavr. 20222,5 × 10²⁴Publiée
GPT-4mars 20232,1 × 10²⁵Estimation
Llama 3.1 405Bjuil. 20243,8 × 10²⁵Publiée
GPT-4.5févr. 20253,8 × 10²⁶Estimation
Grok 4juil. 20255,0 × 10²⁶Estimation
GPT-6 Astrasept. 20261,0 × 10²⁷Estimation

04 / Du modèle au système

L’outil que vous utilisez n’est jamais le modèle seul.

Un assistant professionnel assemble un modèle, des consignes, des documents, des outils et parfois une mémoire. Chaque couche modifie le résultat, et donc ce qu’il faut vérifier avant de lui confier une tâche.

Figure 4 · Schéma

Ce qui se passe entre votre question et la réponse.

Vousquestion, fichiersPage web, courrielou PDF piégéconsigne cachéeFenêtre de contextetout ce que le modèle « voit »Consigne systèmeConversationDocuments fournisExtraits retrouvésRésultats d’outilsMémoire (parfois)Modèle de langageprédit la suite, jeton par jetonBase documentaireOutilsRecherche webExécution de codeMessagerie, agendaLogiciels métierdemanderelu en entier à chaque jetonréponseextraits (RAG)appelle un outilvalidation humaine ?résultat↻ boucle d’agentagir, observer, recommencer
Le modèle ne connaît que ce qui entre dans sa fenêtre de contexte. Chaque flèche est un point de contrôle possible : qui écrit la consigne système, quels documents sont retrouvés, quels outils peuvent agir et avec quelle validation. Le trait rouge montre l’injection de consignes : un contenu lu par l’outil peut être pris pour un ordre.
01 · Consignes

Une consigne système invisible

Avant votre première question, le fournisseur ou l’organisation a fixé un rôle, un ton, des interdits et des règles de format. Deux outils fondés sur le même modèle peuvent donc répondre très différemment.

ApporteUn cadrage adapté au métier
À vérifierQui rédige ces consignes et qui peut les modifier
02 · Contexte

Une mémoire de travail limitée

Le modèle ne « voit » que sa fenêtre de contexte : la conversation, les documents fournis et les extraits retrouvés dans une base documentaire (RAG). Ce qui n’y figure pas n’existe pas pour lui, et un document très long peut être exploité de façon inégale.

ApporteDes réponses ancrées dans vos sources
À vérifierLes extraits réellement retrouvés et cités
03 · Outils

Des actions dans d’autres logiciels

Recherche web, exécution de code, messagerie, agenda ou dossier : le modèle peut appeler des outils par des connecteurs, par exemple ceux du protocole MCP. Il ne se contente plus de proposer, il agit.

ApporteDes tâches menées de bout en bout
À vérifierLes droits accordés, action par action
04 · Agents

Une boucle qui poursuit un objectif

Un agent planifie, agit, observe le résultat et recommence, parfois pendant des heures, avec une supervision humaine intermittente. Une erreur commise au début peut se propager à toute la chaîne d’actions.

ApporteL’automatisation de séquences entières
À vérifierPoints d’arrêt, journal des actions, retour arrière
05 · Hébergement

Modèle fermé ou modèle ouvert

Les modèles fermés, comme GPT, Claude ou Gemini, ne s’utilisent qu’à distance, sur l’infrastructure du fournisseur. Les modèles à poids ouverts, comme Llama, Qwen, DeepSeek ou certains modèles de Mistral, peuvent être installés sur des serveurs maîtrisés, avec en général un léger retard sur les meilleurs modèles fermés.

ApporteLa maîtrise du trajet des données
À vérifierLocalisation, certification HDS pour les données de santé, réutilisation pour l’entraînement
06 · Multimodalité

Lire, voir, écouter, transcrire

Les modèles récents traitent aussi des images, des documents scannés, de l’audio et de la vidéo. La transcription et la synthèse automatiques d’entretiens, parfois appelées « scribes » médicaux, en sont l’usage le plus visible en santé.

ApporteMoins de saisie, des documents non textuels exploitables
À vérifierErreurs de transcription, information des personnes enregistrées

05 / Capacités et limites

Ce que les modèles de langage savent faire — et ce qu’il reste à vérifier.

Les capacités dépendent du modèle, de sa version, de la langue, des documents fournis, des outils auxquels il a accès et de la façon dont la tâche est formulée.

Type de tâcheCe que le modèle peut apporterCe qui ne peut pas être présumé
01Lire et rédigerRésumer, reformuler, traduire, extraire des informations, comparer des documents ou préparer un premier texte.Exhaustivité, fidélité à la source, mise à jour des informations et adéquation au contexte professionnel.
02Raisonner sur un problèmeDécomposer une question, proposer des hypothèses, appliquer une procédure décrite et expliquer les étapes d’un calcul.Justesse constante. Une explication convaincante peut accompagner une réponse fausse.
03Écrire du code et traiter des donnéesProduire, expliquer ou corriger du code ; préparer une requête ou une analyse exploratoire.Sécurité, robustesse et bon fonctionnement sur les cas non testés. L’exécution et les tests restent indispensables.
04Utiliser des outilsAvec une application adaptée, rechercher sur le web, consulter une base documentaire, appeler un logiciel ou enchaîner plusieurs actions.Qualité des sources, autorisation d’agir et maîtrise des conséquences. Les droits d’accès doivent être limités.
05Traiter plusieurs médiasSelon le modèle : décrire une image, transcrire un son, analyser un document ou répondre à partir d’une vidéo.Perception complète des détails, compréhension de la situation et respect des règles propres au métier.
Une capacité démontrée n’est pas une fiabilité garantie.

Réussir souvent une catégorie de tâches ne permet pas de prévoir chaque réponse. Il faut tester les erreurs qui comptent dans votre usage.

Une version de modèle est un objet daté.

Le fournisseur peut modifier le modèle, ses réglages, ses filtres ou ses outils. Une évaluation utile mentionne la version et la date.

Pourquoi certaines erreurs persistent.

Ces limites ne sont pas de simples défauts de réglage. Elles découlent de la manière dont les modèles sont entraînés, évalués et intégrés aux outils. Les connaître aide à placer les contrôles au bon endroit.

01 · Fabulation

Une réponse plausible plutôt qu’un « je ne sais pas »

Le pré-entraînement n’apprend pas à distinguer un fait rare d’une invention vraisemblable. Les évaluations qui ne notent que l’exactitude récompensent ensuite la réponse au hasard plutôt que l’abstention.

Au travailRéférences, articles de loi ou chiffres inventés, présentés avec assurance.

Kalai et al., OpenAI, 2025 ↗
02 · Complaisance

Donner raison à la personne qui interroge

L’ajustement sur les préférences humaines peut favoriser l’approbation au détriment de l’exactitude. En avril 2025, OpenAI a retiré une mise à jour de GPT-4o jugée excessivement flatteuse.

Au travailL’outil tend à confirmer l’hypothèse contenue dans la question posée.

OpenAI, 2025 ↗
03 · Frontière irrégulière

Excellent ici, défaillant juste à côté

Les capacités ne suivent pas la difficulté perçue par un humain. Auprès de 758 consultants, l’IA améliorait vitesse et qualité sur les tâches à sa portée, mais réduisait la justesse des réponses sur une tâche située juste au-delà.

Au travailLa confiance acquise sur une tâche ne se transfère pas à la tâche voisine.

Dell’Acqua et al., Harvard Business School, 2023 ↗
04 · Raisonnement affiché

L’explication n’est pas le calcul réel

Le raisonnement qu’affiche un modèle ne reflète pas fidèlement ce qui a déterminé sa réponse. Dans une étude d’Anthropic, les modèles testés ne signalaient un indice qu’ils avaient utilisé que dans 25 à 39 % des cas.

Au travailUne justification convaincante ne prouve pas que la réponse est fondée.

Chen et al., Anthropic, 2025 ↗
05 · Injection de consignes

Un document peut donner des ordres

Le modèle ne sépare pas de façon fiable les instructions de l’utilisateur et le texte qu’il lit : une page web, un courriel ou un PDF peuvent contenir des consignes cachées. C’est le premier risque du classement OWASP des applications fondées sur des LLM.

Au travailLe risque augmente dès que l’outil peut envoyer, modifier ou supprimer.

OWASP, LLM01:2025 ↗
06 · Variabilité

La même question, une autre réponse

La génération est probabiliste et sensible à la formulation, à l’ordre des documents et à la version du modèle. Ses connaissances s’arrêtent à une date de coupure, sauf s’il peut consulter des sources en direct.

Au travailTester plusieurs fois, dater les essais et consigner la version utilisée.

Figure 5 · Schéma et données

Une frontière en dents de scie : la difficulté pour l’humain ne prédit pas l’échec de la machine.

ce que l’on observece que l’on imagineniveau de fiabilitéexigé par la tâchetâche simple manquéetâche complexe réussieTâches, de la plus simple à la plus difficile pour un humain →Performance de l’IA →
Tâches dans la frontière
+12 %de tâches menées à terme
+25 %de rapidité
+40 %de qualité jugée, au moins
Tâche hors frontière
−19 ptsde réponses justes
Partie haute : schéma illustratif. Partie basse : résultats de l’essai de Dell’Acqua et al. (Harvard Business School, BCG) auprès de 758 consultants, comparés à un groupe sans IA : points rouges, tâches réussies au niveau exigé ; points gris, tâches où l’IA reste en dessous. Sur la tâche hors frontière, les consultants aidés par l’IA donnaient moins souvent la bonne réponse.

06 / Lire les benchmarks

Il n’existe pas de classement universel du « meilleur modèle ».

Un benchmark mesure une performance sur un jeu de tâches, avec une consigne, une métrique et des conditions précises. Changez l’un de ces éléments et le classement peut changer.

Des liens vivants plutôt que des chiffres déjà périmés.

Les pages ci-dessous sont maintenues par leurs auteurs. Elles permettent de consulter les derniers résultats disponibles sans figer ici un palmarès qui serait rapidement dépassé. L’instantané ci-dessous montre seulement que le premier change selon le test.

Figure 6 · Instantané daté

Qui est en tête ? Cela dépend du test.

GPT-6 Astra (OpenAI, 3 sept. 2026)Claude Opus 5.5 (Anthropic, 22 sept. 2026)

Indice de capacités (ECI) ↗

Epoch AI · agrège plusieurs dizaines de tests

  1. 1GPT-6 Astra166,6
  2. 2Claude Fable 5.1165,0
  3. 3Claude Fable 5163,6
  4. 4Claude Opus 5162,7
  5. 5GPT-5.5 Pro162,5

Claude Opus 5.5 pas encore classé

Tâches professionnelles (GDPval-AA) ↗

Artificial Analysis · score Elo, comparaisons par paires

  1. 1Claude Opus 5.51 846
  2. 2Claude Fable 5.11 735
  3. 3Claude Opus 51 708
  4. 4Grok 4.71 695
  5. …GPT-6 Astra1 542

Raisonnement abstrait (ARC-AGI-2) ↗

ARC Prize · scores vérifiés

  1. 1GPT-6 Astra95,0 %
  2. 2Claude Opus 5.593,3 %
  3. 3GPT-5.692,5 %
Instantané au 27 septembre 2026, vite dépassé : suivez les liens pour les résultats du jour. Les écarts entre les premiers sont souvent inférieurs à l’incertitude de la mesure. Aucun de ces tests ne dit quel modèle convient à votre usage : cela se vérifie sur vos propres tâches.
01 · TâcheLe test ressemble-t-il réellement au travail que l’outil devra accomplir ?
02 · ProtocoleQuelle consigne, quels outils, combien d’essais et quelle version du modèle ?
03 · MesureLe score mesure-t-il l’exactitude, la préférence, le coût, la vitesse ou autre chose ?
04 · FragilitéLes données ont-elles pu être vues pendant l’entraînement et quelles erreurs sont masquées par la moyenne ?

07 / Suivre la trajectoire

Mesurer le rythme des progrès plutôt que photographier un classement.

Pour anticiper les effets sur le travail, la question utile n’est pas « quel modèle est le meilleur ? » mais « qu’est-ce qui devient faisable, à quel rythme et à quelles conditions ? ». Quatre repères datés, avec leurs limites.

Figure 7 · Données

Les tâches qu’un agent mène seul sont passées de quelques secondes à plusieurs heures.

au-delà de 16 h : mesures peu fiables1 s1 min10 min1 h8 h8 h : une journée de travail20192020202120222023202420252026Durée de la tâche pour un expert humain · échelle logarithmiqueGPT-2 · 3 sGPT-3 · 8 sGPT-3.5 · 36 sGPT-4 · 4 mino1 · 39 minGPT-5 · 3 h 23Claude Opus 4.6 · 11 h 59Claude Mythos Preview · 17 h 25GPT-5.6 SolDoublement tous les 7 mois environde 2019 à 2025, et tous les 3 mois environ depuis 2024
Source : METR, Time Horizon 1.1, données de mai 2026 (modèles de pointe à leur sortie), complétées par le rapport de METR sur GPT-5.6 Sol (juin 2026, point gris). Lecture : GPT-5 réussit une fois sur deux des tâches qui demandent environ 3 h 20 à un expert. Au 27 septembre 2026, METR n’a publié aucune mesure pour Claude Opus 5.5, Fable 5.1 ou GPT-6 Astra : les modèles les plus avancés dépassent déjà ce que ses tâches permettent de mesurer. Tâches surtout de programmation ; intervalles de confiance larges.
Voir les données
ModèleSortieHorizon à 50 %IC 95 %
GPT-2févr. 20193 s1 s – 8 s
GPT-3mai 20208 s5 s – 13 s
GPT-3.5mars 202236 s16 s – 1 min
GPT-4mars 20234 min2 min – 8 min
GPT-4 (nov.)nov. 20234 min2 min – 8 min
GPT-4omai 20247 min4 min – 13 min
Claude 3.5 Sonnet (juin)juin 202411 min5 min – 22 min
o1-previewsept. 202420 min12 min – 33 min
Claude 3.5 Sonnet (oct.)oct. 202421 min10 min – 41 min
o1déc. 202439 min21 min – 1 h 05
Claude 3.7 Sonnetfévr. 20251 h 0033 min – 1 h 44
o3avr. 20252 h 001 h 15 – 3 h 11
GPT-5août 20253 h 231 h 53 – 6 h 46
Gemini 3 Pronov. 20253 h 442 h 20 – 6 h 19
Claude Opus 4.5nov. 20254 h 532 h 42 – 10 h 24
GPT-5.2déc. 20255 h 523 h 18 – 13 h 35
Claude Opus 4.6févr. 202611 h 595 h 17 – 60 h 34
Claude Mythos Previewavr. 202617 h 258 h 29 – 55 h 04
GPT-5.6 Sol (hors modèles de pointe)juin 2026≈ 11 h 185 h 00 – 40 h 00
01Autonomie des agentsMETR · Horizon temporelLa durée des tâches confiées aux agents s’allonge viteMETR mesure la durée, en temps de travail d’un expert humain, des tâches qu’un agent réussit une fois sur deux. Elle a doublé environ tous les sept mois de 2019 à 2025, et environ tous les trois mois depuis 2024. Tâches surtout informatiques ; mesures peu fiables au-delà de 16 heures, seuil déjà atteint au printemps 2026. Aucune mesure publiée à ce jour pour Claude Opus 5.5 ou GPT-6 Astra.Suivre la courbe ↗ 02Tâches professionnellesOpenAI · GDPvalDes livrables comparés à ceux d’experts, à l’aveugle1 320 tâches issues de 44 professions, jugées par des professionnels expérimentés. Le meilleur modèle était jugé équivalent ou supérieur à l’expert dans 47,6 % des cas en septembre 2025, puis dans 84,9 % des cas en avril 2026 selon OpenAI. Tâches ponctuelles, sans échanges ni ambiguïtés du travail réel ; chiffres publiés par le concepteur du test.Voir l’évaluation ↗ 03AdaptationARC Prize · ARC-AGI-3Face à l’inédit, un écart qui se referme en quelques moisLancé en mars 2026, ce test place le système dans des environnements interactifs nouveaux, sans consigne : il doit explorer, comprendre les règles et atteindre le but. Les humains résolvent tout ; les meilleurs systèmes obtenaient moins de 1 % au lancement, puis 62,7 % en septembre 2026 avec GPT-6 Astra, dans le protocole standard vérifié par ARC Prize.Voir le benchmark ↗ 04Travail réelMETR · Essai randomiséLe gain ressenti n’est pas le gain mesuréDébut 2025, des développeurs expérimentés se pensaient 20 % plus rapides avec l’IA ; ils étaient mesurés 19 % plus lents. Une nouvelle mesure fin 2025 suggère plutôt une accélération, mais METR la juge peu probante en raison de biais de sélection. En mai 2026, une enquête déclarative affiche un gain médian de ×3, que METR estime probablement surévalué.Lire la mise à jour ↗
Figure 8 · Données

Deux tests réputés difficiles, franchis en quelques mois.

GDPval · tâches professionnelleslivrable jugé équivalent ou meilleur que celui d’un expert0 %25 %50 %75 %100 %parité avec l’expertsept. 2025mars 2026sept. 2026Claude Opus 4.1 · 47,6 %GPT-5.2 Thinking · 70,9 %GPT-5.5 · 84,9 %
ARC-AGI-3 · adaptation à l’inéditniveaux résolus, protocole standard (humains : 100 %)0 %25 %50 %75 %100 %humainssept. 2025mars 2026sept. 2026au lancement · 0,5 %Claude Opus 5 · 30,2 %GPT-6 Astra · 62,7 %
Sources : GDPval, chiffres publiés par OpenAI, concepteur du test (septembre 2025 à avril 2026) ; aucun chiffre comparable n’a été publié pour GPT-6 Astra ni Claude Opus 5.5. ARC-AGI-3, scores vérifiés par ARC Prize, septembre 2026 ; avec un dispositif qui conserve son raisonnement entre les coups, GPT-6 Astra atteint environ 99 % : le score dépend du protocole. Trait rouge : meilleur score à date ; points gris : autres modèles.
Figure 9 · Données

Gain de temps attendu avec l’IA, puis mesuré.

Source : Becker, Rush, Barnes et al., METR, 2025. Essai randomisé : 16 développeurs expérimentés, 246 tâches réelles sur leurs propres projets, début 2025. Une nouvelle mesure fin 2025 suggère plutôt une accélération, jugée peu probante par METR.
Des progrès rapides, mais inégaux.

Des systèmes capables de résoudre des problèmes de niveau expert échouent sur des tâches simples de perception ou d’adaptation. Le Rapport international sur la sûreté de l’IA (février 2026) juge plausibles, d’ici 2030, aussi bien un plafonnement qu’une forte accélération.

Une tâche réussie n’est pas un métier automatisé.

Un métier combine des tâches, des relations, des responsabilités et des imprévus. Ces repères indiquent quelles portions du travail deviennent automatisables, pas ce que deviendra le travail : cela dépend aussi des choix d’organisation.

08 / Risques des systèmes

Au-delà de l’erreur ponctuelle, trois familles de risques.

Le Rapport international sur la sûreté de l’IA, rédigé par plus de 100 experts sous la présidence de Yoshua Bengio, distingue les usages malveillants, les dysfonctionnements et les risques systémiques. Les effets sur le travail et la santé sont détaillés dans le parcours Risques.

01 · Usages malveillants

Quand l’outil sert à nuire

Fraudes et escroqueries, hypertrucages, manipulation, aide à des cyberattaques. Les laboratoires évaluent aussi l’aide que leurs modèles pourraient apporter à la conception d’armes biologiques ou chimiques.

Au travailHameçonnage ciblé, usurpation de l’identité d’un dirigeant, atteintes à la réputation.

02 · Dysfonctionnements

Quand le système fait autre chose que prévu

Contenus fabriqués, code défectueux, agents qui échouent ou détournent l’objectif fixé. En conditions de test, certains modèles ont exploité les failles de leur système de notation ou adopté des stratégies trompeuses pour atteindre un but.

Au travailActions non souhaitées d’un agent, contrôle humain réduit à une validation de façade.

03 · Risques systémiques

Quand l’effet naît de la diffusion à grande échelle

Automatisation de tâches intellectuelles, affaiblissement de l’esprit critique par excès de confiance dans la machine, dépendance affective à des compagnons conversationnels utilisés par des dizaines de millions de personnes.

Au travailDéqualification, intensification, perte d’autonomie et de sens du métier.

Un point aveugle

Les tests réalisés avant la mise sur le marché prédisent mal l’utilité et les risques en conditions réelles, et certains modèles détectent désormais qu’ils sont évalués. Le suivi après déploiement, y compris dans les organisations de travail, devient indispensable.

Des protections qui progressent, sans garantie.

Les principaux laboratoires publient des cadres de sécurité, comme la Responsible Scaling Policy d’Anthropic, le Preparedness Framework d’OpenAI ou le Frontier Safety Framework de Google DeepMind, qui associent des seuils de capacités à des mesures renforcées. La recherche en interprétabilité tente de lire les mécanismes internes des modèles plutôt que leurs seules réponses. Ces engagements restent largement volontaires et évalués par les entreprises elles-mêmes.

Un premier cadre contraignant en Europe.

Depuis le 2 août 2025, l’AI Act impose aux fournisseurs de modèles d’IA à usage général une documentation technique et une politique de respect du droit d’auteur. Les modèles présentant un risque systémique doivent en outre être évalués, faire l’objet d’une gestion des risques et d’un signalement des incidents graves. Voir le parcours Gouvernance →

09 / L’objectif d’AGI

L’AGI, un objectif affiché par les laboratoires et une notion encore disputée.

Plusieurs entreprises déclarent chercher à construire une intelligence artificielle générale, ou AGI. Il n’en existe ni définition partagée, ni test qui permettrait de constater son arrivée. Trois manières de la définir éclairent ce qui est en jeu pour le travail.

01 · Par le travail

Surpasser les humains dans la plupart des emplois

La charte d’OpenAI (2018) vise des « systèmes hautement autonomes » qui surpassent les humains dans la plupart des travaux économiquement utiles. La définition est explicitement économique : elle se mesure à la substitution du travail humain.

Charte d’OpenAI, 2018 ↗
02 · Par niveaux

Une progression plutôt qu’un seuil

Google DeepMind croise le niveau de performance, d’« émergent » à « surhumain », et l’étendue des tâches couvertes. Le degré d’autonomie laissé au système est traité à part : il relève d’un choix de déploiement, pas seulement d’une capacité.

Morris et al., Levels of AGI, 2023 ↗
03 · Par la cognition

Comparer aux aptitudes d’un adulte instruit

Un collectif de chercheurs mesure les modèles sur dix grandes aptitudes de la cognition humaine (modèle CHC). GPT-4 obtenait 27 % et GPT-5 57 %, avec un profil très irrégulier : connaissances étendues, mémoire à long terme quasi nulle.

Hendrycks, Bengio et al., 2025 ↗
Figure 10 · Grille de lecture

Les niveaux d’AGI : croiser la performance et l’étendue des tâches.

Niveau de performance
IA spécialisée · une tâche
IA générale · nombreuses tâches
0 · Sans IA
IA spécialiséeCalculatrice, compilateur
IA généraleTravail humain assisté par une plateforme (Mechanical Turk)
1 · Émergentau niveau d’un humain non qualifié, ou un peu mieux
IA spécialiséeSystèmes à règles simples
IA généraleChatGPT, Bard, Llama 2, Gemini
2 · Compétentau moins la médiane des adultes qualifiés
IA spécialiséeAssistants vocaux, détecteurs de contenus toxiques
IA généralePas encore atteint
3 · Expertau moins 90 % des adultes qualifiés
IA spécialiséeCorrecteurs de style, générateurs d’images
IA généralePas encore atteint
4 · Virtuoseau moins 99 % des adultes qualifiés
IA spécialiséeDeep Blue (échecs), AlphaGo
IA généralePas encore atteint
5 · Surhumainmieux que tous les humains
IA spécialiséeAlphaFold, AlphaZero, Stockfish
IA généraleSuperintelligence : pas encore atteinte
Source : Morris et al., Google DeepMind, « Levels of AGI », 2023, exemples des auteurs à cette date. Les modèles plus récents n’ont pas été reclassés officiellement ; les auteurs notent déjà que les meilleurs modèles atteignent le niveau « compétent » sur certaines tâches, comme la rédaction courte ou le code simple.
Figure 11 · Données

Un profil irrégulier : très fort en connaissances, nul en mémoire durable.

GPT-4 · 27 %GPT-5 · 57 %chaque aptitude est notée sur 10 ; 100 % = adulte instruit
Source : Hendrycks, Bengio et al., « A Definition of AGI », 2025, tableau 1, fondé sur le modèle CHC des aptitudes cognitives humaines. Le stockage en mémoire à long terme reste à zéro : le modèle n’apprend rien durablement d’une conversation à l’autre, sauf mémoire externe ajoutée par l’outil. Au 27 septembre 2026, aucun modèle plus récent n’a été évalué avec cette grille.
Un terme aussi contractuel que scientifique.

Dans le contrat entre Microsoft et OpenAI, la déclaration d’AGI avait des conséquences financières ; sa vérification a été confiée en octobre 2025 à un panel d’experts indépendants, avant qu’un avenant d’avril 2026 ne vide largement la clause de sa portée en dissociant les paiements des progrès technologiques.

Les annonces ne sont pas des mesures.

Plusieurs dirigeants de laboratoires évoquent publiquement une échéance de quelques années. Ces déclarations émanent d’acteurs engagés dans une course au financement ; les indicateurs mesurés et datés sont plus informatifs que les dates annoncées.

Arguments pour une arrivée rapide

Pourquoi certains anticipent une accélération

  • Les capacités mesurées progressent de façon régulière depuis plusieurs années
  • Des tests conçus pour résister aux modèles tombent vite : ARC-AGI-3 est passé de moins de 1 % à 63 % en six mois
  • Le calcul et les investissements consacrés à l’entraînement augmentent encore fortement
  • Le calcul au moment de la réponse ouvre un nouveau levier de progrès
  • Les modèles contribuent déjà à la programmation et à la recherche en IA, ce qui pourrait accélérer la suite
Arguments de prudence

Pourquoi d’autres restent sceptiques

  • L’apprentissage continu et la mémoire durable restent très limités
  • Les scores dépendent du protocole : sur ARC-AGI-3, le même modèle obtient 63 % ou 99 % selon le dispositif de test
  • La fiabilité sur de longues tâches progresse moins vite que les démonstrations
  • Énergie, données et capitaux pourraient freiner la poursuite de l’échelle
  • Réussir des tests ne garantit pas de tenir un poste dans un environnement réel
Pour la santé au travail

L’enjeu n’est pas de parier sur une date. Il s’agit de suivre, tâche par tâche, ce qui devient automatisable, à quel rythme et sous quel contrôle, et d’anticiper les effets sur la charge, l’autonomie, les compétences et l’emploi avant qu’ils ne s’imposent. Voir les enjeux économiques et sociaux →

10 / Revenir au travail réel

Un bon score technique ne prédit pas, à lui seul, un bon usage professionnel.

Le benchmark décrit le comportement d’un modèle dans un test. Le déploiement doit aussi être évalué dans la tâche réelle, avec ses contraintes, ses responsabilités et ses effets sur les personnes.

Évaluation du modèle

Le système répond-il correctement ?

  • Exactitude sur des cas représentatifs
  • Erreurs fréquentes et erreurs graves
  • Stabilité d’une réponse à l’autre
  • Coût, délai et besoin en ressources
  • Résistance à des entrées trompeuses
Évaluation du déploiement

Le travail est-il mieux fait sans créer de nouveaux risques ?

  • Temps réellement gagné, y compris la relecture
  • Qualité finale du travail et traitement des exceptions
  • Responsabilités et moyens de contester un résultat
  • Charge, autonomie, compétences et coopération
  • Effets observés avant et après la mise en place
Le principe à retenir

On n’évalue pas seulement un modèle. On évalue le système de travail formé par l’outil, la tâche, les données, les personnes qui l’utilisent et les règles de l’organisation.

11 / Avant un usage professionnel

Cinq questions pour passer de la démonstration à une décision éclairée.

Ces questions évitent de partir du produit ou de sa réputation. Elles obligent à décrire l’usage concret et les moyens nécessaires pour le maîtriser.

01Quelle tâche précise voulons-nous transformer ?

Décrire la situation actuelle, le résultat attendu, les personnes concernées et les moments où une erreur aurait des conséquences importantes. « Gagner du temps » n’est pas une tâche.

02Quelles données seront envoyées, conservées ou réutilisées ?

Identifier les données personnelles, confidentielles ou couvertes par un secret ; vérifier le lieu de traitement, la durée de conservation et les usages prévus par le fournisseur.

03Qui vérifiera le résultat, avec quel temps et quelles informations ?

Nommer la personne compétente, intégrer la relecture à la charge de travail et préciser les sources auxquelles elle pourra comparer la réponse.

04Qui décide et qui répond des conséquences ?

Distinguer la proposition de l’outil, la décision humaine et la responsabilité de l’organisation. Prévoir un moyen de contester, corriger ou suspendre l’usage.

05Quels effets allons-nous mesurer après le lancement ?

Choisir avant le test quelques indicateurs utiles : qualité, erreurs, temps de contrôle, charge, autonomie, compétences, entraide et difficultés signalées.

Pour aller plus loin

Choisir la ressource adaptée à la question que vous vous posez.

Une sélection courte, issue d’organismes publics ou de projets de recherche qui expliquent leur méthode. Le niveau et la langue sont indiqués.

Newsletter indépendante

Suivre les usages, les évaluations et leurs effets sur le travail.