Ils ont appelé à ralentir l'IA, puis ont sorti un modèle chacun le même jour
Le 22 septembre, Anthropic et OpenAI ont chacun sorti un modèle, dix jours après l'appel de leurs patrons à ralentir.
Le 14 septembre, j'ai publié ici une lecture de We Must Pace the Frontier, un texte de Dario Amodei, le patron d'Anthropic, l'entreprise américaine qui développe l'assistant Claude. Il y défend un ralentissement du développement de l'IA, puis explique pourquoi une pause mondiale a peu de chances d'aboutir : chaque pays a intérêt à continuer pendant que les autres freinent. C'est le dilemme du tricheur. Le 22 septembre, il a connu son premier test grandeur nature, entre les deux entreprises dont les patrons venaient d'appeler à ralentir.
Trois semaines, trois annonces
Début septembre, OpenAI, l'entreprise de ChatGPT, publie GPT-6 Astra, son nouveau modèle le plus puissant. Un modèle, c'est l'IA qui vous répond dans ChatGPT ou Claude. Sur sa propre page, OpenAI montre Astra devant Claude Fable 5.1, le haut de gamme d'Anthropic, sur chacun des benchmarks où les deux figurent : ces examens standardisés servent à comparer les IA entre elles.
Le 12 septembre, le site d'information américain Axios relaie le texte d'Amodei. Sa phrase centrale ne laisse aucune ambiguïté : « We must slow the pace at which we improve the capabilities of AI models. » Autrement dit, il faut ralentir le rythme auquel progressent les capacités des modèles. Axios rapporte aussi la réponse de Sam Altman, le patron d'OpenAI, publiée sur le réseau social X (ex-Twitter) : « I agree with Dario that we need to pace the frontier. »
Le 22 septembre, Anthropic sort Claude Opus 5.5. Le même jour, OpenAI sort GPT-6 Sol et GPT-6 Luna, deux modèles moins chers que la gamme précédente.
Ce que mesurent ces benchmarks
Dans un benchmark, tous les modèles passent les mêmes tâches, notées selon une règle fixée d'avance : le score indique la part réussie. Il ne dit rien de vos tâches à vous.
Anthropic compare Opus 5.5 et Astra sur six épreuves, qui ne mesurent pas la même chose :
- Terminal-Bench 4.0 : des tâches informatiques longues à mener seul dans un terminal, l'écran de commandes des informaticiens. Des tests automatiques vérifient le résultat. Opus 5.5 : 66,4 % ; Astra : 57,9 %.
- FrontierCode v1.1 : du code informatique noté sur sa qualité autant que sur son fonctionnement. Une faute bloquante vaut zéro. Opus 5.5 : 54,4 % ; Astra : 53,3 %.
- GDPval-AA v2.1 : 220 livrables professionnels issus de 44 métiers. Une IA arbitre compare les rendus deux par deux, à l'aveugle. Le score est un classement Elo, comme aux échecs : plus il est élevé, plus le modèle l'emporte souvent dans ces duels. Opus 5.5 : 1 846 ; Astra : 1 542.
- Humanity's Last Exam : 2 500 questions de niveau recherche, rédigées par près de 1 000 experts. Opus 5.5 : 67,7 % ; Astra : 57,2 %.
- AutomationBench, créé par Zapier, un outil d'automatisation sans code : des tâches administratives enchaînées, par exemple retrouver et mettre à jour une fiche client puis envoyer la relance. La notation est binaire : les bons enregistrements ont été modifiés et les bons messages envoyés, ou la tâche échoue. Astra : 41,4 % ; Opus 5.5 : 40,0 %.
- Terminal-Bench-Science 0.1 : 70 tâches tirées de la recherche scientifique, vérifiées par des tests. Astra : 64,6 % ; Opus 5.5 : 58,7 %.
Opus 5.5 mène sur les quatre premières épreuves, Astra sur les deux dernières. Pour une PME, la ligne à regarder en premier est AutomationBench : c'est l'épreuve la plus proche du travail administratif que vous voudriez confier à une IA.
D'après la grille tarifaire d'Anthropic, Opus 5.5 coûte 4 $ par million de tokens envoyés et 20 $ par million de tokens produits, contre 10 $ et 50 $ pour Fable 5.1. Le token est l'unité de facturation des IA : un fragment de mot. Un modèle deux fois et demie moins cher dépasse donc le haut de gamme de la maison sur chaque benchmark où Anthropic les compare.
Tous ces chiffres sont publiés par les entreprises elles-mêmes. Ils ne concordent pas toujours. Sur FrontierCode v1.1, le même Fable 5.1 obtient 50,3 % dans le tableau d'Anthropic et 50,9 % dans celui d'OpenAI. Chaque entreprise mesure dans ses propres conditions, et aucun organisme indépendant n'a vérifié ces tableaux.
Relire l'essai avant de crier à l'hypocrisie
Ma première réaction a été de sourire. Un dirigeant réclame un ralentissement, et dix jours après que l'appel a été relayé, son entreprise sort un modèle qui surpasse son propre haut de gamme. L'essai, lu de près, ne permet pourtant pas de conclure à l'hypocrisie.
Amodei y écrit : « Pacing does not mean halting model training or technical progress. » Ralentir ne veut pas dire arrêter de développer de nouveaux modèles. Surtout, il veut un ralentissement décidé ensemble, par toutes les entreprises du secteur, pour qu'aucune ne sacrifie son avantage commercial. Le seul engagement qu'Anthropic prend de son côté consiste à accueillir des experts extérieurs, chargés de vérifier ses pratiques de sécurité.
Anthropic l'assume sur la page d'Opus 5.5 : « Claude Opus 5.5 is our first release since we called for pacing the frontier. It was tested before release by external evaluators […] » L'entreprise tient à la lettre ce qu'elle a promis. Rien de plus.
La sortie du 22 septembre ne contredit donc pas l'essai. Elle l'illustre : sans accord entre les entreprises, celle qui ralentit seule cède sa place, et aucune ne veut être celle-là.
Sauf que « ralentir, mais pas avant les autres » est précisément la posture qui garantit que personne ne ralentit. Un appel sans engagement précis et vérifiable reste un appel. Le dilemme du tricheur vaut aussi pour ceux qui le décrivent.
Le 22 septembre en une phrase. Les deux patrons qui avaient appelé à ralentir la course ont chacun publié un modèle le même jour : sans engagement précis, un appel à ralentir ne modifie aucun calendrier de sorties.
Pour votre entreprise, la course ne ralentira pas
Deux entreprises ont fait trois annonces en trois semaines. Attendre que le marché se stabilise avant d'automatiser revient à attendre indéfiniment.
Dans vos scénarios Make ou n8n, les outils d'automatisation sans code, le modèle doit rester un simple réglage. Chez un même fournisseur, passer d'une version à la suivante doit se résumer à modifier une valeur. Entre fournisseurs, regroupez l'appel à l'IA dans un seul module : le jour où vous changez de modèle, vous ne réécrivez que ce module.
Ne choisissez pas non plus sur la foi d'un tableau publié par une entreprise d'IA. Sur AutomationBench, Astra devance Opus 5.5 d'un point et demi à peine. Testez sur vos tâches : prenez dix demandes réelles, passez-les dans deux modèles, notez le résultat et le coût de chacun. Je le disais le 14 septembre : ce que les États n'obtiennent pas les uns des autres, la vérification, vous l'avez en interne pour un coût dérisoire.
Tant qu'aucun accord ne rend la triche détectable, chaque sortie en appellera une autre. Votre marge de manœuvre se situe dans vos propres systèmes : des automatisations qui changent de modèle sans casser.
Sources : l'essai de Dario Amodei, We Must Pace the Frontier ; la page d'annonce de Claude Opus 5.5 et la grille tarifaire d'Anthropic ; la page d'annonce de GPT-6 Astra ; Axios, 12 septembre 2026. Pour les benchmarks : Terminal-Bench et Terminal-Bench-Science, FrontierCode, GDPval-AA, Humanity's Last Exam, AutomationBench. Les citations sont en anglais dans le texte d'origine. Article préparé avec l'aide de Claude Opus 5.5, le modèle dont il est question.
Questions fréquentes
Que demande Dario Amodei dans « We Must Pace the Frontier » ?
Le patron d'Anthropic demande de ralentir le rythme auquel les IA progressent, sans arrêter d'en développer de nouvelles. Ce ralentissement doit être décidé ensemble par les entreprises du secteur. Anthropic s'engage seulement à faire contrôler ses pratiques de sécurité par des experts extérieurs.
Que mesure un benchmark d'IA ?
Un benchmark est un examen standardisé : la même série de tâches pour chaque modèle, notée selon une règle fixée à l'avance. Un même modèle peut obtenir des scores différents selon qui le teste.
Que doit faire une PME face à ce rythme de sorties ?
Ne pas attendre que le marché se stabilise. Dans Make ou n8n, regroupez l'appel à l'IA dans un module unique, pour changer de modèle sans tout réécrire. Puis comparez les modèles sur vos propres tâches, résultat et coût à l'appui.