Blog · IA & stratégie

Modèles d'IA ouverts : 56 % du volume, 14 % de la facture

Le volume part vers les modèles bon marché. L'argent, lui, reste sur les modèles de pointe.

Vercel, l'hébergeur de ce site, exploite aussi AI Gateway : un point d'accès unique par lequel des applications interrogent les modèles d'IA de plusieurs éditeurs, avec un suivi des dépenses et une bascule vers un autre fournisseur en cas de panne. Des dizaines de milliers de milliards de tokens y transitent chaque mois ; le token est l'unité de texte sur laquelle les IA sont facturées, un mot ou un morceau de mot.

Vercel en publie les chiffres chaque mois. Dans l'édition du 17 septembre, consacrée à août, les modèles d'IA ouverts, que chacun peut télécharger, ont traité 56 % des tokens, pour 14 % des dépenses. Dans un classement, comme celui dont je parlais le 28 septembre, les modèles sont notés sur des épreuves. Ici, il s'agit de ce que des équipes paient.

Le volume part vers les modèles ouverts

Un modèle à poids ouverts est un modèle dont l'éditeur publie les poids, c'est-à-dire les paramètres numériques qui déterminent ses réponses : chacun peut les télécharger. Ceux des modèles fermés, non. En décembre 2025, les modèles ouverts traitaient 7 % des tokens passés par AI Gateway, puis leur part a progressé chaque mois d'avril à août, de 13 % à 56 %.

Côté dépenses, 14 % seulement. À prix catalogue, le token d'un modèle fermé revient donc en moyenne à près de huit fois celui d'un modèle ouvert. L'argent reste chez les éditeurs de modèles fermés, et d'abord chez Anthropic, qui édite l'assistant Claude : 64 cents sur chaque dollar dépensé en août, jamais moins de 61 cents depuis décembre.

Pour Vercel, les équipes peuvent désormais faire traiter davantage de demandes avec le même budget, et réserver les modèles de pointe, les plus puissants, « aux seules tâches qui justifient leur surcoût ».

À moitié prix, un modèle « assez bon » l'emporte

Chez Anthropic, Fable est le modèle le plus puissant. Et le plus cher. Opus, la gamme juste en dessous, coûte environ moitié moins au token. Revenu le 1er juillet après la levée d'une restriction à l'exportation imposée par Washington, ce que je racontais le jour même, Claude Fable 5 a pris 13,2 % des dépenses de la plateforme en juillet. Opus 5 est arrivé fin juillet.

En août, Fable 5 est retombé à 4,9 % des dépenses, et Opus 5 est monté à 22,5 %. Neuf équipes sur dix qui utilisaient Fable ont réduit leur usage, et c'est vers Opus 5 qu'elles ont le plus souvent basculé leur travail. Pour Vercel, le surcroît de capacité de Fable « ne valait pas le double du prix ».

Anthropic a gardé ces clients. Le travail est resté chez lui, un cran plus bas : Opus 5 a gagné près de deux fois ce que Fable a perdu.

Les équipes paient le modèle le plus cher seulement quand il fait la différence. Quand un modèle à moitié prix fait le même travail, elles changent en un mois. Et le gros du volume part déjà vers des modèles bon marché.

Quand le nouveau modèle n'apporte rien de plus, les clients partent ailleurs

Google a vécu l'inverse. Gemini 3 Flash, un modèle de Google environ neuf fois moins cher qu'Opus 5, a perdu 95 % de sa part des tokens depuis mai. Google ne l'a pas retenue. Plus des trois quarts du volume perdu sont partis chez d'autres éditeurs, et les successeurs de Gemini 3 Flash chez Google n'en ont pas récupéré un dixième : selon Vercel, ils n'offraient d'avantage ni en capacité ni en prix.

Environ la moitié de ce volume est allée vers des modèles moins chers, à commencer par GPT-5.6 Luna, d'OpenAI, l'éditeur de ChatGPT. L'essentiel du reste est parti vers des modèles plus chers, dont Claude Opus 5. Sur la même période, la part de Google dans les tokens de la plateforme est tombée de 30 % à 5 %.

Certains ont payé plus, d'autres moins. Vercel en tire une règle : « La fidélité à un éditeur ne suit pas la marque, elle suit le profil du modèle. » Quand un nouveau modèle conserve ce que ses utilisateurs appréciaient chez le précédent, l'éditeur garde ses clients. Sinon, ils vont voir ailleurs. Opus 5 illustre le premier cas, Gemini 3 Flash le second.

Qui est mesuré, et comment

Ces statistiques ne portent que sur les équipes qui passent par la plateforme de Vercel, et qui peuvent donc changer de modèle sans changer d'outil ; l'usage de ChatGPT ou de Claude par des salariés n'y figure pas. Vercel vend cette plateforme. La page du rapport s'ouvre d'ailleurs sur une invitation à essayer un modèle qu'il distribue. Et les dépenses sont estimées aux prix catalogue, pas d'après les factures réelles.

Le prix moyen du token a reculé de 23,2 % en août, troisième baisse d'affilée. Parmi les équipes qui ont consommé plus de dix millions de tokens en juillet comme en août, l'équipe médiane, celle du milieu du classement, n'a pourtant payé son token que 7,6 % moins cher. Soit trois fois moins. Selon Vercel, la moyenne baisse aussi parce que le volume glisse vers les modèles ouverts.

Enfin, ces chiffres s'arrêtent à fin août, avant les modèles moins chers sortis le 22 septembre par Anthropic et OpenAI.

Dans vos automatisations

Avant de payer le modèle le plus cher pour une tâche, passez vos cas réels dans celui d'un cran plus bas : si le modèle moins cher fait le travail, la différence vous revient.

Votre fournisseur sort un nouveau modèle ? Ne l'adoptez pas par réflexe. Repassez les mêmes cas dans ce successeur et dans le modèle d'un concurrent, en comparant le coût d'une tâche réussie : dix demandes réelles, avec le résultat et la facture de chacune.

Et n'attendez pas la baisse des prix. L'économie vient du tri des tâches, avec un modèle bon marché pour le volume et le plus puissant là où une erreur coûte cher.

Les modèles en tête des dépenses changent au fil des mois. La répartition se confirme pourtant depuis le printemps : la part des modèles ouverts dans le volume a augmenté chaque mois d'avril à août, et Anthropic n'est jamais descendu sous 61 % des dépenses depuis décembre. Réglez vos automatisations dessus.

Sources : Vercel, AI Gateway Production Index de septembre 2026 et documentation d'AI Gateway ; glossaire de la NTIA, agence du gouvernement américain, pour la définition des modèles à poids ouverts ; SiliconANGLE sur les modèles sortis le 22 septembre. Citations traduites de l'anglais.

Questions fréquentes

Qu'est-ce qu'un modèle d'IA à poids ouverts ?

Un modèle dont l'éditeur publie les poids, c'est-à-dire les paramètres numériques qui déterminent ses réponses : chacun peut les télécharger. Ceux des modèles fermés ne sont pas publiés. En août 2026, les modèles ouverts ont traité 56 % des tokens passés par AI Gateway, la plateforme de Vercel, mais seulement 14 % des dépenses.

Pourquoi les équipes ont-elles délaissé Claude Fable 5 pour Opus 5 ?

Opus, la gamme juste en dessous de Fable chez Anthropic, coûte environ moitié moins au token. En août, neuf équipes sur dix qui utilisaient Fable 5 ont réduit leur usage, et sa part des dépenses est tombée de 13,2 % à 4,9 %. Pour Vercel, son surcroît de capacité « ne valait pas le double du prix ».

Ces chiffres valent-ils pour toutes les entreprises ?

Non. Ils ne portent que sur le trafic passé par la plateforme de Vercel, dont les clients peuvent changer de modèle sans changer d'outil. Les dépenses sont estimées aux prix catalogue, et les données s'arrêtent à fin août, avant les modèles moins chers sortis le 22 septembre par Anthropic et OpenAI.