Nouveau modèle

GPT-6.1 Sol : OpenAI garde ses prix et divise par deux la lecture de cache

Le 29 septembre, OpenAI a lancé GPT-6.1 Sol dans son API à 2 et 10 dollars le million de jetons, le tarif de GPT-6 Sol sorti une semaine plus tôt. Seule la lecture de cache baisse, de 0,20 à 0,10 dollar, et le réglage de raisonnement « none » disparaît. Le même jour, Bain observe que le coût par tâche des entreprises reste élevé malgré la baisse du prix du jeton.

STStephane Nachez · ·8 min
Le prix affiché du jeton n'a pas bougé mais le coût réel d'une session d'agent dépend du cache et de l'infrastructure d'inférence facturée
Visuel d'illustration généré par IA - ActuIA
Sommaire

Le 22 septembre, OpenAI sortait GPT-6 Sol à 2 dollars le million de jetons d'entrée et 10 dollars en sortie, la moitié du tarif promotionnel de GPT-5.6 Sol. ActuIA avait appliqué ces grilles à une session d'agent type et refait le calcul. Une semaine plus tard, le 29 septembre, à son DevDay, l'éditeur a mis en ligne GPT-6.1 Sol. Entrée : 2 dollars. Sortie : 10 dollars.

Le prix affiché n'a pas bougé, une seule ligne du barème a changé : la lecture de cache, c'est-à-dire la relecture d'un début de requête déjà traité, tombe de 0,20 à 0,10 dollar le million de jetons. Le même jour, Bain & Company publiait un chapitre de son Technology Report 2026 consacré à la dépense en jetons, où il observe que le coût par tâche des entreprises, lui, reste élevé.

Un barème identique, une ligne divisée par deux

La fiche de GPT-6.1 Sol affiche quatre tarifs par million de jetons en contexte court : 2,00 dollars en entrée, 0,10 dollar en entrée servie par le cache, 2,50 dollars en écriture de cache, 10,00 dollars en sortie. La documentation précise que le cache est facturé « 5 % du tarif d'entrée non mis en cache ». La fiche de GPT-6 Sol, publiée sept jours plus tôt, affiche les mêmes 2,00 et 10,00 dollars, la même écriture à 2,50 dollars, et 0,20 dollar en lecture de cache, soit « 10 % du tarif d'entrée non mis en cache ». Elle renvoie désormais à GPT-6.1 Sol comme « le modèle Sol plus récent ».

Le reste du barème est inchangé. Au-delà de 272 000 jetons d'entrée, la requête entière passe au double pour l'entrée et le cache, et à une fois et demie pour la sortie ; le Batch, traitement différé, et le Flex, traitement plus lent à la disponibilité non garantie, valent la moitié du tarif standard, le traitement régional ajoute 10 %.

Au 30 septembre, la page tarifs d'OpenAI n'affiche, dans son tableau des modèles phares, que trois lignes : gpt-6-astra, gpt-6.1-sol et gpt-6-luna. Sorti sept jours avant son successeur, gpt-6-sol n'y figure pas. GPT-6 Astra y est facturé 10 et 50 dollars, avec une lecture de cache à 1,00 dollar. Au tarif standard et en contexte court, GPT-6.1 Sol vaut donc un cinquième de GPT-6 Astra en entrée comme en sortie, et un dixième sur la lecture de cache.

La session d'agent type, recalculée

Le scénario du 25 septembre : un million de jetons d'entrée cumulés dont 70 % relus en cache, 100 000 jetons de sortie facturés, tarif standard, écritures de cache et frais d'outils exclus, chaque requête sous le seuil de contexte long. Il donnait 1,74 dollar sur GPT-6 Sol.

Le même scénario sur GPT-6.1 Sol donne 1,67 dollar, dont 0,60 dollar pour les 300 000 jetons d'entrée neufs, 0,07 dollar pour les 700 000 relus et 1,00 dollar pour la sortie. Soit 4 % de moins. L'hypothèse porte tout le résultat : les 100 000 jetons de sortie incluent les jetons de raisonnement, que le guide d'OpenAI déclare « facturés comme des jetons de sortie » bien que leur contenu ne soit pas exposé par l'API.

Le gain relatif est multiplié par cinq sur le profil plus dépendant du cache qu'ActuIA avait appliqué aux modèles Claude Opus d'Anthropic : cinq millions de jetons relus, 200 000 jetons neufs, 100 000 en sortie. GPT-6 Sol y coûte 2,40 dollars, GPT-6.1 Sol 1,90 dollar, soit environ 21 % de moins. Porté sur GPT-6 Astra, ce profil coûte 12,00 dollars : GPT-6.1 Sol en représente 16 %. Sur la session type, Astra coûte 8,70 dollars et GPT-6.1 Sol 19 % de ce montant. En traitement Batch, la session type tombe à 0,84 dollar sur GPT-6.1 Sol, le profil à fort cache à 0,95 dollar.

L'effort « none » a disparu de la fiche

La fiche de GPT-6 Sol liste six niveaux d'effort de raisonnement, de « none » à « max ». Celle de GPT-6.1 Sol en liste cinq et ajoute une phrase : « Les efforts de raisonnement none et minimal ne sont pas pris en charge. » Les jetons de raisonnement étant facturés au tarif de sortie, le plus élevé des quatre, la disparition de ce réglage ferme au nouveau modèle les étapes où l'on ne voulait précisément pas payer de raisonnement. Sur la session de référence calculée en septembre, la sortie représentait à elle seule 57 % de la facture de Sol.

La contrainte se prolonge côté interfaces. GPT-6 Sol autorise l'appel de fonctions dans Chat Completions « seulement avec reasoning_effort réglé sur none » ; sur GPT-6.1 Sol, l'appel d'outils passe par l'API Responses et Chat Completions est « pris en charge sans appel d'outils ». Une intégration concernée doit être réécrite.

AWS, qui a ouvert Amazon Bedrock au modèle le 29 septembre, reprend les mesures d'OpenAI : GPT-6.1 Sol égale GPT-6 Astra sur DeepSWE v1.1, un test d'ingénierie logicielle mené sur des bases de code réelles, pour environ un cinquième du coût par tâche, et dépasse le meilleur score de GPT-6 Sol de 6,4 points de pourcentage « tout en utilisant un effort de raisonnement inférieur ». L'annonce d'OpenAI parle d'un gain obtenu « à un effort de raisonnement et un coût inférieurs », et chiffre à 5,47 dollars le coût moyen par tâche de GPT-6.1 Sol sur Terminal-Bench Science 0.1 à effort maximal, contre 23,80 dollars pour GPT-6 Astra. Ces mesures sont celles de l'éditeur.

Au-dessus, la relève attendue n'arrive pas : le 28 septembre, TheWrap rapportait qu'OpenAI renonçait à publier GPT-6.1 Astra, prévu pour octobre, Saachi Jain, sa responsable des systèmes de sûreté, évoquant un modèle qui ne tenait pas assez dans son périmètre et ses autorisations, et rendait mal compte du travail accompli.

La thèse de Bain et ses angles morts

Le chapitre « Managing Token Spending without Choking Off Opportunity », signé de Jue Wang, Anne Hoecker, Alec Koh, Chris McLaughlin et Vito Trinchera, décrit le mécanisme qui annule les baisses de tarif. Les entreprises migrent vers le modèle de frontière le plus récent, leurs agents consomment davantage sur des tâches plus sophistiquées, et l'usage s'étend à de nouveaux flux de travail. Résultat, selon le cabinet : « la baisse du coût par jeton est compensée par la hausse des usages, ce qui laisse le coût global par tâche obstinément élevé », et « le point d'inflexion attendu ne s'est pas encore matérialisé ».

Le diagnostic de Bain ne porte pas sur une dépense incontrôlée, mais sur une dépense mal placée. Le cabinet cite une entreprise technologique mondiale qui a fixé, pour encourager l'usage, un plafond souple de 500 dollars par mois et par développeur : la dépense moyenne s'est établie autour de 200 dollars.

Une phrase du chapitre raccorde cette thèse au barème d'OpenAI. Pour un assistant de connaissance largement déployé, écrit Bain, « la quasi-totalité des jetons sont des jetons d'entrée mis en cache […] qu'une entreprise ne peut ni voir ni prévoir facilement ». C'est la ligne qu'OpenAI a divisée par deux.

Restent les angles morts. Le texte ne donne ni taille d'échantillon, ni méthode, ni nom d'entreprise. La figure qui soutient la thèse du cabinet porte pour sources « Wells Fargo, octobre 2025 ; analyse Bain » : la courbe du coût moyen par jeton s'appuie sur une source datée d'octobre 2025.

L'arbitrage se déplace vers le taux de réutilisation

Pour qui avait lu la grille du 22 septembre comme le nouveau plancher de la gamme, la décision se déplace. Le choix se joue entre deux modèles au même prix affiché, dont l'écart dépend de deux variables : la part d'entrée servie par le cache, qui fait passer le gain de 4 à 21 % dans les calculs ci-dessus, et le niveau d'effort, qui commande la ligne de sortie. Les étapes déterministes qui tournaient à effort « none » doivent rester sur un modèle qui propose encore ce réglage, soit GPT-6 Sol, soit GPT-6 Luna à 0,10 et 0,50 dollar, soit GPT-5.6 Sol à 4 et 20 dollars, un tarif promotionnel garanti au moins jusqu'au 21 novembre 2026. Comme GPT-6.1 Sol, GPT-6 Astra ne le propose pas.

La résidence européenne des données est proposée sur les deux modèles, hors mode rapide ; la fiche de GPT-6.1 Sol y ajoute la résidence américaine. Le traitement régional reste majoré de 10 %.

Le mouvement du 29 septembre est un repositionnement de gamme. Le palier à 2 dollars sert désormais, selon les mesures de l'éditeur, un niveau de capacité supérieur, pendant que le modèle qui l'occupait est absent du tableau des modèles phares de la page tarifs. Pour piloter une dépense, les seuls repères de coût par tâche sont ceux de l'éditeur, mesurés sur des benchmarks : ni OpenAI ni Bain ne publient celui d'une même application avant et après migration.

Bain écrit, d'expérience, qu'un nouveau flux de travail peut coûter dix fois plus qu'il ne le devrait. Sur la session type d'ActuIA, à consommation de jetons égale, le passage de GPT-6 Sol à GPT-6.1 Sol récupère 0,07 dollar.

ST
Stephane Nachez

Rédaction ActuIA — actualités, données et analyses sur l'intelligence artificielle pour les décideurs.

Acteurs cités
OPOpenAI
BABain & Company
AMAmazon Web Services
GPGPT-6 Astra
ANAnthropic
ACActuIA
AMAmazon
GPGPT-5
L'Hebdo ActuIA

Inscription confirmée, à très vite !