Mains d’un développeur posées sur un clavier d’ordinateur portable dans un bureau sombre, baies de serveurs allumées en arrière-plan.

Pourquoi une seule requête à GPT-6 Astra peut-elle coûter des dizaines de dollars ?

Au-delà de 272 000 tokens de contexte, GPT-6 Astra refacture la requête entière au double du tarif d’entrée. Un seul token de trop ajoute 2,72 dollars, et le Fast mode double encore l’addition.

Depuis la mise en service de GPT-6 Astra, le prix d’une requête à l’IA se compte en dizaines de dollars. Sur l’API d’OpenAI, la grille publiée affiche 10 dollars le million de tokens en entrée et 50 dollars en sortie, soit deux fois et demie le tarif de GPT-5.6 Sol. Next.ink a titré début septembre sur « jusqu’à 33 dollars pour un prompt ». Le chiffre n’est pas une coquille.

Le tarif affiché n’est qu’un palier. Passé un certain volume de contexte, OpenAI refacture la requête entière au tarif supérieur, et pas seulement la part qui dépasse. Le seuil ne prévient pas.

Le token de trop coûte 2,72 dollars

La fenêtre d’Astra accepte 1 050 000 tokens, et le compteur bascule au quart du réservoir. Au 21 septembre 2026, le tarif d’entrée de GPT-6 Astra passe de 10 à 20 dollars le million de tokens dès qu’une requête dépasse 272 000 tokens de contexte : un seul token de trop ajoute 2,72 dollars à la facture d’un développeur français.

Le calcul tient en deux lignes. Un prompt calé juste sous la barre revient à 2,72 dollars en entrée ; le même prompt, un token plus loin, coûte 5,44 dollars. La facture double pour 0,0004 % de texte supplémentaire. En sortie, le tarif suit le même mouvement, de 50 à 75 dollars le million.

Fast mode et cache, les deux autres curseurs

OpenAI vend le même modèle à plusieurs régimes. Le Fast mode, qui priorise le traitement, s’applique au double des tarifs en vigueur : 20 dollars le million en entrée en contexte court, 40 dollars au-delà du seuil. Il porte bien son nom. Il vide le budget deux fois plus vite.

Dans l’autre sens, deux leviers font baisser l’addition. Le cache d’entrée revient à 1 dollar le million en contexte court, soit dix fois moins que le tarif plein pour un préambule réutilisé d’une requête à l’autre. Un surcoût de 10 % s’ajoute en revanche aux requêtes traitées sur des points d’accès régionaux, pour les organisations qui exigent que leurs données restent dans un pays donné.

Le mode d’emploi tient en deux gestes. Découper un dossier trop long en requêtes qui restent sous la barre, plutôt que de tout envoyer d’un coup. Et réutiliser le même préambule, mot pour mot, pour qu’il tombe dans le cache.

Le prix d’entrée d’Astra varie du simple à l’octuple selon le régime de facturation choisi ; le franchissement du seuil de contexte fait basculer la requête entière, pas son seul dépassement.
Le prix d’entrée d’Astra varie du simple à l’octuple selon le régime de facturation choisi ; le franchissement du seuil de contexte fait basculer la requête entière, pas son seul dépassement.
Reprendre ce graphique ou citer ce chiffre

Citez ce chiffre en mentionnant Actu Alt Plus :

Ou réutilisez ce graphique librement sur votre site, attribution incluse :

Quatre prix d’entrée coexistent donc pour un seul modèle, du batch à 5 dollars au Fast mode en contexte long à 40. La grille complète tient en six lignes.

Tarifs API publiés, en dollars par million de tokens, grilles OpenAI et Anthropic en vigueur le 21 septembre 2026.
Régime de facturationEntréeSortie
Astra, contexte court (sous 272 000 tokens)10 $50 $
Astra, contexte long20 $75 $
Astra en Fast mode, contexte court20 $100 $
Astra en Fast mode, contexte long40 $150 $
Astra en mode batch, contexte court5 $25 $
Claude Fable 5.1, chez Anthropic10 $50 $

Chez le concurrent, le prix d’entrée est identique

La comparaison fait ressortir ce qui coûte vraiment. Anthropic facture Claude Fable 5.1 aux mêmes 10 et 50 dollars le million qu’Astra en contexte court, et sa grille publiée n’affiche qu’un seul palier. Next.ink situe à 18,14 dollars le plafond d’un prompt chez Anthropic, contre 33,65 dollars chez OpenAI. L’écart ne vient pas du prix affiché. Il vient du seuil.

Long rouleau de papier vierge déroulé depuis le bord d’un bureau jusqu’au sol d’un open space.
Deux modèles affichent le même prix d’entrée : c’est le seuil de contexte qui creuse l’écart.

Reste à savoir qui envoie des requêtes de cette taille. Les intégrateurs, d’abord, ceux qui font tourner des agents sur des dépôts de code ou des corpus documentaires entiers. GitLab a mesuré sur sa plateforme d’agents 42,7 % de jetons en moins par exécution avec Astra qu’avec GPT-5.6 Sol, et 43,4 % de temps en moins. Le tarif monte, la consommation baisse, et personne ne publie le solde des deux.

Côté grand public, rien de tout cela n’apparaît sur la facture. L’abonnement reste forfaitaire et c’est la limite de messages qui sert de compteur : Next.ink rapporte un relèvement de la fourchette Plus, de 3 à 30 messages vers 5 à 45. Qui a droit à quoi selon son plan se lit dans notre comparatif des accès. Le même modèle est par ailleurs classé tout en haut de l’échelle de risque cyber d’OpenAI.

Reste la file d’attente. En mode batch, le million de tokens en entrée retombe à 5 dollars, huit fois moins que le même prompt lancé en Fast mode au-delà du seuil. Le prix d’une requête dépend moins du modèle choisi que de la patience qu’on accepte d’y mettre.

Votre réaction :

Article créé en collaboration avec l’IA.

Les plus lus

  1. 1Taratata 600 : la date d’enregistrement et celle de diffusionTaratata 600 : la date d’enregistrement et celle de diffusion
  2. 2Mondiaux de cyclisme : le maillot arc-en-ciel rapporte 8 000 euros, moins qu’une étape du TourMondiaux de cyclisme : le maillot arc-en-ciel rapporte 8 000 euros, moins qu’une étape du Tour
  3. 3Prix du roman Fnac 2026 : « C’était ça ou mourir » lauréatPrix du roman Fnac 2026 : « C’était ça ou mourir » lauréat
  4. 4Résultats des évaluations nationales 2026, dès le 21 septembreRésultats des évaluations nationales 2026, dès le 21 septembre
  5. 5Résultat du Super Loto du 18 septembre : 13 millions gagnésRésultat du Super Loto du 18 septembre : 13 millions gagnés

Nos dossiers

Recevez notre sélection dans votre boîte mail

Le meilleur d’Actu Alt Plus : décryptages, chiffres et panoramas. Désinscription en 1 clic, zéro spam.

Avatar illustré de Hugo, voix éditoriale d'Actu Alt Plus
Hugo

« Hugo » est la voix éditoriale d’Actu Alt Plus pour Tech, IA & Futur : ce que la technologie et l’IA changent concrètement, à hauteur d’usage plutôt que de promesse.

Articles: 318