
3 centimes. C’est le coût moyen d’un test de référence pour DeepSeek V4-Flash, le modèle publié le 31 juillet 2026 par le laboratoire chinois, selon la firme d’analyse indépendante Artificial Analysis. Concrètement, ce chiffre ne dit pas ce que vous paierez. Il dit combien coûtent, en jetons facturés, les épreuves standardisées que la firme fait passer aux modèles. C’est un indice de comparaison, pas un prix de marché.
Ce que recouvre exactement « un test »
L’indice d’intelligence d’Artificial Analysis agrège neuf évaluations : GDPval-AA v2, tau-3 Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR. Le coût que la firme affiche pour faire tourner cette batterie complète sur DeepSeek V4-Flash en effort maximal n’est pas de 3 centimes : il est de 72,03 dollars, pour 210 millions de jetons produits en sortie. Les 3 centimes sont une moyenne par épreuve unitaire, pas le prix d’une campagne d’évaluation.
La seule source qui définit noir sur blanc son unité, c’est la page de résultats d’ARC Prize : 0,02 dollar par tâche sur ARC-AGI-1, où le modèle marque 89,0 %, et 0,04 dollar par tâche sur ARC-AGI-2, où il tombe à 61,4 %. La moyenne des deux fait bien 3 cents. Une tâche, ici, c’est une grille de raisonnement visuel à résoudre, pas une session de travail.
Pour rendre ces montants comparables à une facture française, nous avons converti chaque coût au taux de référence de la Banque centrale européenne du 7 août 2026, soit 1 euro pour 1,1535 dollar, puis nous avons calculé le rapport entre le prix et le score de qualité. Résultat : 2,6 centimes d’euro le test, et 62,44 euros la batterie complète.

Reprendre ce graphique
Réutilisez ce graphique librement sur votre site, en citant Actu Alt Plus. Copiez le code ci-dessous :
Le graphique se lit dans un seul sens : l’écart de prix entre le moins cher et le plus cher se compte en dizaines de fois, pas en pourcentages. Le tableau ci-dessous ajoute la colonne qui manque au débat, celle de la qualité mesurée.
| Modèle | Coût par test | Indice d’intelligence | Poids |
|---|---|---|---|
| DeepSeek V4-Flash | 0,03 $ (0,026 €) | 52 | Ouverts (MIT) |
| Kimi K3 | 0,86 $ (0,75 €) | 60 | Ouverts (licence sur mesure) |
| GPT-5.6 Sol | 1,86 $ (1,61 €) | 61 | Fermés |
| Claude Fable 5 | 3,15 $ (2,73 €) | 62 | Fermés |
Les coûts sont ceux rapportés par Quartz le 3 août 2026 d’après Artificial Analysis. Les indices sont relevés sur la fiche de la firme, pas sur les reprises de presse : The Next Web crédite par exemple DeepSeek de 50 points et ses concurrents d’environ 66, là où le classement d’Artificial Analysis affiche 52, 60, 61 et 62.
Pourquoi le coût par tâche s’effondre
Le tarif affiché explique une partie de l’écart : 0,14 dollar par million de jetons en entrée, 0,28 dollar en sortie, et surtout 0,003 dollar pour les jetons déjà vus, servis depuis le cache. Un jeton mis en cache coûte donc 47 fois moins cher qu’un jeton neuf. C’est ce ratio qui produit le prix mixte de 0,06 dollar par million communiqué par le laboratoire, calculé sur une répartition de 7 jetons en cache pour 2 en entrée et 1 en sortie. Autant dire une hypothèse d’usage très favorable.

Trois mécaniques s’additionnent derrière ce tarif. Les architectures à experts n’activent qu’une fraction des paramètres à chaque jeton, ce qui divise le calcul facturé. La quantification réduit la précision des poids et donc la mémoire mobilisée, au moment précis où cette mémoire coûte cher : nous vous racontions en juillet la pénurie de mémoire qui fait grimper les factures matérielles. Enfin, les poids ouverts sous licence MIT autorisent n’importe quel hébergeur à servir le modèle, ce qui écrase la marge d’inférence par la concurrence. Kimi K3 joue la même partition côté ouvert, avec une licence commerciale sur mesure.
Ce que la facture d’une entreprise regarde vraiment
Voilà la limite honnête. Claude Fable 5 coûte 105 fois plus par test que DeepSeek V4-Flash pour 10 points d’indice de plus, soit 19 % de qualité mesurée en plus. GPT-5.6 Sol coûte 62 fois plus pour 9 points. Kimi K3, 29 fois plus pour 8 points. Dit comme ça, l’arbitrage semble évident. Il ne l’est pas.
Parce qu’une facture d’entreprise ne se calcule pas au prix du jeton, mais au nombre de jetons consommés pour arriver au bon résultat. DeepSeek V4-Flash a produit 210 millions de jetons de sortie pour passer neuf évaluations : à 0,28 dollar le million, les seuls jetons de sortie pèsent environ 58,80 dollars sur les 72,03 dollars de la note. C’est un modèle de raisonnement, et un modèle de raisonnement est bavard. Un modèle deux fois moins cher au jeton qui en consomme trois fois plus pour la même tâche revient plus cher, et il vous a fait attendre.
Le bon test, si vous achetez de l’IA à l’usage, ne se trouve donc pas dans un classement. Prenez vos dix tâches les plus fréquentes, faites-les tourner sur deux modèles, comptez les jetons réellement facturés et les reprises nécessaires. L’indice d’Artificial Analysis vous dit qui est le moins cher à évaluer. Il ne vous dit pas qui est le moins cher à travailler avec vous.
Votre réaction :
Article créé en collaboration avec l’IA.
Les plus lus
- 1
2 millions d’acres brûlés : l’Oregon bat son record d’incendies avec deux mois de saison à venir - 2
Feux de forêt : 15 000 hectares brûlent en France chaque année (et 2026 déborde) - 3
1,86 million d’euros engagés, 400 000 à trouver : la cascade d’un festival annulé pour canicule - 4
20 £ pour entrer au Royaume-Uni : l’ETA obligatoire, où la demander sans se faire piéger - 5
88 km seule devant : le pari fou de Haugset qui rafle le jaune
Nos dossiers
- France493
- Santé211
- Science207
- Prévention199
- Culture185
- Consommation181
- Biodiversité171
- IA149
Recevez notre sélection dans votre boîte mail
Le meilleur d’Actu Alt Plus : décryptages, chiffres et panoramas. Désinscription en 1 clic, zéro spam.

