Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Coûts d'inférence : une offre ChatGPT à 500 $, des moteurs ouverts deux fois plus rapides, 6 cents par milliard de tokens

OpenAI a ouvert le 29 septembre une offre ChatGPT Pro à 500 $ par mois, son forfait le plus cher à ce jour et 300 $ de plus que le précédent haut de gamme, rapporte Business Insider. En face, des moteurs d'inférence ouverts et moins chers cassent les prix.

IA & modèlesActualitéCamille RousseauPublié le: 30 septembre 20265 min de lectureSources 9
Coûts d'inférence : une offre ChatGPT à 500 $, des moteurs ouverts deux fois plus rapides, 6 cents par milliard de tokens

Le nouveau forfait a été annoncé lors du DevDay de mardi. Il donne accès au calcul « Ultrafast » pour GPT-6 Astra dans ChatGPT Work et Codex. Business Insider rapporte qu'un gain de vitesse de 8x est promis pour ce mode dans Codex. Le même article indique qu'OpenAI rouvre son offre Pro à 200 $ par mois, suspendue le 10 septembre. L'allocation de calcul est toutefois divisée par deux : 10x le forfait Plus à 20 $ au lieu de 20x. Les messages de chat GPT-6 Pro passent de 200 à 100 par semaine.

Thibault Sottiaux, responsable de l'ingénierie chez Codex, a écrit lundi dans un message sur X que ces changements reviennent à la moitié des dépenses API en dollars par rapport au forfait précédent, selon Business Insider.

« Je voulais partager ce changement à l'avance pour que vous puissiez tous le comprendre avant qu'on vous inonde de bonnes nouvelles », a-t-il écrit.

Voilà pour le haut du marché. En bas, ça bouge plus vite.

Moteurs ouverts et noyaux auto-ajustés

Le 30 septembre, Magnitude, soutenu par YC, a publié un moteur d'inférence open source. Il compile et ajuste les noyaux sur le matériel de l'utilisateur avant l'exécution d'un modèle. La société affirme que les modèles ouverts tournent jusqu'à 2x plus vite que llama.cpp. Le README GitHub indique un décodage 92 % plus rapide sur le backend Metal d'Apple Silicon et de 19 % sur CUDA, plus 27 % de mémoire en moins par agent et des caches de préfixe partagés pour les sessions concurrentes.

Le moteur est distribué comme application de bureau sous Apache 2.0. Il prend en charge Apple Silicon, NVIDIA, AMD ou CPU seul, et se connecte à Pi, OpenCode, Hermes, Codex et d'autres agents. Deux heures plus tôt, Modal et le Full Stack Data Lab ont publié un moteur conjoint SQL et inférence appelé Quail. La note de Modal affirme que Quail dépasse le milliard de tokens traités par minute sur un seul GPU H100 pour une requête à jointures multiples. C'est plus de 10x sa référence vLLM sur le même matériel, à moins de 6 cents par milliard de tokens sur Modal. Sur le nouveau benchmark AI-SQL de l'équipe, le gain moyen géométrique par rapport à vLLM est de 1,84x. L'article cite deux requêtes conçues pour montrer où l'approche reste en retrait.

Les auteurs disent clairement que les moteurs génériques ne sont pas adaptés à cette charge de travail. Dans l'article du Full Stack Data Lab, Shreya Shankar, Charles Frye, Fergus Finn, Arnav Dhariya, Joseph Barrow et Meryem Arik écrivent qu'envoyer des millions d'appels de modèle liés à un moteur comme vLLM sous forme de requêtes séparées coûte cher. Leur requête d'exemple, BIO-4 dans le benchmark QUAIL-B, filtre 5 000 longs rapports médicaux contre 4 144 termes de réaction utilisés deux fois. Une exécution naïve transforme donc une instruction SQL en un très grand nombre d'appels de modèle.

Le plancher de prix est publié, et il n'est pas uniforme

L'indice de prix de septembre d'AICostBudget, figé à la coupure UTC du 2026-09-30, couvre 81 enregistrements publics chez 11 fournisseurs. Il situe le prix médian des entrées à 1,32 $ par million de tokens et celui des sorties à 6 $. La sortie est facturée 5,0x l'entrée à la médiane sur les 69 enregistrements qui portent les deux chiffres. Les plages observées vont de 0,10 $ à 30 $ par million de tokens en entrée et de 0,10 $ à 180 $ par million de tokens en sortie.

Le même jeu de données donne les médianes par fournisseur. OpenAI : 2 $ en entrée et 11 $ en sortie sur 18 enregistrements. Google Gemini : 0,75 $ et 4,125 $ sur 14. Anthropic : 5 $ et 25 $ sur 13. xAI : 1,25 $ et 2,5 $ sur neuf. Mistral AI : 0,20 $ et 0,60 $ sur sept. DeepSeek : 0,30 $ et 1,2 $ sur trois. Moonshot AI : 0,95 $ et 4 $ sur trois. Sur 58 enregistrements comparables avec entrée en cache, la remise médiane est de 90 %. Sur 44 enregistrements facturés par lots, la remise médiane par lots est de 50 %. Une comparaison qui ignore l'un ou l'autre mode compare des prix catalogue, pas des factures.

Le matériel est le terrain où le débat se tranche le moins facilement. EnerTune, un article de Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar présenté à SOSP '26 le 28 septembre, soutient que multiplexer des GPU uniquement pour augmenter l'utilisation peut faire grimper la consommation d'énergie. Les auteurs rapportent que leur système de bin-packing sensible à l'énergie respecte les SLO de performance. Il réduit la consommation d'énergie de 1,4 à 2,3x et la puissance appelée de 1,3 à 2,6x par rapport aux références de l'état de l'art.

Toute l'actualité des coûts de la semaine ne concerne pas les centres de données. Des données de Transport & Environment analysées le 29 septembre situent le coût d'usage d'un véhicule électrique à moins de la moitié de celui d'un diesel au kilomètre. La base : 6,9 litres aux 100 km pour le diesel et 20,2 kWh aux 100 km pour l'électrique à batterie, avec un prix de l'électricité de 0,343 EUR par kWh. Les conducteurs diesel paient 32 EUR de plus par réservoir de 50 litres qu'au début de l'année, dont environ 16 EUR de marge de raffinage supplémentaire, selon les estimations de la BCE citées par CleanTechnica.

Deux leçons de la semaine n'ont rien à voir avec l'IA. Pinecone a retiré le calculateur de prix de sa page tarifaire après un test A/B. Les visiteurs qui ne le voyaient pas étaient 16 % plus susceptibles de s'inscrire et 90 % plus susceptibles de contacter l'entreprise, sans hausse des tickets de support sur les prix, selon le fondateur Greg Kogan. Dans les télécoms, Light Reading rapportait le 30 septembre que StarHub et M1 de Singapour discutent d'une fusion, tandis que 2degrees et OneNZ de Nouvelle-Zélande ont proposé de combiner leurs réseaux d'accès radio.

Le fil conducteur : quand une unité de travail devient assez bon marché, les acheteurs cessent de lire le calculateur et se mettent à mesurer la facture.

Commentaires 0

Sources

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05AI API pricing index - September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08The pricing calculator made people more confused about pricingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.