Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

ChatGPT à 500 dollars par mois : OpenAI lance son offre quelques jours après un prix médian de 1,32 dollar en entrée

OpenAI a annoncé mardi, lors de son DevDay, un abonnement ChatGPT à 500 dollars par mois. La même semaine, un relevé de fin de mois fixait le prix catalogue médian du million de tokens en entrée à 1,32 dollar sur 81 enregistrements publics.

IA & modèlesAnalyseSophie LeclercPublié le: 30 septembre 20265 min de lectureSources 9
ChatGPT à 500 dollars par mois : OpenAI lance son offre quelques jours après un prix médian de 1,32 dollar en entrée

OpenAI a profité de son DevDay, mardi, pour annoncer une nouvelle formule haut de gamme, Pro 500, à 500 dollars par mois, rapporte Business Insider. C'est 300 dollars de plus que la précédente offre la plus chère de l'entreprise. Sur un an, cela représente 6 000 dollars pour un seul poste.

La formule donne accès à ce qu'OpenAI appelle le calcul « Ultrafast » pour GPT-6 Astra dans ChatGPT Work et Codex. Selon Business Insider, l'option promet un gain de vitesse de 8x dans Codex et offre le quota d'utilisation le plus élevé de la société. Le même article indique qu'OpenAI rouvre son ancienne formule Pro à 200 dollars par mois, suspendue le 10 septembre, mais divise par deux son allocation de calcul. Celle-ci passe à 10x la formule Plus à 20 dollars, contre 20x auparavant, et les messages hebdomadaires dans GPT-6 Pro tombent de 200 à 100.

Thibault Sottiaux, responsable de l'ingénierie de Codex chez OpenAI, a écrit lundi sur X que ces changements reviennent à la moitié de la dépense API en dollars par rapport à la formule précédente. Business Insider le cite directement. Aucun autre média de ce dossier ne confirme ces détails tarifaires, et OpenAI n'a pas publié de liste de prix publique que cet article pourrait vérifier de façon indépendante.

Le calendrier compte. Un relevé de septembre des tarifs API publiés montre que le plancher des prix catalogue est très loin de 500 dollars par mois pour la plupart des charges de travail. L'AI API Pricing Index d'AICostBudget, figé à la date limite du 2026-09-30 UTC, couvre 81 enregistrements tarifaires publics chez 11 fournisseurs. Sur les 69 enregistrements disposant d'un barème actuel pour les tokens d'entrée, l'écart observé va de 0,10 à 30 dollars par million de tokens. Pour les tokens de sortie, sur ces mêmes 69 enregistrements, il va de 0,10 à 180 dollars par million.

Remises, cache et prix affiché

Les médianes mises en avant par l'index sont de 1,32 dollar par million de tokens en entrée et de 6 dollars par million en sortie, soit un rapport médian sortie/entrée de 5,0x. Ce sont des prix catalogue, et l'index précise clairement que la plupart des acheteurs ne paient pas ce prix. Sur 58 enregistrements comparables, la remise observée sur l'entrée mise en cache va de 75 % à 98 %, avec une médiane de 90 %. Sur 44 enregistrements compatibles avec le mode Batch, la remise observée sur l'entrée en batch va de 20 % à 50 %, avec une médiane de 50 %.

Cet écart résume l'argument des projets de moteurs d'inférence et d'optimisation de requêtes apparus la semaine dernière. Si une charge de travail peut déplacer ses préfixes répétés vers le cache et ses gros traitements vers le batch, le prix effectif par token tombe bien en dessous de la médiane. Sinon, c'est le prix catalogue qui s'applique.

Deux projets publiés le 30 septembre attaquent le problème par les deux bouts de la pile. Côté base de données, les travaux QUAIL du Full Stack Data Lab, mis en ligne le 30 septembre, optimisent conjointement la planification des requêtes SQL et l'inférence LLM. Leur requête de référence BIO-4 porte sur plus de 5 000 longs comptes rendus médicaux et 4 144 termes de réaction, la liste de réactions servant deux fois dans deux jointures. Les auteurs soutiennent qu'envoyer des millions d'appels de modèle liés à un moteur généraliste comme vLLM sous forme de requêtes séparées coûte cher, car chaque prompt est rendu et servi comme une requête d'inférence indépendante.

La note de Modal sur le même système, également datée du 30 septembre, chiffre la chose. Quail traite plus d'un milliard de tokens par minute et par GPU H100 sur une requête à jointures multiples. Modal présente ce résultat comme plus de 10x plus rapide que sa référence vLLM sur un matériel identique, pour moins de 6 cents par milliard de tokens chez Modal. Sur le nouveau benchmark AI-SQL, Modal annonce Quail à 1,84x plus rapide que vLLM, en moyenne géométrique sur les tâches, dont deux requêtes conçues par les auteurs pour montrer là où l'inférence AI-SQL demande encore du travail.

La moyenne géométrique de 1,84x et le chiffre de 10x sur une seule requête viennent de la même équipe et ne doivent pas être lus comme une même mesure.

Kernels locaux et latence des robots

Côté client, Magnitude, société du Y Combinator S25, a lancé le 30 septembre un moteur d'inférence open source qui compile et ajuste ses kernels sur l'appareil de l'utilisateur avant l'exécution d'un modèle. Son README GitHub affirme que les modèles ouverts tournent jusqu'à 2x plus vite que llama.cpp, avec un décodage 92 % plus rapide sur Metal et 19 % sur CUDA, et 27 % de mémoire en moins par agent. Il prend en charge Apple Silicon, NVIDIA, AMD ou le CPU seul. Ces chiffres viennent du projet lui-même et n'ont pas été reproduits de façon indépendante dans ce dossier.

L'inférence robotique court après le même chronomètre. MindOn a présenté Mind-1 le 30 septembre, en affirmant réduire la latence d'inférence des robots de 82 ms à 32 ms. La société note qu'à une vitesse de 3 m/s en bout d'effecteur, 10 ms de latence correspondent à environ 3 cm de déplacement, de quoi affecter une saisie précise, une insertion ou une manipulation riche en contacts. Ses chiffres de vitesse couvrent la logistique et les environnements humains du quotidien et proviennent des propres tests de MindOn.

Des travaux académiques pointent un coût que les métriques d'utilisation masquent. Un article présenté à SOSP '26 le 28 septembre par Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar décrit EnerTune, un système de service qui modélise la puissance de chaque modèle et la consommation des modèles colocalisés sur des GPU partagés. Les auteurs rapportent des réductions d'énergie de 1,4x à 2,3x et des réductions de puissance appelée de 1,3x à 2,6x par rapport aux meilleures références, tout en respectant les SLO de performance. Leur thèse : optimiser uniquement l'utilisation peut faire grimper la consommation d'énergie, et profiler chaque configuration à grande échelle coûte trop d'énergie pour être praticable.

L'endroit où l'argent atterrit réellement reste contesté. Light Reading rapportait le 30 septembre que StarHub et M1 discutent d'une fusion à Singapour, et que 2degrees et OneNZ en Nouvelle-Zélande ont proposé de combiner leurs réseaux radio. StarHub prévient que les négociations se poursuivent. Light Reading note qu'un ensemble StarHub et M1 atteindrait à peu près l'échelle de Singtel, et que Singtel détenait selon les informations disponibles 43 % de part mobile en juin, contre 22 % pour M1, 21 % pour StarHub et 14 % pour Simba.

Une leçon tarifaire de la même semaine n'a rien à voir avec les GPU. Pinecone a retiré son calculateur de prix après avoir constaté qu'une seule saisie mal interprétée pouvait gonfler une estimation jusqu'à 1 000x, selon un témoignage à la première personne de Gkogan publié le 30 septembre. Les visiteurs qui n'ont pas vu le calculateur étaient 16 % plus nombreux à s'inscrire et 90 % plus nombreux à contacter l'entreprise, sans hausse des tickets de support tarifaire. Sept employés sur dix s'attendaient à ce que la version avec calculateur l'emporte.

Commentaires 0

Sources

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02AI API Pricing Index - September 2026EN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  6. 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
  7. 07Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09The pricing calculator made people more confused about pricingEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.