Les coûts d'inférence se coupent en deux : moins cher au token, plus cher au GPU
Magnitude, une startup Y Combinator S25, a publié le 30 septembre un moteur d'inférence open source qui, selon elle, fait tourner des modèles ouverts jusqu'à 2 fois plus vite que llama.cpp sur Apple Silicon, NVIDIA, AMD ou un simple CPU, sans coût au token. Le même jour, un indice de prix couvrant 81 relevés publics situait le prix de sortie médian affiché à 6 $ par million de tokens, contre 1,32 $ pour l'entrée.

Le dépôt de Magnitude a été mis en ligne le 30 septembre. Le principe est simple : le moteur compile et ajuste ses kernels sur votre appareil avant l'exécution d'un modèle, au lieu de livrer des binaires précompilés pour de grandes classes de matériel. L'entreprise annonce un décodage 92 % plus rapide sur Metal et 19 % sur CUDA face à llama.cpp, plus 27 % de mémoire en moins par agent, libérée quand les agents s'arrêtent. La licence est Apache 2.0.
C'est une réponse au problème de coût : arrêter de payer au token.
Ce n'est pas la seule, et ce n'est pas celle vers laquelle pointe le reste des publications de la semaine. Quail, un moteur d'inférence développé par l'équipe Full Stack Data Lab à l'origine de DocETL, vise l'autre moitié de la facture. Ses auteurs soutiennent que les requêtes AI-SQL, où un appel de LLM s'exécute par ligne ou par paire de lignes, sont mal servies par les moteurs généralistes. Envoyer des millions d'appels liés au modèle vers vLLM sous forme de requêtes séparées coûte cher, écrivent-ils. Quail planifie au contraire la requête et l'inférence ensemble.
Les chiffres sont précis. Sur une requête à jointures multiples, où la planification compte le plus, Quail dépasse le milliard de tokens traités par minute sur un seul GPU H100. L'équipe y voit plus de 10 fois sa référence vLLM sur le même matériel. Sur Modal, cela revient à moins de 6 cents par milliard de tokens. Sur le benchmark AI-SQL de l'équipe, le gain est plus faible : 1,84 fois plus rapide que vLLM, en moyenne géométrique, y compris deux requêtes conçues pour montrer où l'inférence AI-SQL reste à la traîne.
Les prix au token ne font pas toute la facture
L'indice de septembre d'AICostBudget, arrêté à la date limite du 30 septembre UTC, couvre 81 relevés de prix publics chez 11 fournisseurs. Sur les 69 relevés dotés d'un tarif courant à l'entrée, l'éventail va de 0,10 $ à 30 $ par million de tokens. La sortie va de 0,10 $ à 180 $. Le prix d'entrée médian est de 1,32 $ et le prix de sortie médian de 6 $, soit un rapport de 5,0 fois sur les 69 relevés qui portent les deux.
Les médianes par fournisseur divergent nettement. Les 18 relevés d'entrée et 18 de sortie d'OpenAI ont pour médianes 2 $ et 11 $. Google Gemini, sur 14 de chaque, affiche 0,75 $ et 4 125 $. Les 13 relevés d'Anthropic sont à 5 $ et 25 $. Les neuf de xAI à 1,25 $ et 2,50 $, les sept de Mistral à 0,20 $ et 0,60 $, les trois de DeepSeek à 0,30 $ et 1,20 $.
L'indice signale aussi ce qu'une comparaison naïve laisse échapper. Sur 58 relevés comparables, la remise médiane sur l'entrée mise en cache est de 90 %, et sur 44 relevés compatibles Batch, la remise médiane sur l'entrée Batch est de 50 %. Le rapport le dit sans détour : une comparaison de charges de travail qui ignore la tarification du cache et du Batch omet des modes d'économie publiés pour une large part des relevés suivis. Il ajoute que les pages de documents, le stockage, la durée de session et les autres unités fondées sur le temps ne peuvent pas être aplatis sans risque dans un tableau de tokens seuls. L'avertissement vaut pour qui veut bâtir un classement unique du coût par token.
Les données de prix sont un instantané, pas un prix d'équilibre du marché. La capacité GPU évolue de son côté.
Où va l'argent des GPU
Business Insider a rapporté le 30 septembre qu'OpenAI avait annoncé lors de son DevDay de mardi une offre ChatGPT à 500 $ par mois, soit 300 $ de plus que son précédent forfait le plus cher. L'offre inclut un calcul « Ultrafast » pour GPT-6 Astra dans ChatGPT Work et Codex, qu'OpenAI présente comme un gain de vitesse de 8 fois dans Codex, ainsi que l'usage inclus le plus élevé de l'entreprise. Business Insider rapporte aussi qu'OpenAI rouvre son forfait Pro à 200 $ tout en divisant par deux l'allocation de calcul, de 20 fois le forfait Plus à 20 $ à 10 fois, et en ramenant les messages GPT-6 Pro de 200 à 100 par semaine. Thibault Sottiaux, responsable de l'ingénierie pour Codex, a déclaré dans un message X de lundi que ces changements reviennent à la moitié des dépenses API en dollars par rapport au forfait précédent.
Côté matériel, l'article SOSP '26 de Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar, publié le 28 septembre, avance un argument qui va contre la métrique d'utilisation habituelle. Les GPU coûtent cher, et pourtant les clusters d'inférence restent largement sous-utilisés, ce qui pousse les systèmes au multiplexage. Mais optimiser uniquement l'utilisation peut, contre toute attente, augmenter la consommation d'énergie, écrivent les auteurs. Leur système, EnerTune, s'appuie sur des modèles analytiques de performance et de puissance par modèle, y compris la consommation des modèles colocalisés sur des GPU partagés, au sein d'un algorithme de bin-packing sensible à l'énergie. Il annonce une consommation d'énergie de 1,4 à 2,3 fois inférieure et une puissance appelée de 1,3 à 2,6 fois inférieure aux références de l'état de l'art, tout en respectant les SLO de performance.
Voilà une affirmation de coût sur une facture que la plupart des tableaux de prix au token ne montrent pas.
La robotique joue la même partition dans un autre décor. Mind-1 de MindOn, annoncé le 30 septembre, fait passer la latence d'inférence de 82 ms à 32 ms, selon la propre note de l'entreprise. Le billet explique pourquoi cela compte : à une vitesse de 3 m/s en bout d'effecteur, 10 ms de latence correspondent à environ 3 cm de déplacement, de quoi affecter une préhension précise, une insertion ou une manipulation riche en contacts. MindOn pointe aussi le tempo des données d'entraînement. Les démonstrations téléopérées sont plus lentes que le mouvement humain naturel, et les modèles apprennent le tempo autant que la tâche.
Deux factures, deux stratégies
L'expérience de Pinecone avec un calculateur de prix, racontée par Gabriel Kogan le 30 septembre, rappelle que le chiffre de coût vu par le client est lui-même une décision produit. Le calculateur produisait des estimations surestimées jusqu'à 1 000 fois après une erreur d'interprétation, et donnait aux utilisateurs une fausse assurance qui les dissuadait de vérifier la documentation. Quand l'entreprise a testé en A/B sa suppression, les visiteurs qui ne voyaient pas le calculateur étaient 16 % plus susceptibles de s'inscrire et 90 % plus susceptibles de contacter l'entreprise, sans hausse des tickets de support sur les prix. Dans un sondage interne, 7 employés sur 10 s'attendaient à ce que la version avec calculateur fasse mieux.
Deux autres points de données sortent de la pile IA mais cadrent le même raisonnement sur la substitution du capital au carburant. Transport & Environment, analysé par CleanTechnica le 29 septembre, affirme que les conducteurs de véhicules électriques paient moins de la moitié de ce que paient les conducteurs diesel au kilomètre. Le calcul repose sur 6,9 L/100 km pour le diesel, 20,2 kWh/100 km pour l'électrique à batterie et un prix de l'électricité de 0,343 €/kWh. Antony Froggatt, du groupe, indique que les conducteurs diesel paient 32 € de plus par plein qu'au début de l'année, dont environ 16 € de marge de raffinage supplémentaire.
Light Reading a rapporté le 30 septembre que StarHub et M1 sont en discussions de fusion à Singapour, l'entité combinée atteignant à peu près l'échelle de Singtel, et que les néo-zélandais 2degrees et OneNZ ont proposé de combiner leurs réseaux radio. L'accord 5G entre China Telecom et China Unicom, le plus grand partage de ce type, couvre 1 500 000 stations de base et revendique 56 000 000 000 $ d'économies d'investissement. Rien de tout cela n'est de l'inférence IA. Tout cela relève du même échange : partager l'actif fixe, réduire le coût marginal.
Pour les acheteurs, la séparation est désormais claire. Les prix au token baissent dans les tableaux publiés, et la mise en cache comme les modes Batch les réduisent encore. Les coûts par heure de GPU relèvent d'un autre marché, et les travaux de cette semaine suggèrent qu'une grande partie est encore gaspillée. Ni les kernels locaux de Magnitude ni le planificateur de requêtes de Quail n'y remédient. Ils déplacent seulement l'endroit où se trouve le compteur.
Sources
10- 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 04AI API pricing index - September 2026EN
- 05ChatGPT's new plan costs $500 a monthEN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 08The pricing calculator made people more confused about pricingEN
- 09Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 10Singapore, New Zealand operators seek partnerships to cut costsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.