Les outils de calcul du coût d'inférence se multiplient, les prix des GPU restent opaques
Un calculateur en ligne publié le 23 septembre compare le coût d'inférence de 27 modèles. Son auteur prévient : le résultat est une estimation de planification, pas un devis fournisseur. Quelques jours plus tard, un autre benchmark a mis sous les projecteurs le coût d'une heure d'exécution d'un seul modèle.

La dernière pièce du débat sur le coût d'inférence n'est pas une annonce tarifaire. C'est un calculateur. Flavio Copes a publié le 23 septembre un Inference Cost Calculator qui classe 27 modèles d'OpenAI, Anthropic, Google, xAI, Mistral, OpenRouter et Workers AI sur des hypothèses identiques.
On y saisit le nombre d'utilisateurs actifs par jour, les appels par utilisateur, les tokens d'entrée et de sortie par appel, et un taux de succès du cache de prompt en option. L'outil renvoie une facture mensuelle. Il précise aussi que les chiffres viennent des tarifs API publiés. Ils ignorent les tarifs batch, les remises entreprise, les surcoûts liés aux images ou aux outils, et toute couche de cache développée en interne.
Cette réserve compte plus que le classement.
Le benchmark qui chiffre une heure de réflexion
Le 26 septembre, StarSkirmish a publié un autre type de comparaison de coûts. Le benchmark donne à chaque LLM une heure pour écrire un bot Protoss en C++ pour StarCraft: Brood War, puis fait s'affronter les bots entre eux et contre des adversaires écrits par des humains. Le plateau réunit 50 bots LLM issus de 10 modèles, plus 3 bots de démonstration et 9 bots compétitifs écrits par des humains, soit 62 participants, exécutés sur des sandboxes Prime Intellect.
GPT-6 Astra et Claude Opus 5.5 sont à égalité de fait en tête, selon le compte rendu du projet. GPT-6 Sol se détache nettement du reste à leurs côtés. Le benchmark trace aussi le score en fonction du coût API moyen d'une exécution d'une heure sur une échelle logarithmique. Il indique que GPT-6 Sol offre un rapport qualité-prix unique dans cette comparaison.
C'est une lecture coût par capacité, pas coût par token. Elle admet une limite : les auteurs disent que les modèles de raisonnement de pointe tirent désormais un bénéfice significatif de périodes de raisonnement supérieures à une heure, et que des versions à exécution plus longue sont prévues.
Pourquoi les chiffres publics sont difficiles à croire
Aucune de ces deux sources ne donne un prix de GPU. Pour cela, le dossier dispose d'une enquête publiée le 20 septembre par Nexlab, qui compare des orchestrateurs auto-hébergés dont LocalAI, exo, GPUStack, vLLM, Ollama, Xinference et CoderAI. Ses compteurs d'étoiles ont été relevés via l'API GitHub le 20 septembre. L'auteur écrit clairement que lorsqu'une fonction n'a pas pu être confirmée, le tableau le signale au lieu de deviner.
Les distinctions utiles de cette enquête ne portent pas du tout sur le prix. Elle sépare le cas où un modèle peut s'étendre sur plusieurs machines, celui où un tour suivant est routé vers l'endroit où se trouvent déjà son cache KV ou de préfixe, et celui où le serveur peut louer un GPU tout seul. vLLM, à 92 000 étoiles dans cet instantané, prend en charge le parallélisme tensoriel et de pipeline via Ray et la mise en cache de préfixe par instance. Ollama, à 181 000 étoiles, se limite à une machine et à un modèle à la fois. Il n'a pas d'histoire de cluster au-delà d'une répartition en tourniquet de plusieurs URL derrière Open WebUI.
Le matériel, pas le logiciel, est là où passe l'argent. Le marché photovoltaïque brésilien n'est pas un sujet d'IA, mais pv magazine rapportait le 26 septembre que les prix moyens des systèmes PV dans le pays ont augmenté de 7 % entre janvier et juin 2026 pour les projets jusqu'à 300 kW, selon l'étude Distributed Energy Solutions de Greener. Le coût des kits pour les systèmes de 4 kW a grimpé de 18,3 %, de 1,42 BRL/W à 1,68 BRL/W.
Matière première différente, même problème : le chiffre en tête bouge parce que les composants bougent.
Ce que la recherche dit du côté de la production
Une dernière pièce du tableau des coûts se situe du côté de la demande. Un article soumis à arXiv le 14 septembre et révisé le 17 septembre, SlopShape, décrit un instrument à 214 caractéristiques qui détecte les contenus web commerciaux générés par IA à partir de leurs seules signatures structurelles. Appliqué par un LLM et validé contre une annotation humaine, il atteint 98,0 de macro-F1 sur des entreprises mises de côté, et 98,1 lorsque chaque publication IA a été reformulée par son propre modèle. L'auteur est Jochen Madler, de Sitefire.
Une inférence moins chère produit plus de texte. Détecter ce texte est désormais une tâche mesurable avec une précision publiée, ce qui constitue en soi un coût d'infrastructure.
Aucune de ces sources ne s'accorde sur ce que devrait coûter l'inférence, parce qu'aucune ne mesure la même chose. Le calculateur mesure une facture hypothétique. Le benchmark mesure la capacité par heure de dépense API. L'enquête sur les orchestrateurs mesure des fonctions, pas des factures. Prenez chaque chiffre isolé comme une hypothèse de départ.
Sources
5- 01Inference Cost CalculatorEN
- 02StarSkirmish BenchEN
- 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN
- 04PV system costs increase by 7% in Brazil in H1EN
- 05SlopShape: Identifying AI-Generated Commercial Web ContentEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.