Le coût d'inférence s'installe au centre de la pile IA avec l'arrivée de nouveaux moteurs
Magnitude, une startup Y Combinator S25, a publié son moteur d'inférence open source sur GitHub le 30 septembre. La société affirme que les modèles ouverts y tournent jusqu'à 2 fois plus vite que sur llama.cpp, à matériel égal.

Magnitude a mis son dépôt en ligne le 30 septembre à 17h37 UTC, selon la fiche GitHub. La promesse est étroite : un moteur d'inférence pour agents qui compile et ajuste les kernels sur la machine où il tourne. La société affirme obtenir jusqu'à 2 fois les performances de llama.cpp, avec un décodage 92% plus rapide sur le backend Metal d'Apple et 19% sur CUDA.
Le chiffre vient d'un benchmark de l'éditeur. Personne en dehors de Magnitude ne l'a encore reproduit. Le dépôt ne nomme ni les modèles, ni la longueur des prompts, ni la taille des lots derrière ces résultats. À traiter comme un argument marketing tant que personne d'indépendant ne l'a exécuté.
L'essentiel est ailleurs : là où l'entreprise vise. Magnitude dit livrer une application de bureau qui se connecte aux agents que les gens utilisent déjà, citant Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline. Tout le reste passe par une API compatible OpenAI. Le moteur tourne sur Apple Silicon, sur GPU NVIDIA ou AMD, ou sur un simple CPU, d'après le dépôt. Magnitude revendique aussi 27% de mémoire en moins par agent, libérée quand les agents s'arrêtent, et des sessions qui partagent les caches de préfixe pour éviter les ralentissements en concurrence.
La même semaine, une autre couche de la pile
Deux heures plus tard, le 30 septembre, une seconde publication est tombée. Full Stack Data Lab a mis en ligne un billet sur Quail, une couche d'inférence sensible aux requêtes construite avec Modal, et Modal a publié son propre texte à 17h38 UTC le même jour. Quail s'attaque à l'AI-SQL, cette pratique qui consiste à appeler des modèles de langue ligne par ligne depuis des requêtes SQL.
Les chiffres sont gros et le cadre est direct. Full Stack Data Lab explique qu'une seule requête peut générer des centaines de milliers ou des millions d'appels au modèle, parce qu'une fonction IA évalue un prompt par ligne, et qu'une jointure naïve évalue un prompt par paire de lignes. Sur une requête de référence appelée BIO-4, qui joint 5 000 comptes rendus médicaux à 4 144 termes de réaction, le laboratoire détaille le coût d'envoi de ces appels à un moteur généraliste comme vLLM sous forme de requêtes séparées.
Le billet de Modal rapporte le résultat : Quail traite plus d'un milliard de tokens par minute et par GPU H100 sur une requête à jointures multiples, plus de 10 fois plus vite que sa base vLLM sur le même matériel, à moins de 6 cents par milliard de tokens sur Modal. Sur un benchmark nouvellement publié, Modal annonce que Quail tourne 1,84 fois plus vite que vLLM, en moyenne géométrique sur les tâches. Modal signale que l'ensemble contient deux requêtes destinées à montrer là où l'inférence AI-SQL demande encore du travail.
Je le vois comme un point sur la courbe de Pareto des LLM, dans un régime où une forte demande latente s'est révélée (pas de réflexion, un seul token, latence faible pour une intelligence acceptable), sous-investi à cause de la course à plus d'intelligence. Karpathy-san, à propos de Jev
Cette citation figure dans le billet de Modal, attribuée à Karpathy, commentant le modèle Jev de TypeSafe AI. L'argument est qu'une grande part de la demande d'inférence se situe dans le bas de gamme, à faible latence, et qu'elle a été mal servie parce que les laboratoires couraient après la capacité de pointe. Magnitude et Quail parient tous deux sur cet écart.
Aucun des deux textes n'a été évalué par des pairs. Ce sont des billets d'entreprise accompagnant des publications de code, et les bases de comparaison, l'une contre llama.cpp, l'autre contre vLLM, sont choisies par leurs auteurs. La direction est cohérente, mais les ordres de grandeur ne sont pas acquis.
Ce que disent l'électricité et la liste de prix
Des travaux universitaires publiés cette semaine pointent un problème connexe que des tokens plus rapides ne règlent pas seuls. Un article présenté à SOSP '26, daté du 28 septembre et référencé dans les actes de l'ACM, soutient qu'optimiser des clusters GPU uniquement pour l'utilisation peut augmenter la consommation d'énergie. Ses auteurs, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar, décrivent un système appelé EnerTune. Celui-ci modélise analytiquement la performance et la puissance par modèle au lieu de profiler chaque configuration, puis répartit les modèles sur des GPU partagés en conséquence. Les auteurs rapportent une consommation d'énergie réduite de 1,4 à 2,3 fois et une puissance appelée réduite de 1,3 à 2,6 fois par rapport aux meilleures bases existantes, tout en atteignant les objectifs de performance.
Il y a ensuite le versant prix catalogue. AICostBudget a publié son indice tarifaire de septembre le 30 septembre, un instantané figé à la date limite du 2026-09-30 UTC, couvrant 81 enregistrements de prix publics chez 11 fournisseurs. Le prix d'entrée médian sur 69 enregistrements est de 1,32 dollar par million de tokens et le prix de sortie médian de 6 dollars par million, soit un rapport de 5,0 fois. C'est la tarification de sortie, pas l'ingestion du prompt, qui pèse le plus lourd en général.
Cet indice casse aussi un raccourci courant dans les discussions sur les coûts. Sur 58 enregistrements comparables d'entrée mise en cache, la remise médiane est de 90%. Sur 44 enregistrements de tarification par lots, la remise médiane est de 50%. Toute comparaison de charges de travail qui ignore la mise en cache et les tarifs par lots décrit une facture que la plupart des clients ne verront jamais, et l'indice le dit noir sur blanc. Côté fournisseurs, ses médianes vont de Mistral AI à 0,20 dollar en entrée et 0,60 dollar en sortie par million de tokens sur 7 enregistrements, et DeepSeek à 0,30 et 1,20 dollar sur 3, jusqu'à Anthropic à 5 et 25 dollars sur 13 enregistrements et OpenAI à 2 et 11 dollars sur 18. Ce sont des médianes de prix catalogue publics, pas des prix effectifs après remises, et les populations diffèrent en taille : ce n'est pas un classement des modèles à périmètre égal.
La vitesse n'est qu'un coût parmi d'autres
Hors des centres de données, la latence a un coût physique mesurable. MindOn a présenté son modèle d'IA physique Mind-1 le 30 septembre, affirmant réduire la latence d'inférence des robots de 82ms à 32ms et ramener les tâches de manipulation à des temps de cycle humains. L'explication de l'entreprise sur l'enjeu est la partie utile : à une vitesse d'effecteur de 3 mètres par seconde, 10ms de latence correspondent à environ 3cm de déplacement, de quoi rater une préhension ou une insertion précise. MindOn signale aussi un problème de données : une grande part des données de manipulation robotique vient de la téléopération, plus lente que le mouvement humain naturel, si bien que les modèles apprennent un tempo ralenti en même temps que la tâche.
Il y a une histoire de coût pour le consommateur dans la même fenêtre. CleanTechnica rapportait le 29 septembre qu'une analyse de Transport & Environment situe le coût d'usage d'un véhicule électrique à moins de la moitié de celui d'un diesel par kilomètre en Europe. L'analyse part d'une consommation moyenne de 6,9 litres aux 100km pour le diesel et de 20,2 kWh aux 100km pour l'électrique à batterie, avec l'électricité à 0,343 euro par kWh. Antony Froggatt, de T&E, déclarait dans le billet que les conducteurs diesel paient 32 euros de plus par plein qu'au début de l'année et avertissait d'un risque d'approvisionnement si les États-Unis bloquent les exportations de diesel. T&E précise que son estimation de recharge est probablement une borne haute.
Et la page de tarifs elle-même peut être un coût. Un témoignage publié le 30 septembre par Gokhan Kogan, revenant sur son passage chez Pinecone, rapporte qu'un calculateur d'usage sur la page de tarifs produisait des estimations surestimées jusqu'à 1 000 fois après une seule saisie mal interprétée. Dans un test A/B, écrit-il, les visiteurs qui ne voyaient pas le calculateur étaient 16% plus enclins à s'inscrire et 90% plus enclins à contacter l'entreprise, sans hausse des tickets de support sur la tarification. Il note aussi que 7 employés sur 10 interrogés en interne s'attendaient à ce que la version avec calculateur fasse mieux. C'est l'expérience d'une entreprise, pas une loi générale, mais cela rappelle que coût perçu et coût réel divergent facilement.
L'économie des capacités bouge aussi au niveau du réseau. Light Reading rapportait le 30 septembre que StarHub et M1 sont en discussions de fusion à Singapour, où ils partagent déjà le spectre 5G et le réseau d'accès radio via une société commune appelée Antina. Singtel détenait 43% du marché mobile en juin, avec M1 à 22%, StarHub à 21% et Simba à 14%, selon le rapport. En Nouvelle-Zélande, 2degrees et OneNZ ont proposé de combiner leurs réseaux radio, une décision de la Commerce Commission étant attendue l'an prochain.
Le fil conducteur n'est pas que l'inférence va devenir gratuite. C'est que les optimisations arrivées cette semaine visent des goulots précis : la vitesse de décodage des agents sur du matériel grand public, les appels SQL ligne par ligne et la puissance des GPU au repos. Chacune arrive avec son propre benchmark et son propre éditeur. L'indice tarifaire suggère que les prix catalogue eux-mêmes n'ont pas beaucoup bougé. Les économies se vendent au niveau du moteur, et les acheteurs devront les tester sur leurs propres charges de travail.
Sources
9- 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04AI API pricing index - September 2026EN
- 05Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 06The pricing calculator made people more confused about pricingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.