Quail revendique un milliard de tokens par minute sur un seul GPU, le débat sur le coût d'inférence s'aiguise
Un groupe de recherche affirme que sa couche d'inférence sensible aux requêtes a traité plus d'un milliard de tokens par minute sur un seul GPU Nvidia H100, plus de 10 fois plus vite qu'une base vLLM. Objectif : réduire le coût d'exploitation des grands modèles de langage à grande échelle. L'annonce a été publiée le 30 septembre, le jour même où OpenAI a présenté une offre ChatGPT à 500 dollars par mois et où un moteur open source promettait une inférence locale 2 fois plus rapide.

Les chiffres viennent du Full Stack Data Lab et de Modal, qui ont publié séparément le 30 septembre des articles sur un système nommé Quail, pour QUery-Aware Inference Layer. Le blog de Modal indique que sur une requête à jointures multiples, Quail a dépassé le milliard de tokens traités par minute et par GPU H100. C'est, selon l'entreprise, plus de 10 fois plus rapide que sa base vLLM sur le même matériel. Sur Modal, cela revient à moins de 6 cents par milliard de tokens.
Les deux articles décrivent le même projet sous des angles différents. Le billet du Full Stack Data Lab, daté du 24 septembre mais mis en ligne le 30 septembre, expose le problème. AI-SQL étend SQL avec des fonctions qui appellent des modèles ligne par ligne. Un filtre peut donc signifier un appel de modèle par ligne, et une jointure un appel pour chaque paire de lignes. La requête de référence du laboratoire, BIO-4 dans une suite appelée QUAIL-B, porte sur plus de 5 000 comptes rendus médicaux et 4 144 termes de réaction.
Petits modèles, volumes énormes
L'article de Modal présente AI-SQL comme un parent plus discret de l'essor des agents et des chatbots. Sa requête d'exemple joint clients et produits avec un prompt demandant si l'un pourrait acheter l'autre. Une telle requête, écrit Modal, peut produire des millions de séquences de milliers de tokens, et ces séquences demandent souvent moins qu'une intelligence de pointe. Des petits modèles à poids ouverts suffisent. Le goulot d'étranglement n'est pas la qualité du modèle, selon Modal. C'est le coût de livrer des millions de requêtes liées à un moteur conçu pour du trafic utilisateur arbitraire.
L'approche de Quail consiste à planifier ensemble la requête SQL et la charge d'inférence, au lieu de traiter le moteur comme un point d'accès générique. Modal annonce une accélération en moyenne géométrique de 1,84 fois par rapport à vLLM sur son nouveau benchmark AI-SQL. C'est un chiffre bien plus modeste que le cas vedette du milliard de tokens par minute. L'entreprise précise que deux requêtes du benchmark ont été conçues pour révéler des points à améliorer.
« Je le vois comme un point sur la courbe de Pareto des LLM, dans un régime où une forte demande latente s'est révélée (pas de réflexion, un seul token, une intelligence acceptable à faible latence) et qui a été sous-investi à cause de la course à une intelligence supérieure. »
Modal attribue cette citation à Karpathy, à propos du modèle Jev de TypeSafe AI. Le même article note que de nombreux éditeurs de bases de données proposent désormais des fonctions d'IA. La liste comprend Snowflake Cortex AISQL, les fonctions AI de BigQuery, Databricks AI Functions et, récemment, MotherDuck.
Les systèmes académiques s'attaquent au même gaspillage. Le Full Stack Data Lab cite DocETL de UC Berkeley, LOTUS de Stanford, Palimpzest du MIT et ThalamusDB de Cornell. Il nomme aussi des techniques comme MOAR, Task Cascades, Abacus et BARGAIN, qui réduisent le nombre d'appels ou choisissent des modèles moins chers. Même dans ce cas, écrit le laboratoire, un plan peut encore nécessiter des centaines de milliers ou des millions d'appels.
Liste de prix contre structure de prix
Pendant que Quail s'attaque au coût d'une requête, un instantané indépendant publié le 30 septembre suit ce que facturent les fournisseurs. L'AICostBudget AI API Pricing Index couvre 81 enregistrements publics figés chez 11 fournisseurs, avec une date d'arrêté au 2026-09-30 UTC. Sur 69 enregistrements avec un tarif d'entrée scalaire, l'écart observé va de 0,10 à 30 dollars par million de tokens. Les prix de sortie s'étendent de 0,10 à 180 dollars. Le prix d'entrée médian est de 1,32 dollar et le prix de sortie médian de 6 dollars, soit un rapport de 5,0 fois.
L'indice souligne un point qui compte pour quiconque modélise des dépenses d'inférence : les tarifs de cache et de lot ne sont pas des erreurs d'arrondi. Sur 58 enregistrements comparables, la remise médiane sur l'entrée mise en cache est de 90 %. Sur 44 enregistrements compatibles avec le traitement par lots, la remise médiane est de 50 %. Une comparaison de charges de travail qui ignore les deux, selon le rapport, omet des modes d'économie publiés pour une grande part des enregistrements suivis. Les médianes par fournisseur dans l'instantané incluent OpenAI à 2 dollars en entrée et 11 dollars en sortie sur 18 enregistrements, Google Gemini à 0,75 et 4,125 dollars sur 14, et Anthropic à 5 et 25 dollars sur 13. Mistral AI, DeepSeek, Cohere et Moonshot AI figurent aussi.
Les prix pour l'utilisateur final ont évolué en sens inverse le même jour. Business Insider a rapporté qu'OpenAI a annoncé un nouveau palier Pro 500 lors de son DevDay mardi, à 500 dollars par mois, soit une hausse de 300 dollars par rapport à l'offre haut de gamme précédente. Il donne accès à l'informatique « Ultrafast » pour GPT-6 Astra dans ChatGPT Work et Codex, avec une promesse de vitesse 8 fois supérieure pour Codex. OpenAI a aussi rouvert son offre Pro à 200 dollars tout en divisant par deux son allocation de calcul, ramenée à 10 fois l'offre Plus à 20 dollars, contre 20 fois auparavant. L'entreprise a réduit de 200 à 100 le nombre hebdomadaire de messages GPT-6 Pro. Thibault Sottiaux, responsable de l'ingénierie pour Codex, a déclaré dans un message publié lundi sur X que ces changements se traduisent au final par la moitié des dépenses en dollars dans l'API par rapport à l'offre précédente.
Du côté du matériel, le tableau est plus confus. Un message de lancement sur GitHub pour Magnitude, une entreprise du YC S25, affirme que son moteur open source ajuste les kernels sur l'appareil de l'utilisateur et exécute des modèles ouverts jusqu'à 2 fois plus vite que llama.cpp. Il cite un décodage 92 % plus rapide sur Metal et 19 % sur CUDA, plus 27 % de mémoire en moins par agent. Ce sont des benchmarks de fournisseur, pas des tests indépendants, et le message ne fournit aucune vérification tierce.
Par ailleurs, l'article SOSP '26 « Beyond Utilization » de Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar soutient qu'optimiser les clusters GPU uniquement pour l'utilisation peut augmenter la consommation d'énergie. Il présente un système appelé EnerTune qui, selon ses auteurs, réduit l'énergie de 1,4 à 2,3 fois et la puissance appelée de 1,3 à 2,6 fois par rapport aux meilleures bases existantes. L'article a été publié le 28 septembre. Le 30 septembre, CleanTechnica a rapporté une analyse de Transport & Environment selon laquelle les conducteurs de véhicules électriques en Europe paient moins de la moitié de ce que paient les conducteurs diesel au kilomètre, le diesel coûtant 32 euros de plus par plein qu'au début de l'année, dont environ 16 euros de marge de raffinage supplémentaire.
Sources
10- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03AI API Pricing Index - September 2026EN
- 04ChatGPT's new plan costs $500 a monthEN
- 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 09The pricing calculator made people more confused about pricingEN
- 10Singapore, New Zealand operators seek partnerships to cut costsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.