Le moteur d'inférence Quail franchit le milliard de tokens par minute, les tarifs des fournisseurs grimpent
Quail, un moteur d'inférence du Full Stack Data Lab, a traité plus d'un milliard de tokens par minute sur un seul GPU H100, selon des résultats publiés le 30 septembre. C'est plus de 10 fois plus rapide que sa base vLLM sur le même matériel, pour moins de 6 cents par milliard de tokens sur Modal.

Ces chiffres tombent au moment où la capacité GPU coûte plus cher. AWS aurait signalé une hausse de 15 % des prix de la capacité GPU au 7 octobre, et Nebius a relevé ses tarifs d'inférence de 18,3 % fin septembre, selon des rapports distincts. Dans ce contexte, une série de projets de la couche d'inférence ont publié des benchmarks cette semaine, qui attaquent le coût par le logiciel.
Quail, pour QUery-Aware Inference Layer, vient du Full Stack Data Lab. L'équipe le présente comme une optimisation conjointe du planificateur de requêtes SQL et du moteur d'inférence, conçue pour AI-SQL, du SQL étendu par des fonctions définies par l'utilisateur qui appellent un LLM. Le compte rendu de benchmark du moteur annonce 1,84 fois plus de rapidité que vLLM en moyenne géométrique sur les tâches. Deux des requêtes testées ont été conçues par les auteurs pour montrer là où l'inférence AI-SQL demande encore du travail.
La charge de travail ne ressemble en rien à un chatbot.
Une fonction AI évalue son prompt ligne par ligne. Une seule requête SQL peut donc générer des centaines de milliers ou des millions d'appels au modèle, selon le billet technique du laboratoire, publié le 30 septembre. Un filtre a besoin d'un appel LLM par ligne ; une jointure naïve a besoin d'un appel pour chaque paire de lignes entre deux tables d'entrée. Envoyer ces appels comme requêtes séparées à un moteur généraliste comme vLLM entraîne une lourde surcharge, soutient le billet, parce que les requêtes partagent des préfixes qui pourraient être réutilisés.
La requête BIO-4 du laboratoire, dans son benchmark QUAIL-B, illustre l'échelle : 5 000 longs rapports médicaux joints à 4 144 termes de réaction, la liste de réactions servant deux fois pour deux jointures. Le plan filtre les ensembles de termes pour les réactions cardiovasculaires et neurologiques, puis joint les rapports retenus à chacun. L'exécuter naïvement signifierait un prompt par entrée de filtre et un prompt par paire rapport-réaction candidate.
La réponse de Quail est de rendre le planificateur et le moteur conscients l'un de l'autre. Quail est publié en version 0.1.0, avec un exemple qui exécute une requête sur le jeu de données IMDB en utilisant qwen3-4b-fp8 sur un appareil h100-sxm. Le compte rendu de benchmark du moteur annonce le chiffre d'un milliard de tokens par minute sur une requête à jointures multiples, là où la planification compte le plus, plus de 10 fois plus vite que la base vLLM sur un matériel identique.
Modal, qui héberge la démo, chiffre le coût à moins de 6 cents par milliard de tokens. Ce chiffre vaut pour un profil de requête précis : de petits modèles à poids ouverts qui traitent des décisions courtes et bornées, plutôt que de longues chaînes agentiques. Les auteurs du laboratoire citent DocETL de UC Berkeley, LOTUS de Stanford, Palimpzest du MIT et ThalamusDB de Cornell parmi les systèmes académiques du même domaine. Ils créditent des techniques comme MOAR, Task Cascades, Abacus et BARGAIN d'avoir réduit le nombre d'appels et la taille des modèles.
Leur thèse : même après ces optimisations, un plan peut encore exiger des centaines de milliers ou des millions d'appels. C'est là qu'un moteur conçu pour cet usage justifie sa place.
Quail n'est pas seul à viser le matériel local. Magnitude, une société YC S25, a lancé le 30 septembre un moteur d'inférence open source pour agents, publié sur GitHub sous Apache 2.0. Son README affirme que les modèles ouverts tournent jusqu'à 2 fois plus vite que llama.cpp, soit 92 % plus vite en décodage sur Metal et 19 % sur CUDA. Le mécanisme repose sur la compilation et le réglage des kernels sur la machine de l'utilisateur avant l'exécution d'un modèle, plutôt que sur la livraison de kernels précompilés pour de grandes classes de matériel.
Magnitude affirme aussi 27 % de mémoire en moins par agent, libérée quand les agents s'arrêtent, et un partage du cache de préfixes entre sessions simultanées. Le moteur prend en charge Apple Silicon, NVIDIA, AMD ou CPU seul. Il se connecte à Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline, avec une API compatible OpenAI pour le reste. La société indique que les prompts, les fichiers et les modèles restent sur la machine, sans besoin d'internet une fois un modèle téléchargé.
Les deux projets défendent la même économie : sortir l'inférence des points d'accès cloud facturés à l'usage, pour la porter sur du matériel que l'acheteur possède déjà ou loue à forfait. Les données tarifaires suggèrent pourquoi cet argument porte.
L'indice tarifaire de septembre d'AICostBudget, figé à la date du 30 septembre, couvre 81 enregistrements publics chez 11 fournisseurs. Le prix médian d'entrée sur 69 valeurs scalaires non nulles est de 1,32 $ par million de tokens ; le prix médian de sortie est de 6 $. La sortie médiane coûte 5,0 fois l'entrée. Les plages observées sont larges : l'entrée va de 0,10 $ à 30 $ par million de tokens, la sortie de 0,10 $ à 180 $.
L'indice quantifie aussi les structures de remise qui rendent les tarifs affichés trompeurs. Sur 58 enregistrements comparables, la remise médiane sur l'entrée mise en cache est de 90 %, avec une plage observée de 75 % à 98 %. Sur 44 enregistrements compatibles avec le mode Batch, la remise médiane sur l'entrée Batch est de 50 %, avec une plage observée de 20 % à 50 %. La conclusion du rapport est directe : une comparaison de charges de travail qui ignore la mise en cache et la tarification Batch omet des modes d'économie publiés pour une large part des enregistrements suivis.
Les médianes par fournisseur du même jeu de données placent OpenAI à 2 $ en entrée et 11 $ en sortie sur 18 enregistrements, Google Gemini à 0,75 $ et 4,125 $ sur 14, Anthropic à 5 $ et 25 $ sur 13, xAI à 1,25 $ et 2,5 $ sur neuf, Mistral AI à 0,20 $ et 0,60 $ sur sept, DeepSeek à 0,30 $ et 1,2 $ sur trois, Moonshot AI à 0,95 $ et 4 $ sur trois, et Cohere à 1,5 $ et 5,75 $ sur deux. Le rapport prévient que les pages de documents, le stockage, la durée de session et d'autres unités liées au temps ne peuvent pas être aplatis dans un tableau en tokens seulement, et que 13 enregistrements comportent des composantes non liées aux tokens.
Tous les problèmes de coût ne sont pas des problèmes de tarif. Une communication présentée à SOSP '26 le 28 septembre soutient qu'optimiser les clusters GPU pour le seul taux d'utilisation peut faire grimper la consommation d'énergie. Les auteurs, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar, présentent EnerTune. Le système utilise des modèles analytiques de performance et de puissance par modèle, plus la consommation des modèles colocalisés sur des GPU partagés, dans un algorithme de bin-packing sensible à l'énergie qui choisit ensemble le placement et la configuration.
Leur résumé annonce des réductions d'énergie de 1,4 à 2,3 fois et des réductions de puissance de 1,3 à 2,6 fois par rapport aux meilleures bases existantes, tout en respectant les SLO de performance. L'article soutient que profiler chaque modèle sur des centaines de configurations coûte trop cher à l'échelle. C'est pourquoi l'approche s'appuie sur des modèles plutôt que sur des mesures.
La latence, pas le débit, est la contrainte en IA physique. MindOn a publié Mind-1 le 30 septembre, en affirmant réduire la latence d'inférence des robots de 82 ms à 32 ms. La société note qu'à une vitesse d'effecteur terminal de 3 m/s, 10 ms de latence correspondent à environ 3 cm de déplacement, assez pour affecter une saisie précise, une insertion ou une manipulation riche en contacts. MindOn pointe aussi le tempo des données d'entraînement : une grande partie des données de manipulation vient de la téléopération, plus lente que le mouvement humain naturel, et les modèles apprennent le tempo en même temps que la tâche.
La même logique d'efficacité apparaît hors de l'IA. CleanTechnica a rapporté le 29 septembre qu'une analyse de Transport & Environment situe le coût d'usage d'un véhicule électrique à moins de la moitié de celui d'un diesel au kilomètre. L'analyse se base sur une consommation diesel de 6,9 L/100 km contre 20,2 kWh/100 km en électrique, et un prix de l'électricité de 0,343 €/kWh. Antony Froggatt, de T&E, a déclaré que l'UE devrait taxer les profits pétroliers pour financer le soutien aux ménages modestes et les dispositifs de prime à la casse. L'estimation de T&E pour la recharge est décrite dans sa propre méthodologie comme probablement une borne supérieure.
Les opérateurs télécoms suivent la même recette par la consolidation. Light Reading a rapporté le 30 septembre que StarHub et M1 sont en discussions de fusion à Singapour, où les deux partagent déjà le spectre 5G et le réseau d'accès radio via une société commune nommée Antina. Singtel détenait selon les informations disponibles 43 % du mobile en juin, avec M1 à 22 %, StarHub à 21 % et Simba à 14 %. En Nouvelle-Zélande, 2degrees et OneNZ ont proposé de réunir leurs réseaux radio dans une entité commune, avec une décision de la Commerce Commission attendue l'an prochain. Light Reading cite l'accord 5G entre China Telecom et China Unicom comme le plus grand partenariat de ce type, couvrant 1,5 million de stations de base et des économies d'investissement annoncées de 56 milliards de dollars.
Reste à savoir si le débit de Quail se traduit par des factures plus basses pour les utilisateurs ordinaires d'AI-SQL. Le chiffre d'un milliard de tokens par minute vient d'une seule requête à jointures multiples, choisie parce que la planification y compte le plus. La moyenne du benchmark du moteur sur l'ensemble des tâches est de 1,84 fois, pas de 10 fois. Le laboratoire a lui-même inclus deux requêtes conçues pour exposer les faiblesses actuelles. Quail en est à la version 0.1.0.
Sources
9- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03AI API pricing index - September 2026EN
- 04Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 07The pricing calculator made people more confused about pricingEN
- 08Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.