Les moteurs d'inférence open source font baisser le coût de l'AI-SQL et des agents, selon des benchmarks
Deux projets d'inférence open source ont publié des benchmarks le 30 septembre. Ils annoncent de fortes baisses du coût d'exécution des charges d'IA. Un index de prix distinct situe le jeton de sortie médian à 6 dollars le million.

Le 30 septembre, Modal et le Full Stack Data Lab de l'université Carnegie Mellon ont lancé Quail. Ce moteur d'inférence optimise en même temps la planification des requêtes SQL et l'exécution des LLM. Selon le blog de Modal, Quail traite plus d'un milliard de jetons par minute sur un seul GPU H100. C'est plus de 10 fois plus rapide que sa référence vLLM sur le même matériel. Sur l'infrastructure de Modal, cela revient à moins de 6 cents par milliard de jetons.
Le blog du Full Stack Data Lab, publié le 24 septembre et mis en avant aux côtés de l'article de Modal, explique le problème. L'AI-SQL étend SQL avec des fonctions qui appellent un LLM ligne par ligne. Une seule requête de filtrage peut donc déclencher des centaines de milliers ou des millions d'appels au modèle. Le laboratoire rattache cette prise en charge à Snowflake Cortex AISQL, aux fonctions AI de BigQuery, aux AI Functions de Databricks et, récemment, à MotherDuck.
Quail est la plus récente de plusieurs promesses d'efficacité annoncées cette semaine. Le 30 septembre, le projet open source Magnitude a été lancé sur GitHub. Il se présente comme un moteur d'inférence pour agents qui compile et ajuste les kernels sur le matériel de l'utilisateur. Son README annonce des vitesses de décodage jusqu'à 2 fois supérieures à llama.cpp, avec un décodage 92 % plus rapide sur Metal et 19 % sur CUDA, et 27 % de mémoire en moins par agent. Magnitude fonctionne sur Apple Silicon, NVIDIA, AMD ou processeur seul. Il se connecte à Pi, OpenCode, Hermes et Codex en un clic.
Sur une requête à jointures multiples où la planification compte particulièrement, Quail dépasse le milliard de jetons traités par minute et par GPU H100 (TPM/GPU), soit plus de 10 fois plus vite que notre référence vLLM sur le même matériel.
Les deux projets s'attaquent à des goulots d'étranglement différents. Magnitude vise les charges d'agents locales, où la contrainte est l'adéquation des kernels aux puces grand public ou de station de travail. Quail vise les charges de bases de données, où la contrainte est la surcharge de l'hôte et l'éviction du cache KV. Le Full Stack Data Lab a mesuré une référence vLLM sur BIO-4, une requête de rapport médical, à 6,84 heures. C'est 27,55 fois sa propre estimation de vitesse limite, fixée à 14,91 minutes.
L'économie du matériel reste en toile de fond. Un article présenté à SOSP '26 et publié le 30 septembre décrit EnerTune, un système de partage de GPU. Les auteurs affirment qu'il réduit la consommation d'énergie de 1,4 à 2,3 fois et la puissance appelée de 1,3 à 2,6 fois par rapport aux meilleures références, tout en respectant les SLO de performance. Ils soutiennent qu'optimiser uniquement le taux d'utilisation du GPU peut augmenter la consommation d'énergie. Ils ajoutent que profiler chaque configuration à grande échelle coûte trop cher.
Les prix catalogue restent très dispersés
Côté tarifs, AICostBudget a publié son index de septembre le 30 septembre. Il repose sur 81 enregistrements de prix publics figés chez 11 fournisseurs. Il situe le prix d'entrée médian à 1,32 dollar par million de jetons et le prix de sortie médian à 6 dollars, soit un rapport de 5,0. L'intervalle observé va de 0,10 à 30 dollars par million en entrée et de 0,10 à 180 dollars en sortie.
L'index rapporte une remise médiane de 90 % sur l'entrée mise en cache, sur 58 enregistrements comparables. Il rapporte une remise médiane de 50 % pour le mode Batch, sur 44 enregistrements. En prix d'entrée médian par fournisseur, Mistral AI est le moins cher à 0,20 dollar. DeepSeek est à 0,30 dollar, Google Gemini à 0,75 dollar, Moonshot AI à 0,95 dollar, xAI à 1,25 dollar, Cohere à 1,50 dollar, OpenAI à 2 dollars et Anthropic à 5 dollars.
Tous les enregistrements ne sont pas directement comparables. AICostBudget indique que 17 enregistrements utilisent une tarification par paliers ou à contexte long et que 13 reposent sur des composants non liés aux jetons, comme les pages de document ou la durée de session. Ils sont exclus de ses médianes par jeton. L'index précise aussi que sa fenêtre d'observation commence en juillet 2026 et ne revendique aucune baisse annuelle des prix à l'échelle du secteur.
Pendant ce temps, le coût d'ingénierie de l'absence d'optimisation apparaît dans les chiffres de Quail. Le laboratoire indique que vLLM a traité 174,6 millions de jetons inutiles sur BIO-4, à cause du regret de cache KV, et que l'ordonnancement CPU a laissé le H100 au repos. Ce sont les écarts que Magnitude et Quail cherchent tous deux à combler, par les deux extrémités de la pile.
Sources
5- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04AI API pricing index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.