Course au coût d'inférence : Quail revendique 1B de tokens par minute, Magnitude optimise ses noyaux sur l'appareil
Deux équipes d'ingénieurs ont publié séparément le 30 septembre des résultats selon lesquels on peut faire baisser le coût d'exploitation des modèles ouverts en réécrivant la façon dont les moteurs d'inférence traitent le matériel et la structure des requêtes, plutôt qu'en attendant des GPU moins chers.

Modal et le Full Stack Data Lab de l'université Carnegie Mellon ont annoncé le 30 septembre que Quail, leur moteur d'inférence développé en commun, avait traité plus d'un milliard de tokens par minute sur un seul GPU H100, pour une requête AI-SQL à jointures multiples. C'est plus de 10x leur référence vLLM sur le même matériel, selon le billet de blog de Modal. Cela revient à moins de 6 cents par milliard de tokens sur le cloud de Modal.
La revendication repose sur une charge de travail précise. AI-SQL étend le SQL ordinaire avec des fonctions qui appellent un modèle de langue. Un filtre peut donc déclencher un appel de modèle par ligne, et une jointure un appel par paire de lignes. Le document technique du Full Stack Data Lab décrit une requête de référence, BIO-4, portant sur 5 000 comptes rendus médicaux et 4 144 termes de réaction. Exécutée sur vLLM 0.26.0 avec Qwen3 4B FP8 sur un H100, elle a pris 6,84 heures à un facteur d'échelle de 1,0. Les auteurs calculent que cela représente 27,55x une estimation roofline de 14,91 minutes.
Un travail de moteur, pas de silicium
Cet écart, voilà l'argument. Les auteurs attribuent la perte à la surcharge de l'hôte, le CPU ordonnant les requêtes pendant que le H100 reste inactif, et à ce qu'ils appellent le KV regret : vLLM jette un cache de clés et de valeurs dont il aura besoin plus tard. Le blog du laboratoire indique que la requête a traité 174,6 millions de tokens de travail KV gaspillé. Quail prend au contraire le plan de requête comme entrée, ce qui lui permet d'ordonner les requêtes pour réutiliser le cache et l'évincer délibérément.
Les deux textes ne mettent pas l'accent au même endroit. Modal cadre le résultat autour de la meilleure requête et du chiffre de 1B de tokens par minute, tandis que le Full Stack Data Lab rapporte que Quail est 1,84x plus rapide que vLLM en moyenne géométrique sur son nouveau banc d'essai AI-SQL, y compris deux requêtes que les auteurs ont conçues pour exposer les faiblesses restantes. Les deux séries de chiffres viennent de la même collaboration : il ne s'agit donc pas d'une vérification indépendante.
Le même jour, Magnitude, société de Y Combinator S25, a ouvert le code source de son propre moteur d'inférence sous Apache 2.0. Son dépôt GitHub affirme que les modèles ouverts y tournent jusqu'à 2x plus vite que llama.cpp, avec un décodage 92% plus rapide sur Metal et 19% sur CUDA. Le mécanisme diffère de celui de Quail : Magnitude compile et ajuste les noyaux sur l'appareil de l'utilisateur avant l'exécution d'un modèle, en ciblant Apple Silicon, Nvidia, AMD ou un simple CPU. Le dépôt revendique aussi 27% de mémoire en moins par agent et un partage du cache de préfixe entre sessions simultanées.
Le contexte des deux sorties est un marché où les prix affichés ne baissent pas de façon uniforme. L'instantané de septembre d'AICostBudget, figé à la coupure UTC du 30 septembre, couvre 81 relevés de prix publics chez 11 fournisseurs. Il situe la médiane des entrées à 1,32 dollar par million de tokens et celle des sorties à 6 dollars, soit un rapport de 5,0x, avec une remise médiane de 90% sur les entrées mises en cache et une tarification par lots à 50%. C'est généralement la sortie, et non l'ingestion du prompt, qui coûte le plus cher.
Le travail au niveau matériel se mesure lui aussi à l'énergie plutôt qu'à l'utilisation. Un article publié à SOSP '26 le 28 septembre, Beyond Utilization, soutient qu'optimiser le multiplexage des GPU pour la seule utilisation peut faire grimper la consommation d'énergie. Son système, EnerTune, s'appuie sur des modèles analytiques de la puissance par modèle et de la puissance appelée par les modèles colocalisés. Les auteurs rapportent des réductions d'énergie de 1,4x à 2,3x et de puissance de 1,3x à 2,6x face à des références de pointe non nommées, tout en atteignant les objectifs de performance.
Une mise en garde vient d'ailleurs, en dehors de l'infrastructure. Gaurav Kogan, de Pinecone, a raconté le 30 septembre comment l'entreprise a retiré son calculateur de tarification à l'usage après un test A/B. Les visiteurs qui ne le voyaient pas étaient 16% plus susceptibles de s'inscrire et 90% plus susceptibles de prendre contact, sans hausse des tickets de support sur les prix, écrit-il. La leçon vaut au-delà : un outil censé clarifier un coût peut fausser la décision pour laquelle il a été conçu.
Sources
6- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Building an Ultra-High Throughput AI-SQL EngineEN
- 03Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 04AI API pricing index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.