Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Quail et Magnitude attaquent les coûts d'inférence par les deux bouts de la pile

Deux projets open source publiés le 30 septembre revendiquent le même gain par des voies opposées. Quail annonce plus d'un milliard de tokens traités par minute sur un seul H100, en planifiant les requêtes SQL au niveau du moteur d'inférence. Magnitude affirme de son côté faire tourner des modèles ouverts jusqu'à 2 fois plus vite que llama.cpp, en compilant les kernels sur la machine de l'utilisateur.

IA & modèlesAnalyseCamille RousseauPublié le: 30 septembre 20266 min de lectureSources 6
Quail et Magnitude attaquent les coûts d'inférence par les deux bouts de la pile

La proposition de Modal et du Full Stack Data Lab de l'université Carnegie Mellon est précise. Quail, la QUery-Aware Inference Layer, a dépassé le milliard de tokens traités par minute et par GPU H100 sur une seule requête à jointures multiples, écrivent les équipes le 30 septembre. C'est plus de 10 fois plus vite que leur référence vLLM sur le même matériel. Sur le cloud de Modal, cela revient à moins de 6 cents par milliard de tokens.

Le chiffre est assez gros pour ressembler à une coquille.

Il ne s'agit pas d'une annonce de nouveau modèle ni de nouvelle puce. Il s'agit d'un problème d'ordonnancement.

Ce que fait réellement Quail

AI-SQL étend SQL avec des fonctions qui appellent un modèle de langue ligne par ligne. Un filtre demande un appel de modèle par ligne. Une jointure naïve demande un appel pour chaque paire de lignes entre deux tables. Le billet du Full Stack Data Lab, publié le 24 septembre et repris par Modal, détaille une requête de référence appelée BIO-4 : 5 000 comptes rendus médicaux joints à 4 144 termes de réaction, deux fois. Le laboratoire fixe le plancher théorique de cette requête à 894,37 secondes, soit 14,91 minutes, en supposant le débit maximal du GPU, un recouvrement complet CPU-GPU et un espace illimité pour le cache KV conservé. Faire tourner vLLM 0.26.0 avec Qwen3 4B FP8 sur un H100 a pris 6,84 heures, soit 27,55 fois cette borne inférieure. Le billet attribue l'écart à deux causes. D'abord la surcharge de l'hôte : le CPU ordonnance les requêtes pendant que le H100 reste inactif. Ensuite ce qu'il appelle le regret KV, où vLLM jette un cache clé-valeur dont il aura besoin plus tard. Sur BIO-4 au facteur d'échelle 1.0, le laboratoire indique que vLLM a traité 174 600 000, et la phrase s'interrompt dans le texte dont nous disposons.

Quail corrige le tir en se servant de la structure de la requête comme signal d'ordonnancement. Si le moteur connaît le plan, il peut ordonner les requêtes pour réutiliser le cache et l'évincer volontairement, au lieu de réagir après coup. Le billet de Modal y voit une légère révision de l'attention en cascade de type Hydragen. Il crédite la collaboration entre les chercheurs en inférence de Modal et les chercheurs en bases de données de CMU.

Sur un nouveau benchmark AI-SQL, Quail tourne 1,84 fois plus vite que vLLM en moyenne géométrique sur les tâches. C'est un chiffre bien plus modeste que le titre au milliard de tokens. Le billet de Modal précise que le benchmark contient deux requêtes destinées à montrer là où l'inférence AI-SQL doit encore progresser. La divulgation est utile : le facteur 10 est un meilleur cas sur une requête, pas une accélération générale.

Magnitude va dans l'autre sens

Magnitude, société de Y Combinator S25, a publié son dépôt le 30 septembre avec un argument différent. Son moteur d'inférence compile et ajuste les kernels sur l'appareil réel avant l'exécution du modèle, au lieu de livrer des kernels précompilés pour de grandes classes de matériel. Le README annonce jusqu'à 2 fois plus vite que llama.cpp, avec un décodage 92 pour cent plus rapide sur Metal et 19 pour cent sur CUDA. Il annonce aussi 27 pour cent de mémoire en moins par agent.

Le matériel pris en charge est volontairement large : Apple Silicon, NVIDIA, AMD, ou un CPU seul. Le projet indique qu'il n'y a pas de minimum fixe et que les petites machines font tourner les petits modèles. Il se présente comme une application de bureau avec une CLI, se connecte à Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline, et expose une API compatible OpenAI pour tout le reste. Il est sous licence Apache 2.0 et fonctionne en local.

Les deux projets ne sont pas concurrents. Quail vise la couche SQL analytique, où un planificateur de requêtes génère des millions de petits appels structurés au modèle. Magnitude vise l'ordinateur portable du développeur, où un agent tourne sur un modèle et où la contrainte est la mémoire et la vitesse de décodage. Mais ils désignent le même problème de coût par les deux bouts : l'inférence coûte cher parce que les moteurs généralistes ne savent pas ce que la charge de travail va faire ensuite.

Ce que disent les données de prix

L'indice tarifaire de septembre d'AICostBudget, figé à la coupure du 30 septembre UTC sur 81 enregistrements publics de 11 fournisseurs, donne le contexte du marché. Sur 69 enregistrements disposant d'un scalaire de token d'entrée courant, les prix vont de 0,10 à 30 dollars par million de tokens. Les prix de sortie vont de 0,10 à 180 dollars. Le prix médian d'entrée est de 1,32 dollar, le prix médian de sortie de 6 dollars, et le rapport médian sortie-entrée de 5,0 fois.

L'indice souligne un point facile à manquer dans un classement du modèle le moins cher. Sur 58 enregistrements comparables, la remise médiane sur l'entrée mise en cache est de 90 pour cent. Sur 44 enregistrements compatibles avec le traitement par lots, la remise médiane par lots est de 50 pour cent. Une comparaison de charges de travail qui ignore l'un ou l'autre mode compare des prix affichés que personne ne paie.

Voici les médianes par fournisseur de l'indice, que la méthodologie dit non pondérées par l'usage ni par la part de marché. Google Gemini à 0,75 dollar en entrée et 4 125 en sortie sur 14 enregistrements tarifés, Mistral AI à 0,20 et 0,60 sur 7, DeepSeek à 0,30 et 1,20 sur 3, OpenAI à 2 et 11 sur 18, xAI à 1,25 et 2,50 sur 9, Cohere à 1,50 et 5,75 sur 2, Anthropic à 5 et 25 sur 13, et Moonshot AI à 0,95 et 4 sur 3. AWS, Azure et Google Cloud apportent chacun un enregistrement sans valeur numérique.

Le versant matériel

L'efficacité matérielle est attaquée en parallèle. EnerTune, article publié dans les actes de SOSP '26 le 28 septembre, soutient qu'optimiser les grappes de GPU uniquement pour l'utilisation peut augmenter la consommation d'énergie. Les auteurs, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar, proposent des modèles analytiques de performance et de puissance par modèle, ainsi que de la consommation des modèles co-localisés sur des GPU partagés, pour alimenter un algorithme de bin-packing sensible à l'énergie. Ils rapportent qu'ils respectent les SLO de performance tout en réduisant l'énergie de 1,4 à 2,3 fois et la puissance absorbée de 1,3 à 2,6 fois face aux références de l'état de l'art.

C'est un levier différent de celui de Quail, avec la même réserve : des résultats de benchmark, pas des déploiements en production. L'article note explicitement que profiler chaque modèle sous des centaines de configurations coûte trop cher à l'échelle, d'où le recours à des modèles analytiques.

Pendant ce temps, l'expérience de Pinecone avec son propre calculateur de prix, racontée par Gkogan le 30 septembre, rappelle que la confusion sur les coûts n'est pas qu'un problème de calcul. L'entreprise a retiré le calculateur après un test A/B montrant que les visiteurs qui ne le voyaient pas étaient 16 pour cent plus susceptibles de s'inscrire et 90 pour cent plus susceptibles de prendre contact, sans augmentation des tickets d'assistance sur les prix. Sept employés sur dix avaient prédit que la version avec calculateur l'emporterait.

Le fil commun entre Quail, Magnitude et EnerTune est que les plus gros gains viennent d'une meilleure connaissance de la charge de travail, qu'il s'agisse d'un plan de requête, d'une puce précise ou d'un schéma de co-localisation. Les moteurs généralistes laissent cette information de côté. Ce qu'aucun des trois n'établit encore, c'est si ces gains survivent au contact d'un trafic de production désordonné. Seul Magnitude livre quelque chose qu'un développeur peut installer aujourd'hui.

Commentaires 0

Sources

6
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  4. 04AI API Pricing Index - September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06The pricing calculator made people more confused about pricingEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.