Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Quail fait tourner de l'AI-SQL à un milliard de tokens par minute sur un seul H100, dix fois mieux que vLLM

Modal et le Full Stack Data Lab de Carnegie Mellon ont publié le 30 septembre Quail, un moteur d'inférence qui optimise en même temps le plan de requête SQL et l'exécution du LLM. Résultat : plus d'un milliard de tokens par minute sur un seul H100, contre une base vLLM dix fois plus lente.

IA & modèlesAnalyseCamille RousseauPublié le: 30 septembre 20263 min de lectureSources 7
Quail fait tourner de l'AI-SQL à un milliard de tokens par minute sur un seul H100, dix fois mieux que vLLM

Les chiffres parlent d'eux-mêmes. Sur une requête à jointures multiples, Quail traite plus d'un milliard de tokens par minute et par GPU H100, selon Modal, qui a construit le moteur avec le Full Stack Data Lab de l'université Carnegie Mellon. Sur le matériel de Modal, cela revient à moins de 6 cents par milliard de tokens. Sur un nouveau benchmark de requêtes AI-SQL, Quail est 1,84 fois plus rapide que vLLM, en moyenne géométrique sur l'ensemble des tâches.

Le billet d'accompagnement du Full Stack Data Lab, publié le même jour, explique d'où vient l'écart. L'équipe a lancé vLLM 0.26.0 avec Qwen3 4B FP8 sur un H100 face à BIO-4, une requête qui filtre 5 000 comptes rendus médicaux sur 4 144 termes de réaction, avec deux jointures. Pour ce plan, l'estimation de vitesse limite était de 894,37 secondes, soit 14,91 minutes. vLLM a mis 6,84 heures, 27,55 fois cette estimation.

Deux causes. La surcharge de l'hôte : le CPU planifie et suit les requêtes pendant que le H100 tourne à vide. Et le gaspillage de KV : vLLM jette un cache clé-valeur dont il aura besoin plus tard. Avec un facteur d'échelle de 1,0, l'exécution a ainsi traité 174,6 millions de tokens de prefill inutiles.

Le correctif de Quail est structurel. Avec un plan de requête en main, le moteur peut ordonner et évincer le cache KV délibérément, une révision de l'attention en cascade de type Hydragen. Il peut aussi regrouper les petites requêtes pour que le GPU reste occupé. Modal décrit le résultat comme un point où la planification de base de données et l'ordonnancement de l'inférence cessent d'être deux problèmes séparés.

Pourquoi cela compte pour la facture

L'AI-SQL est le schéma où l'on étend SQL avec des fonctions définies par l'utilisateur qui appellent un LLM. Snowflake Cortex AISQL, les fonctions AI de BigQuery, les AI Functions de Databricks et, récemment, MotherDuck le prennent tous en charge, note le Full Stack Data Lab. Un filtre signifie un appel au modèle par ligne. Une jointure naïve signifie un appel pour chaque paire de lignes. Une seule requête peut générer des centaines de milliers ou des millions d'appels.

Dans ce contexte, le tableau général des prix se complique au lieu de s'éclaircir. L'indice de prix de septembre d'AICostBudget, figé à la date limite du 2026-09-30 UTC, couvre 81 enregistrements publics chez 11 fournisseurs. Le prix médian des entrées est de 1,32 dollar par million de tokens ; celui des sorties est de 6 dollars. La remise médiane sur les entrées mises en cache est de 90 %, et la remise médiane sur les lots est de 50 %. La même page prévient que les prix catalogue servent à planifier, pas à facturer.

Les tarifs horaires bruts des GPU racontent la même divergence. GPUAdvisor, qui suit 14 fournisseurs, dernière mise à jour le 1er octobre, affiche une A4000 16GB chez Hyperstack à 0,15 dollar de l'heure, une RTX 3090 chez Lium à 0,22 dollar, et une L40S chez Lium à 0,38 dollar, qu'il marque comme 89 % sous AWS. Le résumé du site est direct : les clouds spécialisés dans le GPU proposent des prix par GPU 2 à 4 fois inférieurs à ceux des hyperscalers, et le spot peut faire économiser 60 à 70 % sur les entraînements avec points de contrôle.

FitMyLLM convertit les tarifs horaires en coût par million de tokens, et le classement s'inverse. Son option mesurée la moins chère est une RTX 3060 12GB sur Vast.ai à 0,261 dollar par million de tokens. Une RTX 5090 sur Vast.ai est la carte mesurée la plus rapide à 227 tokens par seconde, mais coûte 0,576 dollar par million. Les cartes de centre de données se classent mal dans cette vue à flux unique, et FitMyLLM le dit : un H100 justifie son prix en servant de nombreux flux à la fois, et sur un seul flux sa bande passante reste largement inutilisée.

La question d'efficacité en dessous

L'énergie est l'axe suivant. Un article présenté à SOSP '26 le 28 septembre, signé Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar, soutient qu'optimiser uniquement le taux d'utilisation du GPU peut faire grimper la consommation d'énergie. Leur système, EnerTune, revendique une énergie 1,4 à 2,3 fois plus faible et une puissance appelée 1,3 à 2,6 fois plus faible que les meilleures bases, tout en respectant les SLO de performance.

Tous les fournisseurs ne visent pas la même courbe. Mind-1 de MindOn, annoncé le 30 septembre, cible la latence d'inférence des robots, la ramenant de 82 ms à 32 ms, un autre coin du même problème : ce qu'une heure de calcul achète vraiment.

Commentaires 0

Sources

7
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03AI API pricing index - September 2026EN
  4. 04Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
  5. 05Cloud GPU prices for LLM inference - cost per million tokensEN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Mind-1: Cutting robot inference latency from 82ms to 32msEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.