Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Quail revendique 1B de tokens par minute sur un seul H100, alors que les coûts d'inférence divergent

Deux nouveaux moteurs d'inférence revendiquent des gains d'efficacité d'un ordre de grandeur sur le même matériel GPU, tandis que le nouvel abonnement OpenAI à 500 dollars et un instantané tarifaire de septembre montrent que le marché du token continue d'aller dans des directions opposées.

IA & modèlesActualitéCamille RousseauPublié le: 30 septembre 20267 min de lectureSources 10
Quail revendique 1B de tokens par minute sur un seul H100, alors que les coûts d'inférence divergent

Le 30 septembre, le Full Stack Data Lab a publié un billet décrivant Quail, un moteur d'inférence conçu spécifiquement pour l'AI-SQL, ces extensions SQL qui permettent aux requêtes d'appeler des grands modèles de langage ligne par ligne. Le projet revendique plus d'un milliard de tokens traités par minute sur un seul GPU H100 pour une requête à jointures multiples, et un gain de vitesse de 1,84x en moyenne géométrique par rapport à vLLM sur un nouveau benchmark de charges de travail AI-SQL.

C'est le chiffre phare. Il est aussi étroit.

Le milliard de tokens par minute provient d'une seule requête, que l'équipe décrit comme un cas où « la planification est particulièrement importante », et non d'une moyenne. Le chiffre plus large du benchmark, 1,84x, est celui que les auteurs présentent comme le résultat général. Le même jour, Magnitude, société du Y Combinator S25, a lancé un moteur d'inférence open source qui, selon elle, ajuste ses kernels sur le matériel de l'utilisateur avant l'exécution d'un modèle. Son README GitHub revendique jusqu'à 2x plus rapide que llama.cpp, avec un décodage 92 % plus rapide sur Apple Metal et 19 % sur CUDA, et 27 % de mémoire en moins par agent. Le projet est publié sous Apache 2.0 et fonctionne sur Apple Silicon, NVIDIA, AMD ou CPU seul.

Ce que les chiffres comparent réellement

Aucune des deux revendications n'est une affirmation générale sur le prix de l'inférence. Magnitude se compare à llama.cpp, un moteur généraliste, et attribue son avance à des kernels écrits à la main pour des familles de modèles ouverts populaires. Quail se compare à vLLM et attribue son avance à l'optimisation conjointe du plan de requête SQL et du moteur d'inférence. Résultat : des millions d'appels de modèles liés partagent des caches de préfixe au lieu d'arriver comme des requêtes séparées.

Le billet du Full Stack Data Lab, daté du 24 septembre, expose directement le problème de coût. Une fonction AI dans une requête SQL évalue son prompt ligne par ligne. Un filtre nécessite donc un appel LLM par ligne, et une jointure naïve un appel pour chaque paire de lignes de ses deux entrées.

La requête de référence de l'équipe, BIO-4, porte sur 5 000 longs rapports médicaux joints à 4 144 termes de réaction. Les auteurs affirment qu'envoyer ces appels à un moteur généraliste sous forme de requêtes séparées coûte cher. Leur solution consiste à planifier au niveau de la requête. Le billet de Modal sur le même travail formule l'économie plus crûment : moins de 6 cents par milliard de tokens sur le matériel Modal pour la requête à un milliard de TPM. Ce chiffre est celui d'un fournisseur pour sa propre plateforme, et il couvre une seule forme de requête, pas une charge de travail représentative.

Différentes applications d'inférence produisent différentes charges de travail d'inférence, et l'AI-SQL ne fait pas exception. Une requête comme celle ci-dessus peut produire des millions de séquences de milliers de tokens.

Le prix des abonnements va dans l'autre sens

Du côté grand public, OpenAI est allé dans la direction opposée. Lors de son DevDay de mardi, l'entreprise a annoncé une offre Pro 500 à 500 dollars par mois, soit 300 dollars de plus que son précédent forfait le plus élevé, selon Business Insider. Ce forfait inclut l'accès à la capacité de calcul « Ultrafast » pour GPT-6 Astra dans ChatGPT Work et Codex, qu'OpenAI présente comme une multiplication par 8 de la vitesse dans Codex, ainsi que l'usage inclus le plus élevé de l'entreprise.

OpenAI a aussi rouvert son forfait Pro à 200 dollars, mais en divisant par deux l'allocation de calcul.

Cette allocation vaut désormais 10x celle du forfait Plus à 20 dollars, contre un multiple de 20x auparavant, et les messages de chat GPT-6 Pro passent de 200 à 100 par semaine. Thibault Sottiaux, responsable de l'ingénierie pour Codex, a écrit lundi dans un post X que ces changements représentent en fin de compte la moitié de la dépense en dollars d'API par rapport au forfait précédent. « Je voulais m'assurer de partager ce changement à l'avance pour que vous puissiez tous le comprendre avant que nous vous inondions de bonnes nouvelles », a-t-il écrit, cité par Business Insider. Les deux mouvements pointent dans des directions opposées : une allocation moins chère par token au niveau des 200 dollars, un forfait bien plus cher au-dessus. Les abonnés Pro existants reçoivent un crédit unique pendant la transition.

Un instantané distinct publié le 30 septembre par AICostBudget couvre 81 relevés de prix publics chez 11 fournisseurs et situe la médiane des entrées à 1,32 dollar et celle des sorties à 6 dollars par million de tokens. La fourchette observée sur 69 relevés disposant d'un scalaire d'entrée va de 0,10 à 30 dollars, et de 0,10 à 180 dollars pour les sorties. Les sorties sont généralement la composante la plus élevée du prix catalogue, avec un ratio médian sortie sur entrée de 5,0x.

Le même jeu de données rapporte une remise médiane de 90 % sur les entrées mises en cache sur 58 relevés comparables, et une remise médiane de 50 % sur les entrées en mode Batch sur 44. C'est la partie du marché où le prix effectif peut s'écarter fortement du prix catalogue, et c'est celle qu'une comparaison de coûts naïve oublie généralement.

Matériel, énergie et le reste de la pile

Le travail sur l'efficacité ne se résume pas aux tokens par seconde. Un article présenté à SOSP '26 le 28 septembre décrit EnerTune, un système de service qui modélise la consommation électrique de chaque modèle et celle des modèles colocalisés sur des GPU partagés, puis utilise un algorithme de bin-packing sensible à l'énergie pour les placer et les configurer. Les auteurs rapportent une consommation d'énergie de 1,4x à 2,3x inférieure et une puissance appelée de 1,3x à 2,6x inférieure à celle des références de l'état de l'art, tout en respectant les SLO de performance. Leur argument est qu'optimiser uniquement l'utilisation peut augmenter la consommation d'énergie, ce qui compte quand la facture n'est pas seulement par token.

Du côté de la robotique, MindOn a présenté Mind-1 le 30 septembre, un modèle d'IA physique dont l'entreprise dit qu'il réduit la latence d'inférence du robot de 82 ms à 32 ms.

L'entreprise note qu'à une vitesse de l'effecteur terminal de 3 m/s, 10 ms de latence correspondent à environ 3 cm de déplacement, assez pour affecter une saisie précise. C'est un marché différent de l'inférence en centre de données, mais la même contrainte : la latence et le coût sont fixés par toute la chaîne, pas par le seul modèle.

Les opérateurs télécoms poursuivent une logique proche sur les coûts d'infrastructure. Light Reading rapportait le 30 septembre que StarHub et M1 sont en discussions de fusion à Singapour, où ils partagent déjà le spectre 5G et le réseau d'accès radio via une société commune nommée Antina. En Nouvelle-Zélande, 2degrees et OneNZ ont proposé de mettre en commun leurs réseaux radio dans une entité détenue conjointement. L'article cite la part de 43 % de Singtel sur le marché mobile singapourien en juin, contre 22 % pour M1, 21 % pour StarHub et 14 % pour Simba, et indique qu'un ensemble StarHub-M1 serait d'une échelle similaire à celle de Singtel. L'accord 5G entre China Telecom et China Unicom est cité comme le plus grand de ce type, couvrant 1 500 000 stations de base et des économies revendiquées de 56 000 000 000 dollars en capex.

Toutes les tentatives de réduire les coûts en ajoutant de la machinerie ne fonctionnent pas. Un billet publié le 30 septembre par Gokul Kogan décrit comment Pinecone a retiré un calculateur de prix à l'usage après un test A/B. Les visiteurs qui ne voyaient pas le calculateur étaient 16 % plus susceptibles de s'inscrire et 90 % plus susceptibles de contacter l'entreprise, sans augmentation des tickets de support liés aux prix, selon le billet. Dans un sondage interne, sept employés sur dix s'attendaient à ce que la version avec le calculateur performe mieux. La leçon est un avertissement pour quiconque construit un estimateur de coût pour un service facturé au token : une estimation fausse d'un ordre de grandeur peut faire perdre le client définitivement.

Pris ensemble, le tableau est moins un prix unique en baisse qu'un ensemble de paris d'ingénierie. Quail parie sur le traitement par lots conscient de la requête. Magnitude parie sur la compilation des kernels par appareil. EnerTune parie sur le placement sensible à la puissance. OpenAI teste combien un petit nombre d'utilisateurs intensifs paieront pour la vitesse, tandis que son forfait moins cher reçoit moins de calcul qu'avant. Le seul chiffre stable dans tout le dossier est la forme de la facture : les tokens de sortie coûtent plus cher que les entrées, les remises de cache et de lot sont importantes, et les chiffres phares de n'importe quel benchmark décrivent une requête, sur une machine, un jour donné.

Commentaires 0

Sources

10
  1. 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  4. 04ChatGPT's new plan costs $500 a monthEN
  5. 05AI API pricing index - September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09The pricing calculator made people more confused about pricingEN
  10. 10Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.