Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les prix de l'inférence se fragmentent : les moteurs open source compriment les tokens, la facture matérielle grimpe

Un moteur d'inférence open source qui ajuste ses noyaux CPU sur votre propre machine est sorti le 30 septembre. Il revendique des vitesses de décodage jusqu'à 92 % plus rapides que llama.cpp sur Metal. De nouveaux travaux et des données tarifaires dessinent un écart grandissant dans le coût de l'IA.

IA & modèlesExpliquéSophie LeclercPublié le: 30 septembre 20266 min de lectureSources 9
Les prix de l'inférence se fragmentent : les moteurs open source compriment les tokens, la facture matérielle grimpe

Le 30 septembre, Magnitude, société du programme Y Combinator S25, a publié un moteur d'inférence open source pour agents. Il compile et ajuste ses noyaux sur le matériel de l'utilisateur. Le dépôt annonce que les modèles ouverts tournent « jusqu'à 2 fois plus vite que llama.cpp », avec un décodage 92 % plus rapide sur Metal et 19 % sur CUDA, et 27 % de mémoire en moins par agent. Le moteur tourne sur Apple Silicon, NVIDIA, AMD ou CPU, et se connecte à Pi, OpenCode, Hermes, Codex, Claude Code et Cline, selon la page GitHub du projet.

C'est la dernière pièce d'une semaine de revendications concurrentes sur ce que devrait coûter l'inférence. Le même jour, les chercheurs derrière Quail, une couche d'inférence sensible aux requêtes, ont annoncé avoir exécuté une requête AI-SQL multi-jointure à plus d'un milliard de tokens par minute sur un seul GPU H100. Selon eux, c'est plus de 10 fois plus rapide que leur référence vLLM sur le même matériel.

Le versant tokens : la planification bat la force brute

Les travaux Quail, publiés sur le blog de Full Stack Data Lab et détaillés plus avant sur celui de Modal, s'attaquent à une charge précise : l'AI-SQL, où les requêtes SQL appellent des modèles de langue ligne par ligne. Un filtre exige un appel par ligne, et une jointure naïve un appel pour chaque paire de lignes. Sur une requête de référence que les chercheurs nomment BIO-4, les entrées contiennent 5 000 longs rapports médicaux et 4 144 termes de réaction, utilisés deux fois dans deux jointures. Leur argument : envoyer des millions d'appels liés à un moteur généraliste sous forme de requêtes séparées gaspille l'état de préfixe partagé. En optimisant ensemble le plan de requête et le moteur d'inférence, ils réduisent cette surcharge. La note de Modal chiffre le coût à moins de 6 cents par milliard de tokens sur sa plateforme. Elle rapporte Quail 1,84 fois plus rapide que vLLM en moyenne géométrique sur un nouveau benchmark AI-SQL, y compris deux requêtes conçues par l'équipe pour exposer les faiblesses restantes.

« Différentes applications d'inférence produisent différentes charges de travail d'inférence, et l'AI-SQL ne fait pas exception », écrit le billet de Modal, qui note qu'une seule requête peut produire des millions de séquences de milliers de tokens.

Ces deux chiffres viennent des équipes qui construisent les systèmes. Aucun n'a été reproduit indépendamment à partir du matériel publié. La réserve compte : le tableau tarifaire global est plus désordonné que ne le suggère n'importe quelle accélération isolée.

L'indice tarifaire de septembre d'AICostBudget, figé à une date limite du 2026-09-30 UTC, recense 81 enregistrements publics chez 11 fournisseurs. Il situe le prix médian d'entrée à 1,32 $ par million de tokens et le prix médian de sortie à 6 $, soit un rapport de 5,0 fois sur les 69 enregistrements portant les deux valeurs. Les plages observées vont de 0,10 $ à 30 $ en entrée et de 0,10 $ à 180 $ en sortie. Le même jeu de données rapporte une remise médiane de 90 % sur l'entrée mise en cache sur 58 enregistrements comparables, et une remise médiane de 50 % sur le traitement par lots sur 44 lignes éligibles. Autrement dit, les prix affichés renseignent mal sur ce qu'une charge de travail paie réellement. Les médianes par fournisseur vont de Mistral AI à 0,20 $ en entrée et 0,60 $ en sortie, sur trois enregistrements, à Anthropic à 5 $ et 25 $ sur 13. Les 18 enregistrements d'OpenAI se situent à 2 $ et 11 $ ; les 14 de Google Gemini à 0,75 $ et 4,125 $.

Le versant matériel : l'énergie, pas seulement l'utilisation

Si l'économie des tokens s'améliore, celle des GPU ne suit pas forcément. Un article présenté à SOSP '26 le 28 septembre soutient qu'optimiser les clusters GPU uniquement pour l'utilisation peut faire grimper la consommation d'énergie. Les auteurs, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma et Neeraja J. Yadwadkar, décrivent EnerTune, un système de service qui modélise les performances et la consommation de chaque modèle, y compris les modèles colocalisés sur des GPU partagés. Il utilise un algorithme de bin-packing sensible à l'énergie pour placer et configurer les modèles. L'article annonce des réductions d'énergie de 1,4 à 2,3 fois et de consommation de 1,3 à 2,6 fois par rapport aux références de l'état de l'art, tout en respectant les SLO de performance. Il avance aussi un point pratique sur l'échelle : profiler chaque modèle sous des centaines de configurations coûte prohibitivement cher, et le profilage lui-même brûle de l'énergie.

C'est un résultat académique, pas un benchmark de fournisseur. Il tombe au moment où les opérateurs d'Asie-Pacifique prennent une autre voie pour réduire les coûts. Light Reading a rapporté le 30 septembre que StarHub et M1 sont en discussions de fusion à Singapour, où ils partagent déjà le spectre 5G et le réseau d'accès radio via une société commune appelée Antina. Singtel détenait selon les informations une part de 43 % du marché mobile en juin, M1 à 22 %, StarHub à 21 % et Simba à 14 %.

En Nouvelle-Zélande, 2degrees et OneNZ ont proposé de réunir leurs réseaux radio dans une entité détenue conjointement. L'accord devrait arriver devant la Commerce Commission l'an prochain. Light Reading rappelle le précédent : l'infrastructure 5G partagée de China Telecom et China Unicom atteint désormais 1 500 000 stations de base et des économies revendiquées de 56 000 000 000 $ en capex. Ce sont des accords de connectivité, pas de calcul IA. Ils montrent le même réflexe : partager des actifs fixes coûteux vaut mieux que les dupliquer.

Ce que voient les acheteurs

Pour quiconque paie réellement de l'inférence, le point de données le plus utile de la semaine est peut-être un avertissement. Gaurav Kogan, écrivant le 30 septembre, raconte avoir retiré un calculateur de tarification à l'usage chez Pinecone après un test A/B. Les visiteurs qui ne voyaient pas le calculateur étaient 16 % plus susceptibles de s'inscrire et 90 % plus susceptibles de contacter l'entreprise, écrit-il, sans augmentation des tickets de support tarifaire. Son explication du retrait est précise : une légère mauvaise interprétation pouvait produire une estimation surestimée jusqu'à 1 000 fois, et le calculateur donnait aux utilisateurs une fausse confiance. Un sondage interne a trouvé que 7 employés sur 10 s'attendaient à ce que la version avec calculateur performe mieux. La leçon vaut pour les prix de l'inférence : les tarifs en cache et par lots peuvent faire varier une facture d'un ordre de grandeur, et le chiffre en tête d'affiche reflète rarement la charge de travail.

Deux autres éléments du 30 septembre se situent en marge de cette histoire. MindOn a présenté Mind-1, un modèle d'IA physique qui selon la société réduit la latence d'inférence des robots de 82 ms à 32 ms. La société note qu'à une vitesse d'effecteur terminal de 3 m/s, 10 ms de latence équivalent à environ 3 cm de déplacement. Et Transport & Environment a publié une analyse, reprise par CleanTechnica le 29 septembre, affirmant que les conducteurs de véhicules électriques paient moins de la moitié de ce que paient les conducteurs diesel au kilomètre. Ces derniers déboursent 32 euros de plus par plein qu'au début de l'année.

Ni l'un ni l'autre n'est une histoire de centre de données. Tous deux rappellent que le coût de l'inférence est désormais une contrainte physique mesurée en millisecondes, en joules et en euros, pas seulement en dollars par million de tokens.

Le fil conducteur de la semaine : aucun chiffre unique ne tranche. La revendication de 92 % de décodage chez Magnitude est propre à Metal et autodéclarée. Le milliard de tokens par minute de Quail vient d'une seule requête multi-jointure sur un seul H100, l'équipe signalant elle-même deux requêtes de benchmark comme points à améliorer. Les économies d'EnerTune sont modélisées face à des références dans un article. L'indice tarifaire est un instantané figé de prix affichés que la plupart des acheteurs ne paient pas.

Ce qui reste constant, c'est la direction de l'ingénierie : ajuster les noyaux à la puce exacte, planifier les requêtes autour du modèle et traiter la puissance comme une métrique de premier ordre. Savoir si cela se traduit par une inférence moins chère dépend moins d'un benchmark isolé que de la part qui atteint la production.

Commentaires 0

Sources

9
  1. 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04AI API pricing index - September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06Singapore, New Zealand operators seek partnerships to cut costsEN
  7. 07The pricing calculator made people more confused about pricingEN
  8. 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
  9. 09Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.