Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Le prix de l'inférence se fragmente : cache, latence vocale et auto-hébergement

Selon un benchmark publié par inference.academy le 7 septembre 2026, des requêtes DeepSeek V4 Flash à 100 000 tokens d'entrée coûtent 14,9 fois moins cher à chaud qu'à froid dans un échantillon contrôlé.

IA & modèlesAnalyseSophie LeclercPublié le: 27 septembre 20265 min de lectureSources 3
Le prix de l'inférence se fragmente : cache, latence vocale et auto-hébergement

Ce seul ratio, mesuré sur 14 routes, résume l'année écoulée du prix de l'inférence. Le tarif affiché par million de tokens ne décide plus d'une facture. L'état du cache, la forme de la requête et l'amont qui répond à l'appel font varier le coût d'un ordre de grandeur.

Le dispositif d'inference.academy était volontairement étroit. Il visait des cibles de 1 000, 10 000 et 100 000 tokens d'entrée, chacune avec un budget de 100 ou 1 000 tokens de sortie, une température de 0 et le raisonnement désactivé. Les requêtes froides portaient un préfixe unique ; les requêtes chaudes répétaient le même prompt. L'auteur parle de mesures de service, pas de scores de qualité de tâche. Le coût correspond au total des frais de requête divisé par les tokens d'entrée, multiplié par 1M, frais de sortie inclus. Ce n'est donc pas le prix affiché du token d'entrée.

La part de cache est la somme des tokens d'entrée mis en cache divisée par la somme des tokens d'entrée des succès déclarant les deux. C'est une part de tokens, pas le pourcentage de requêtes qui touchent le cache. La séquence chaude inclut sa requête initiale.

Le routage a ajouté une seconde variable que l'étude n'a pas pu expliquer entièrement. Sur 1 000 tokens d'entrée et 100 de sortie avec un cache froid, OpenRouter a renvoyé 20 noms d'amont : Baidu à 18 appels, Relace à 14 et AkashML à 13. La même forme de requête à chaud a renvoyé 14 noms, menés par Relace à 24, CoreWeave à 16 et DeepSeek à 11. Le rapport note qu'un prompt répété peut atteindre un amont différent, ce qui peut changer son comportement de cache. Il indique aussi que la distribution seule n'explique pas pourquoi le routage a changé.

Telnyx a mené la vitesse de génération médiane dans 12 des 12 conditions, selon le même benchmark. Le premier token le plus rapide dépendait de la forme de la requête. Un modèle qui paraît rapide sur un prompt court peut donc ne pas tenir cette position sur un prompt long.

Les modèles vocaux se battent en millisecondes, puis en prix

Les benchmarks de latence en parole ont suivi un schéma similaire. Nari Labs a écrit le 14 septembre 2026 que, à la mi-septembre, la société domine à la fois les benchmarks parole-vers-texte et texte-vers-parole de Coval. Elle se classe première sur la latence et deuxième sur le taux d'erreur de mot en STT, et deuxième sur la latence et première sur le WER en TTS. Elle ajoute une réserve à garder en tête : les chiffres de Coval peuvent fluctuer toutes les 30 minutes.

L'endpoint Qwen3-ASR Fast de la société est classé premier en temps jusqu'au segment final, à un p50 de 44 ms, avec un WER de 3,6 %, ce qui le place deuxième derrière Universal 3.5 Pro d'AssemblyAI à 3,5 %. Nari indique que l'endpoint Fast à 0,12 dollar de l'heure partage le deuxième prix le plus bas parmi les modèles aux tarifs publics connus dans l'annuaire tarifaire de Coval. Universal 3.5 Pro coûte 3,75 fois plus cher et Deepgram Nova 3 coûte 2,4 fois plus cher. L'endpoint Standard serait le moins cher à 0,06 dollar de l'heure.

Côté synthèse, le modèle Qwen3-TTS Fast de Nari est classé deuxième en temps jusqu'au premier audio, à un p50 de 63 ms avec un WER de 3,8 %, ce que la société présente comme la première place sur la qualité. Seul vui de Fluxions affiche un TTFA médian plus bas, à 49 ms, à partir d'un modèle de 300M paramètres contre le Qwen3-TTS de 1,7B que sert Nari.

À 10 dollars par 1M de caractères, Nari indique que son endpoint Fast partage la première place des moins chers dans l'annuaire de Coval. ElevenLabs Eleven v3 Conversational coûte 5 fois plus et Cartesia Sonic 3.6 6,5 fois plus.

La comparaison la plus tranchante du billet porte sur des endpoints servant les mêmes poids. Nari rapporte que l'endpoint officiel Qwen3 TTS Flash Realtime affiche 8,8 % de WER et un TTFA médian dans les centaines de millisecondes. L'endpoint dédié Qwen3-TTS de Baseten enregistre 6,0 % de WER et un TTFA médian dans les basses centaines de millisecondes. Même modèle, pile de service différente, chiffres différents.

L'auto-hébergement a un prix lui aussi, et il est opérationnel

L'enquête de Nexlab du 20 septembre 2026 sur les orchestrateurs auto-hébergés couvre LocalAI, exo, GPUStack, Xinference, Ollama, vLLM et CoderAI, avec les nombres d'étoiles GitHub tirés de l'API ce jour-là. La colonne utile n'est pas les étoiles mais ce que chaque outil fait d'une machine à l'autre.

  • Ollama, à 181 000 étoiles, c'est une machine et un modèle à la fois, sans histoire de cluster au-delà du round-robin sur plusieurs URL Ollama.
  • vLLM, à 92 000 étoiles, gère le parallélisme tensoriel et de pipeline via Ray mais ne gère ni les modèles, ni les utilisateurs, ni le placement.
  • LocalAI, à 49 000 étoiles, a ajouté un mode distribué en juin 2026 avec découverte libp2p et un routeur conscient de la VRAM et des caches de préfixe ; l'enquête indique que son débit LLM brut est en retrait de quelques dizaines de pour cent par rapport à un moteur dédié.
  • exo, à 47 000 étoiles, monte en charge sur Apple Silicon avec MLX et RDMA sur Thunderbolt 5, annonçant 3,2x sur quatre appareils, mais reste CPU uniquement sous Linux en septembre 2026.
  • GPUStack, à 5 700 étoiles, propose utilisateurs, clés, mesure et Prometheus, et prend en charge neuf fournisseurs d'accélérateurs.

LiteLLM, à 59 000 étoiles, route entre endpoints et clouds mais ne fait tourner aucun modèle. L'enquête note que cette distinction est souvent manquée.

Le schéma qui traverse les trois sources est que le coût a cessé d'être un tarif publié unique. Une passerelle qui ignore l'état du cache, un endpoint vocal qui ignore la latence de queue ou un orchestrateur qui ignore les taux de panne produiront chacun une facture ou une expérience utilisateur que le prix affiché n'avait pas prédite.

Ce qu'aucune de ces sources ne tranche, c'est la durabilité des écarts. Les remises de cache dépendent du routage, le routage change entre les appels, et les positions dans les benchmarks bougent en moins d'une heure. Un acheteur qui compare deux fournisseurs sur un seul chiffre compare la mauvaise chose.

Commentaires 0

Sources

3
  1. 01DeepSeek V4 Flash across 14 providers: cost, speed and cachingEN
  2. 02Show HN: Nari Qwen3-TTS and Qwen3-ASREN
  3. 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.