Benchmark d'Inference Academy : DeepSeek V4 Flash coûte 14,9 fois plus cher sur les requêtes à froid
Renvoyer deux fois la même invite à DeepSeek V4 Flash peut coûter 14,9 fois moins cher la seconde fois. C'est le résultat d'un benchmark de serving publié par inference.academy le 7 septembre, portant sur 14 fournisseurs et trois tailles d'entrée.

La mesure ne porte pas sur la qualité des réponses. Inference.academy a monté un dispositif unique et contrôlé sur des cibles de 1 000, 10 000 et 100 000 tokens d'entrée, chacune associée à un budget de 100 ou 1 000 tokens de sortie. La température était réglée à zéro et le raisonnement désactivé. Les requêtes à froid partaient d'un préfixe unique ; les requêtes à chaud répétaient la même invite. Le site présente ces résultats comme des mesures de serving, pas comme des scores de qualité sur une tâche.
Le coût se définit comme le total des frais de requête divisé par les tokens d'entrée, multiplié par 1M, frais de sortie compris. La précision compte : le prix d'entrée affiché en tête de page chez un fournisseur n'est pas ce que compare le benchmark. L'étude rapporte des points de coût sur 13 routes pour la condition 10 000 tokens d'entrée, 100 tokens de sortie, cache froid.
Le chiffre de 14,9x est l'écart le plus large que le benchmark met en avant. Sur les requêtes de DeepSeek à 100 000 tokens d'entrée et 100 tokens de budget de sortie, les appels à chaud coûtent 14,9 fois moins cher que les appels à froid dans cet échantillon. À chaud signifie une invite répétée, et la part de cache mesurée détermine la quantité de travail d'entrée réellement facturée au tarif non caché.
La vitesse est un axe distinct
Telnyx a mené la vitesse de génération médiane dans les 12 conditions testées. La latence du premier token n'a pas suivi le même schéma. Le benchmark indique que le premier token le plus rapide dépendait de la forme de la requête : un fournisseur qui gagne sur le temps jusqu'au premier token pour une invite de 1 000 n'est pas forcément celui qui gagne à 100 000.
"L'endroit où vous envoyez une invite change ce que vous payez, combien de temps vous attendez, et si l'appel aboutit."
C'est la citation par laquelle inference.academy présente l'exercice. Les panneaux de chronométrage utilisent des requêtes à froid avec un budget de sortie de 100 tokens et une échelle d'axe partagée. Le TTFT va du début de la requête au premier delta de contenu ou de raisonnement reçu par le client, temps réseau et temps passé en file compris. Le P90 utilise une interpolation linéaire entre observations ordonnées. La vitesse de décodage, mesurée après le début du streaming, correspond aux tokens de complétion divisés par le temps écoulé entre le premier et le dernier delta de sortie. Les réponses non streamées ne reçoivent aucune mesure de vitesse de décodage.
Le routage est une autre variable. Le benchmark a consigné les noms d'upstream renvoyés par OpenRouter pour chaque forme de requête et chaque condition de cache. Il note qu'une invite répétée peut atteindre un upstream différent, ce qui peut modifier son comportement de cache.
Pour la condition 10 000 à 100 à chaud, Together comptait 29 appels, Novita 20 et CoreWeave 17. Dans la condition 10 000 à 100 à froid, Baidu apparaissait 15 fois et Relace 13. Le site précise que la largeur des segments correspond à la part des appels et que ces noms sont des upstreams rapportés, pas des machines vérifiées. Il indique aussi que la distribution seule n'établit pas pourquoi le routage a changé.
Les taux d'échec sont détaillés par cible d'entrée et par budget de sortie, avec une comparaison séparée entre froid et chaud. Le benchmark prévient qu'une route peut se comporter différemment quand la même invite demande une réponse plus longue. Les erreurs HTTP, de transport et de réponse comptent toutes comme des échecs, et les comptages exacts figurent dans les tableaux sous les graphiques. Zéro signifie qu'aucun échec n'a été observé dans cet échantillon, pas une garantie.
Pour qui paie des factures d'inférence, la conclusion pratique est plus étroite que le titre. Le cache modifie la facture de plus d'un ordre de grandeur sur les entrées longues, et le fournisseur obtenu via un routeur n'est pas fixe. Le benchmark couvre 14 fournisseurs et 13 routes dans son nuage de points de coûts. Sa propre formulation reste le résumé le plus sûr : ce sont des mesures de serving, et elles décrivent ce qui s'est passé dans cet échantillon.
Sources
1Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.