Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Coût d'inférence : ce que cachent les tarifs horaires des GPU

Le comparateur de GPUAdvisor, mis à jour le 1er octobre, couvre désormais 14 fournisseurs de cloud qui vendent du H100, du H200, de l'A100 et du B200. Entre l'offre la moins chère et la plus chère sur la même puce, l'écart est tel que le tarif horaire affiché ne dit presque rien.

IA & modèlesExpliquéCamille RousseauPublié le: 29 septembre 20265 min de lectureSources 6
Coût d'inférence : ce que cachent les tarifs horaires des GPU

Les sites de comparaison se sont multipliés plus vite que les remises. Le 1er octobre, GPUAdvisor a indiqué que son comparateur de prix de GPU dans le cloud couvre 14 fournisseurs et tous les accélérateurs majeurs. Au-dessus du tableau, un avertissement : les prix sont approximatifs, varient selon la région et la disponibilité, et reflètent des estimations de septembre 2026. Voilà l'état du marché. Le prix catalogue est un point de départ, pas une facture.

Meetrix a publié sa propre comparaison le 29 septembre, avec des prix relevés le 28 septembre pour des instances à la demande dans US East et us-central1. Son constat est sans détour : sur le papier, AWS est moins cher pour un H100 ou un A100, et GCP l'est un peu plus si un seul L4 suffit. Un H100 coûte 6,88 dollars de l'heure sur AWS contre 10,98 dollars sur GCP.

Le taux d'utilisation compte plus que le choix du cloud

Le même article contredit ensuite son propre titre. Meetrix a posé le calcul sur un débit théorique de 2 500 tokens de sortie par seconde. Résultat : sur le H100 d'AWS, le coût par million de tokens passe de 0,76 à 3,06 dollar quand le taux d'utilisation tombe de 100 % à 25 %. Sur le H100 de GCP, la même variation va de 1,22 à 4,88 dollar. L'article précise que ce débit est une hypothèse, pas une mesure, et que les rapports entre les lignes n'en dépendent pas.

Économiser 37 % en changeant de cloud, donc, cela vaut la peine. C'est moins que ce que coûte un après-midi d'inactivité. Meetrix signale aussi un problème de données : la page de tarifs GPU de Google affiche son tableau côté client, si bien que l'auteur n'a pas pu la lire par programme. Trois comparateurs s'accordent sur 87,83 dollars pour l'a3-highgpu-8g, un quatrième affiche 88,49 dollars. Un tel désaccord mérite d'être nommé plutôt que moyenné.

Il y a un piège structurel du côté bon marché. AWS ne vend l'A100 que par grappes de 8 GPU : p4d.24xlarge avec des cartes de 40 Go, p4de.24xlarge avec des cartes de 80 Go. Un seul A100 impose donc la forme a2-highgpu-1g de GCP, même si chaque GPU y coûte plus cher. Meetrix chiffre l'A100 8 GPU d'AWS à 21,96 dollars de l'heure, soit 2,75 dollars par GPU, contre 3,67 dollars pour la forme mono-GPU de GCP.

Les tarifs réservés et spot compliquent encore le tableau. Meetrix rapporte qu'une réservation de 3 ans fait économiser 54 % à 57 % sur AWS, que les remises spot sur H100 ou A10G vont de 53 % à 62 %, et que le spot sur L40S est de 1 %. Il note aussi qu'AWS a réduit ses prix à la demande de 33 % pour les P4d et P4de et de 44 % pour les P5, par rapport à ses prix du 31 mai 2025.

Une chose a augmenté : les EC2 Capacity Blocks for ML, où l'on réserve des GPU pour une fenêtre fixe. The Register a rapporté une hausse d'environ 15 % en janvier 2026, le p5e passant de 34,61 à 39,80 dollars de l'heure.

Acheter le même modèle chez trois vendeurs

L'autre moitié du coût d'inférence n'est pas le GPU. Unblocked a publié le 29 septembre un compte rendu du routage de trafic de modèles à poids ouverts entre Baseten, Fireworks et CoreWeave, tous servant GLM 5.2 à des prix et des vitesses différents. Sa première configuration, en round-robin, a envoyé 51 % des tâches à Fireworks et 49 % à Baseten lors de sa dernière semaine complète, alors même que Fireworks facturait 25 % de plus et tournait plus lentement.

Un ordre fixe a réglé le problème : 98,5 % des tâches à Baseten, 1,5 % à Fireworks. Puis les ennuis opérationnels sont arrivés. Changer l'ordre exigeait une modification du code et un déploiement. Le disjoncteur traitait cinq erreurs 429 en une minute comme une panne totale. Et les prix catalogue de CoreWeave, environ 45 % sous ceux de Baseten, restaient inutilisés faute de données de performance. La solution de remplacement note chaque fournisseur sur le coût et la vitesse, pondérés 0,7 et 0,3, et déplace le trafic sans intervention d'un ingénieur. L'article précise que les chiffres viennent de son registre de tokens de production et de ses journaux.

Le comportement des tokens au niveau du modèle se répercute directement sur la facture. Artificial Analysis a rapporté le 29 septembre que Claude Sonnet 5.5 obtient 56 à son Intelligence Index, deux points derrière Opus 5.5 à effort maximal. Mais il consomme environ 193 000 tokens de sortie par tâche de l'indice, ce que le cabinet qualifie de consommation la plus lourde qu'il ait mesurée : environ 60 % de plus qu'Opus 5.5 et près de 7 fois GPT-6 Astra à effort maximal. Sonnet 5.5 est facturé 2 dollars par million de tokens d'entrée et 10 dollars par million de tokens de sortie, inchangé par rapport à Sonnet 5. Artificial Analysis le situe pourtant à 7,60 dollars par tâche, soit environ 50 % de plus que Sonnet 5. La société précise que les évaluations ont tourné sur un déploiement de préversion avec un bug affectant les sorties structurées, corrigé pour la version publique.

Où va l'argent à la place

Le prospectus d'introduction en bourse d'Anthropic, consulté par Reuters et rapporté par CNBC le 29 septembre, résume la demande de ce marché en une ligne : 7,33 milliards de dollars dépensés en calcul et en infrastructure en 2025, un triplement par rapport à 2024, plus de la moitié des 12,65 milliards de dollars de charges d'exploitation totales. Le même document décrit 518 milliards de dollars d'obligations en matière de cloud, de calcul et d'infrastructure pour les années à venir, et une perte nette de 42 milliards de dollars pour 2025.

La mémoire est la contrainte qui apparaît ailleurs. Yahoo Finance a rapporté le 30 septembre que le nouveau directeur général d'Apple, John Ternus, prévoit des licenciements de faible ampleur et des annulations de projets, selon un rapport de Bloomberg, à mesure que les coûts de la mémoire augmentent. L'article cite l'ancien directeur général Tim Cook qui, lors de sa dernière conférence de résultats, a parlé d'une crue centennale sur les prix de la mémoire. Il nomme aussi SK Hynix, Samsung et Micron, qui ont vendu la majeure partie de leur capacité de mémoire IA haut de gamme jusqu'en 2026.

Rien de tout cela ne rend faux le tableau des GPU à l'heure. Cela le rend incomplet. La formulation de Meetrix est la plus honnête : réglez le taux d'utilisation avant de vous engager, et lisez une colonne de haut en bas plutôt qu'une ligne de gauche à droite, car aucun changement de cloud ne rapporte autant qu'un après-midi d'inactivité ne vous coûte.

Commentaires 0

Sources

6
  1. 01Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Routing LLM traffic across inference providers with TCP-style congestion controlEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05Anthropic's IPO prospectus shows AI vision, surging costsEN
  6. 06New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.