Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

AWS vend le H100 moins cher, mais c'est l'utilisation qui décide de la facture

AWS affiche le H100 à 6,88 dollars l'heure, contre 10,98 dollars chez Google Cloud. Cet écart de 37 % pèse bien moins que le rapport de un à quatre entre un GPU occupé et un GPU au repos, selon les tarifs relevés le 28 septembre.

IA & modèlesExpliquéSophie LeclercPublié le: 29 septembre 20265 min de lectureSources 6
AWS vend le H100 moins cher, mais c'est l'utilisation qui décide de la facture

AWS affiche le H100 à 6,88 dollars l'heure, contre 10,98 dollars chez Google Cloud. Cet écart de 37 % pèse bien moins que le rapport de un à quatre entre un GPU occupé et un GPU au repos, selon les tarifs relevés le 28 septembre.

La comparaison vient de meetrix.io. Le site dit avoir relevé le 28 septembre les prix catalogue à la demande pour la région US East chez AWS et us-central1 chez Google Cloud. Sur la même page, il écrit noir sur blanc qu'un H100 coûte quatre fois plus cher par token à 25 % d'utilisation qu'à pleine charge, chez l'un comme chez l'autre. L'auteur prévient aussi que le chiffre de tokens par seconde de son exemple de calcul est une valeur de remplissage, pas un benchmark.

Le tableau, et qui y est le moins cher

Meetrix donne AWS environ 37 % moins cher par H100 et 25 % moins cher par A100 que Google Cloud à la demande. Google l'emporte sur un seul point, la petite carte L4 : la g2-standard-4 revient à environ 0,70 dollar l'heure, contre 0,805 dollar pour la g6.xlarge d'AWS. L'article chiffre lui-même la différence à environ 75 dollars par mois.

La ligne A100 cache un piège. AWS ne vend l'A100 que par grappes de huit GPU : p4d.24xlarge avec des cartes de 40 Go, p4de.24xlarge avec 80 Go, à 2,75 dollars par heure de GPU et 21,96 dollars pour le nœud. Pour un seul A100, l'a2-highgpu-1g de Google à 3,67 dollars l'heure reste donc l'option pratique, même si chaque GPU coûte plus cher.

Sur les sources, meetrix se montre d'une franchise rare. Les chiffres AWS viennent du tracker EC2 de Vantage, mis à jour le 28 septembre 2026. La page de tarifs GPU de Google, elle, génère son tableau côté client, ce qui empêche de la lire par programme. Les chiffres GCP sont donc ceux que publient les trackers de prix. Trois d'entre eux s'accordent sur 87,83 dollars pour l'a3-highgpu-8g, un quatrième affiche 88,49 dollars. Le désaccord est mince, mais c'en est un, et mieux vaut savoir de quel côté du chiffre se situe votre budget.

L'utilisation compte plus que le comparatif

Le calcul du billet meetrix part de 2 500 tokens de sortie par seconde sur un seul H100. L'auteur présente ce chiffre comme une hypothèse, pas comme une mesure. À 100 % d'occupation, AWS revient à 0,76 dollar par million de tokens et GCP à 1,22 dollar. À 50 %, on passe à 1,53 et 2,44 dollars. À 25 %, à 3,06 et 4,88 dollars.

Lisez une colonne, pas une ligne, conseille le billet.

C'est la bonne consigne. Changer de cloud fait économiser 37 % sur le même H100. Laisser la carte tourner à vide les trois quarts du temps coûte quatre fois plus cher. D'un côté un choix d'achat, de l'autre un choix d'ordonnancement, et seul le second s'accumule chaque jour.

GPUAdvisor, qui dit suivre 14 fournisseurs et avoir lancé son dernier contrôle quotidien le 1er octobre 2026, montre où mène cette logique de comparaison. Ses listes placent le L40S de Lium à 0,38 dollar par heure de GPU, signalé comme 89 % sous AWS, le RTX A6000 de Thunder Compute à 0,35 dollar et l'A4000 de Hyperstack à 0,15 dollar. La même page note que les clouds spécialisés dans le GPU affichent des prix par GPU deux à quatre fois inférieurs à ceux des hyperscalers, et que ces prix sont approximatifs et varient selon la région. Un spécialiste ne vend pas le même produit qu'un hyperscaler, mais l'écart n'est pas du bruit non plus.

Les remises d'engagement déplacent aussi le chiffre, et elles jouent dans les deux sens. Meetrix rapporte qu'une réservation AWS de trois ans permet d'économiser 54 % à 57 %, avec la réserve que les GPU vieillissent vite. GPUAdvisor situe les engagements d'un an entre 35 % et 40 % pour les points de terminaison d'inférence toujours actifs, et le Spot de GCP jusqu'à 70 % de remise sur les instances A100 et H100. Meetrix ajoute que le Spot chez AWS offre aujourd'hui 53 % à 62 % de remise sur les H100 et A10G, mais seulement 1 % sur les L40S.

Le produit de capacité qui a pris le chemin inverse

Tous les prix n'ont pas baissé. Meetrix cite le rapport de The Register sur une hausse d'environ 15 % en janvier 2026 sur les EC2 Capacity Blocks for ML, le p5e passant de 34,61 à 39,80 dollars l'heure. Le billet précise qu'il s'agit d'un produit distinct des tarifs à la demande du tableau comparatif. C'est exactement le genre de distinction qui se perd quand une équipe cite un seul chiffre de GPU en réunion de planification.

Le contexte, c'est une tension sur l'offre qui dépasse largement les GPU. Yahoo Finance rapportait le 30 septembre que le nouveau patron d'Apple, John Ternus, prévoit des licenciements de faible ampleur et des annulations de projets, citant un rapport Bloomberg, à mesure que les coûts de la mémoire montent. L'article cite l'ancien patron Tim Cook qui, lors de sa dernière conférence de résultats, parlait d'une crue centennale des prix de la mémoire. Il note aussi que SK Hynix, Samsung et Micron ont vendu la quasi-totalité de leur capacité de mémoire IA haut de gamme sur une bonne partie de 2026. Le calcul et la mémoire sont achetés par les mêmes clients.

Le prospectus d'introduction en bourse d'Anthropic, consulté par Reuters et rapporté le 29 septembre, chiffre cet appétit : 7,33 milliards de dollars dépensés en calcul et en infrastructure en 2025, un bond de trois fois par rapport à 2024, soit plus de la moitié des 12,65 milliards de dollars de charges d'exploitation totales, face à 518 milliards de dollars d'engagements prévus en cloud, calcul et infrastructure pour les années à venir. C'est l'engagement à terme d'un seul acheteur, et il dépasse le chiffre d'affaires GPU annuel de la plupart des clouds.

Pendant ce temps, le logiciel continue de gonfler la facture. Artificial Analysis rapportait le 29 septembre que Claude Sonnet 5.5 consomme environ 193 000 tokens de sortie par tâche de l'Intelligence Index à effort maximal, l'usage de tokens le plus lourd que le cabinet dit avoir mesuré, environ 7 fois GPT-6 Astra au maximum. Anthropic l'a facturé au même tarif que Sonnet 5, soit 2/10 dollars par million de tokens en entrée et en sortie. Le coût se loge donc dans le nombre de tokens, pas dans la grille tarifaire, et Artificial Analysis l'estime à 7,60 dollars par tâche, environ 50 % de plus que Sonnet 5.

Le routage est l'autre levier, et il s'automatise. Unblocked décrit le 29 septembre un routeur adaptatif qui note les fournisseurs sur le coût et la vitesse, pondérés 0,7 et 0,3, et déplace le trafic quand l'un se dégrade. Avant lui, le round-robin envoyait 51 % des tâches GLM 5.2 à Fireworks, à des prix 25 % supérieurs à ceux de Baseten. Après un ordre fixe, Baseten en servait 98,5 %. L'entreprise indique qu'un troisième fournisseur, CoreWeave, affichait des prix environ 45 % inférieurs à ceux de Baseten, sans données de performance pour le positionner.

Rien de tout cela ne rend fausse la question AWS contre GCP. Cela en fait la deuxième question. Mesurez d'abord l'utilisation, puis discutez du tarif horaire.

Commentaires 0

Sources

6
  1. 01GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  2. 02Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  3. 03New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  4. 04Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
  5. 05Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  6. 06Routing LLM traffic across inference providers with TCP-style congestion controlEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.