Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les prix des GPU montent, les tarifs cloud baissent : le vrai coût de l'inférence

Le prospectus d'introduction en Bourse d'Anthropic, rapporté par Reuters le 28 septembre, affiche 518 milliards de dollars d'engagements à venir dans le cloud et le calcul, pour une perte nette de 42 milliards en 2025. Les tarifs publiés cette semaine montrent que c'est le second chiffre qu'il faut regarder de près.

IA & modèlesExpliquéSophie LeclercPublié le: 29 septembre 20263 min de lectureSources 7
Les prix des GPU montent, les tarifs cloud baissent : le vrai coût de l'inférence

Les tarifs affichés ne disent pas où part l'argent. Meetrix a comparé AWS et GCP, prix relevés le 28 septembre : un H100 à la demande coûte 6,88 dollars l'heure sur AWS, contre 10,98 dollars sur GCP. L'écart de 37 % est réel. Il reste plus petit que celui obtenu avec la même carte à un quart de charge. Sur la base du débit de référence de 2 500 tokens par seconde retenu par Meetrix, le million de tokens revient à 0,76 dollar quand le GPU tourne à plein, et à 3,06 dollars à 25 % d'utilisation.

Tout l'argument tient en une phrase. Le silicium qui ne fait rien coûte plus cher que n'importe quel choix de fournisseur.

GPUAdvisor suit 14 fournisseurs et indique avoir arrêté ses données au 1er octobre. Sur les cartes plus anciennes, les clouds spécialisés passent nettement sous les hyperscalers : une A4000 à 0,15 dollar l'heure GPU chez Hyperstack, une L40S à 0,38 dollar chez Lium, une RTX 4090 à 0,40 dollar. Le site présente ces chiffres comme des approximations et invite les acheteurs à vérifier les tarifs sur la page du fournisseur. La prudence est de mise, car cette même page affiche une RTX 4090 à 0,74 dollar chez RunPod. Deux prix, le même modèle, presque du simple au double.

La facture en tokens, encore un autre chiffre

Artificial Analysis a publié le 29 septembre son évaluation de Claude Sonnet 5.5 d'Anthropic. Le modèle atteint 56 sur son Intelligence Index, deux points derrière Opus 5.5 à effort maximal, mais consomme environ 193 000 tokens de sortie par tâche. C'est à peu près 60 % de plus qu'Opus 5.5, et environ sept fois GPT-6 Astra à effort maximal, selon le laboratoire. Anthropic n'a pas touché à ses tarifs : 2 dollars par million de tokens d'entrée, 10 dollars par million de tokens de sortie. Le coût par tâche grimpe pourtant à 7,60 dollars, soit environ 50 % de plus que Sonnet 5.

Même grille tarifaire. Facture différente. Ce sont les tokens qui font la différence.

AI Pricing Guru actualise ses tarifs chaque jour, dernière mise à jour le 1er octobre. Pour les API généralistes, la fourchette utilisable va de 0,50 à 15 dollars par million de tokens de sortie. L'entrée coûte généralement deux à huit fois moins cher, et la mise en cache des entrées retire encore 75 % à 90 % quand le fournisseur la propose. Son calculateur suit 154 modèles actifs chez plus de 10 fournisseurs.

La recherche documentaire change l'arithmétique avant même que la génération démarre. Spheron a publié le 29 septembre un détail des coûts : une configuration RAG standard qui extrait cinq segments de 500 tokens ajoute 2 500 tokens de contexte par requête. Une question qui coûterait 100 à 200 tokens d'entrée en simple conversation peut donc coûter 15 à 20 fois plus cher du côté de l'entrée.

Unblocked a décrit le 29 septembre son propre travail de routage. Le trafic de GLM 5.2 circule entre Baseten, Fireworks et CoreWeave selon un score pondéré à 70 % sur le coût et à 30 % sur la latence. Sur un ordre fixe favorisant Baseten, ce fournisseur a servi 98,5 % des tâches lors de la première semaine complète. L'entreprise indique que les tarifs catalogue de CoreWeave étaient environ 45 % inférieurs à ceux de Baseten, sans données de performance permettant de le classer. Voilà où en est l'achat : l'option la moins chère est souvent celle que personne n'a mesurée.

Commentaires 0

Sources

7
  1. 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05AI Token Cost Calculator 2026: 154 Models by TierEN
  6. 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
  7. 07Routing LLM traffic across inference providers with TCP-style congestion controlEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.