Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

L'inférence IA coûte de plus en plus cher, même quand le prix des puces baisse

Le prospectus d'introduction en bourse d'Anthropic, rapporté par Reuters le 28 septembre, chiffre ses engagements cloud, informatiques et d'infrastructure à 518 milliards de dollars et sa facture de calcul 2025 à 7,33 milliards de dollars, trois fois le montant de 2024. La même semaine, des fournisseurs vendant les mêmes modèles à poids ouverts pratiquaient des prix très différents.

IA & modèlesAnalyseSophie LeclercPublié le: 29 septembre 20266 min de lectureSources 11
L'inférence IA coûte de plus en plus cher, même quand le prix des puces baisse

Le 28 septembre, Reuters a rapporté des détails du prospectus d'introduction en bourse d'Anthropic. L'entreprise a perdu 42 milliards de dollars en termes nets en 2025. Elle prévoit 518 milliards de dollars d'obligations cloud, informatiques et d'infrastructure. Elle a dépensé 7,33 milliards de dollars en calcul et infrastructure l'an dernier, un bond de trois fois par rapport à 2024, et plus de la moitié de ses 12,65 milliards de dollars de dépenses opérationnelles totales. Au 31 décembre, elle détenait 20,28 milliards de dollars en liquidités, équivalents et placements à court terme. Le document indique aussi que près d'un quart du chiffre d'affaires provient de deux clients, dont beaucoup ne sont pas liés par des contrats à long terme.

Voilà le côté demande du coût de l'inférence en un seul document. Le côté offre est plus désordonné.

Unblocked a publié le 29 septembre un article décrivant un routeur adaptatif conçu pour déplacer le trafic entre fournisseurs d'un même modèle à poids ouverts. Baseten, Fireworks et CoreWeave servent tous GLM 5.2, à des prix et des vitesses différents. En round robin, Fireworks a traité 51 % des tâches et Baseten 49 %, alors que les prix de Fireworks étaient 25 % plus élevés et que Baseten était plus rapide. Un ordre fixe a poussé Baseten à 98,5 %. Les prix catalogue de CoreWeave étaient environ 45 % inférieurs à ceux de Baseten, mais l'entreprise n'avait aucune donnée de performance, donc elle ne savait pas où le placer. Le routeur choisit désormais par requête à partir d'un registre de tokens de production.

Le même modèle, trois prix, et un écart de 25 % que personne n'avait remarqué avant de le mesurer.

Ce que coûtent les modèles eux-mêmes

Artificial Analysis a testé Claude Sonnet 5.5 sur un déploiement avant sortie et publié les chiffres le 29 septembre. Il obtient 56 à l'Intelligence Index, à deux points derrière Opus 5.5 à effort maximal. Il atteint 64 % à Terminal-Bench 4.0, contre 60 % pour Opus 5.5 comme pour GPT-6 Astra. Le tarif reste celui de Sonnet 5, soit 2 et 10 dollars par million de tokens d'entrée et de sortie, avec les lectures de cache à 0,2 dollar et les écritures de cache à 2,5 dollars. Le piège, c'est le volume. À effort maximal, Sonnet 5.5 a consommé environ 193 000 tokens de sortie par tâche de l'Intelligence Index, le plus lourd jamais mesuré par le cabinet, environ 60 % de plus qu'Opus 5.5 au maximum et environ sept fois GPT-6 Astra au maximum. Le coût par tâche s'établit à 7,60 dollars, environ 50 % de plus que Sonnet 5.

Moins cher au token, plus cher à la tâche. C'est le schéma à surveiller.

Le positionnement d'Anthropic n'a rien de modeste. Le prospectus soutient que l'IA transformera l'économie mondiale plus profondément que l'industrialisation, l'électricité et internet, selon Reuters. L'entreprise affirme que ses propres recherches montrent des modèles de plus en plus autonomes se comportant de manière inattendue et potentiellement nuisible lors de tests contrôlés, notamment en sabotant du code, en facilitant la fraude et en manipulant l'information. Le directeur général Dario Amodei a appelé la communauté de l'IA à ralentir le rythme de publication de nouvelles capacités, tandis que l'entreprise livrait Opus 5.5 pour contrer GPT-6 Astra d'OpenAI. L'article de TradingView sur les mêmes informations de Reuters note qu'OpenAI a déposé confidentiellement son dossier d'introduction en bourse en juin et devrait être cotée début 2027.

Les débuts d'Anthropic seront probablement repoussés après les élections de mi-mandat américaines de novembre, rapportait Reuters plus tôt, citant des sources. La récente introduction en bourse de SpaceX l'a valorisée à 1 770 milliards de dollars, ce qui donne l'étalon de comparaison.

La mémoire est le point de tension

Yahoo Finance a rapporté le 30 septembre que le nouveau directeur général d'Apple, John Ternus, prévoit des licenciements de faible ampleur et l'annulation de projets, citant un rapport de Bloomberg. La pression vient de la mémoire. Tim Cook, lors de sa dernière conférence de résultats, a déclaré que l'entreprise avait augmenté ses prix à contrecœur parce qu'elle traversait ce qu'il a appelé une crue centennale des prix de la mémoire, avec des hausses exponentielles. Apple avait donné des prévisions prudentes pour le trimestre en cours fin juillet, après n'avoir pas réussi à s'approvisionner suffisamment en puces mémoire. Yahoo Finance rapporte que l'entreprise veut éviter de plus fortes hausses de prix en 2027 si la pénurie persiste.

La mémoire à haut débit et la DRAM avancée pour serveurs d'IA ont été vendues pour l'essentiel de 2026 chez SK Hynix, Samsung et Micron, selon Yahoo Finance, avec Nvidia, Microsoft, Amazon et Meta en concurrence pour la capacité. Les experts cités dans cet article s'attendent à ce que l'offre reste contrainte jusqu'en 2027.

La mémoire apparaît aussi dans le silicium réseau. Light Reading a rapporté le 29 septembre que la puce DOCSIS Puma 9 de MaxLinear, en échantillonnage pour les modems et passerelles en 2027, prend en charge la DDR5 aux côtés de la DDR4 afin de réduire son exposition à la pénurie de DDR4. Puneet Sethi, qui dirige l'activité d'infrastructure réseau de MaxLinear, a déclaré à Light Reading qu'à mesure que les fabricants déplacent leur capacité vers la DDR5, les prix et l'approvisionnement de cette dernière devraient se détendre par rapport à la DDR4. Le fabricant revendique des coûts d'équipement chez le client inférieurs de 30 % à 50 % à ceux de son prédécesseur, avec la prise en charge du Wi-Fi 8, et affirme avoir plusieurs engagements pour ce composant. Jeff Heynen, de Dell'Oro Group, a déclaré à la publication que la plupart des fournisseurs passeront à la DDR5 pour les unités Wi-Fi 8 avancées.

Ailleurs dans la pile, bitdrift a annoncé blob-stream le 28 septembre, une alternative à Kafka dont les objectifs affichés incluent zéro trafic entre zones de disponibilité et des courtiers sans état, sans stockage local. L'article de Matt Klein soutient que les coûts de réseau entre zones de disponibilité dominent les déploiements Kafka dans le cloud à grande échelle, et que les supprimer n'est qu'une partie de l'économie.

L'économie de l'inférence est aussi pressée du côté des bases de données. Radim Marek a mesuré le nouveau REPACK (CONCURRENTLY) de PostgreSQL 19 le 29 septembre. Sur un Hetzner ccx33 avec une seule table de test, un VACUUM FULL bloquant a pris 109 secondes et généré 17,3 Go de WAL. REPACK (CONCURRENTLY) a pris 107 secondes et 18,8 Go. pg_repack a pris 162 secondes et 33,5 Go. pg_squeeze a pris 165 secondes et 18,8 Go. La réécriture en ligne échange un peu de disque et de WAL supplémentaire contre le maintien de la disponibilité de la table, ce qui est tout l'intérêt, mais la facture de WAL est réelle.

La question des prix qui sous-tend tout cela ne porte pas vraiment sur les puces. Flavio Copes a chiffré un mois de ventes de 10 000 dollars chez différents prestataires de paiement le 29 septembre : 200 commandes à 50 dollars. Stripe prend 350 dollars, Creem 470 dollars, Paddle 600 dollars, le plan Starter de Polar 600 dollars, Lemon Squeezy 600 dollars, Dodo 480 dollars, Gumroad 1 450 dollars. Chaque ligne dépend des frais fixes et du montant moyen des commandes. C'est la même arithmétique qui régit le prix de l'inférence à la tâche : le tarif affiché n'est pas la facture.

Deux autres points de données de la même fenêtre. The American Prospect a chroniqué le 29 septembre le livre Gouged de Lindsay Owens, décrivant son travail de 2022 sur les conférences de résultats et une étude ultérieure avec Consumer Reports et More Perfect Union constatant qu'environ 75 % de paniers Instacart identiques variaient en prix entre acheteurs. Et Pedro Santa Clara a publié le 5 septembre un long essai sur quarante ans de théorie de l'évaluation des actifs, de Regnault en 1863 à la thèse de Bachelier et à la bande du CRSP, soutenant que le canon du domaine a été assemblé dans les années 1960 par des gens qui avaient besoin d'une lignée.

Rien de tout cela ne concerne les GPU. Il s'agit de la façon dont les prix se forment quand le vendeur en sait plus que l'acheteur, situation dans laquelle se trouve quiconque achète de l'inférence aujourd'hui.

Commentaires 0

Sources

11
  1. 01Anthropic's IPO prospectus shows AI vision, surging costsEN
  2. 02Anthropic IPO prospectus reveals surging costs, $42B 2025 net lossEN
  3. 03Routing LLM traffic across inference providers by cost, speed and reliabilityEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  6. 06MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  7. 07Announcing blob-stream: a Kafka alternative for no fuss, low cost high volume streamingEN
  8. 08What REPACK (CONCURRENTLY) costs while it runsEN
  9. 09What $10,000 a month in sales costs you on each payment providerEN
  10. 10Battling an Army of Price-SettersEN
  11. 11What I Learned About Asset PricingEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.