L'IPO d'Anthropic et les licenciements chez Apple montrent le vrai coût de l'inférence
Le prospectus d'Anthropic, que Reuters a pu consulter, aligne 518 000 000 000 de dollars d'engagements d'infrastructure sur une perte nette de 42 000 000 000 de dollars pour 2025. Chez Apple, le nouveau patron réduit les effectifs : les prix de la mémoire pèsent.

Deux histoires sont tombées à un jour d'intervalle. Elles racontent la même pression, vue des deux bouts. Le prospectus d'Anthropic, que Reuters a pu consulter, engage la société sur 518 000 000 000 de dollars d'obligations de cloud, de calcul et d'infrastructure dans les années à venir. Apple, selon un rapport de Bloomberg publié mercredi, prépare des licenciements de petite ampleur et l'annulation de plusieurs projets sous la direction de son nouveau patron, John Ternus.
Les chiffres d'Anthropic figurent dans les documents examinés par Reuters. Le chiffre d'affaires a été multiplié par 12 en 2025, à près de 4 600 000 000 de dollars. La société a perdu plus de 8 000 000 000 de dollars en exploitation et a dépensé 7 330 000 000 de dollars en calcul et en infrastructure l'an dernier, trois fois plus qu'en 2024 et plus de la moitié de ses 12 650 000 000 de dollars de charges d'exploitation totales. Au 31 décembre, elle disposait de 20 280 000 000 de dollars en trésorerie, équivalents et placements à court terme.
La perte n'est pas entièrement en espèces.
Sur une perte nette de près de 42 000 000 000 de dollars, environ 34 000 000 000 relèvent d'une charge comptable liée à la hausse de la valeur estimée de financements convertibles en actions Anthropic. Ce n'est pas de l'argent dépensé pour faire tourner l'activité. Deux clients ont produit près d'un quart du chiffre d'affaires l'an dernier, et le prospectus avertit qu'un grand nombre de gros clients ne sont pas liés par des contrats de long terme.
La mémoire est la contrainte décisive
Le problème d'Apple est plus banal, et pour les acheteurs de matériel d'IA, plus instructif. Fin juillet, la société a publié des prévisions de chiffre d'affaires prudentes : elle ne trouvait pas assez de puces mémoire. Ses marges ont subi la hausse des prix de la mémoire. Lors de sa dernière conférence de résultats, le PDG de l'époque, Tim Cook, a parlé d'une « crue centennale sur les prix de la mémoire, avec des augmentations exponentielles ». Yahoo Finance rapporte que Ternus veut éviter de nouvelles hausses en 2027 si la pénurie se prolonge.
Cette pénurie a une cause : la demande d'inférence et d'entraînement en mémoire à large bande passante et en DRAM avancée. Yahoo Finance note que SK Hynix, Samsung Electronics et Micron ont vendu la quasi-totalité de leurs capacités haut de gamme pour l'IA sur une bonne partie de 2026, avec Nvidia, Microsoft, Amazon et Meta en concurrence pour ces volumes. Les fournisseurs s'attendent à une offre contrainte jusqu'en 2027.
Servir un modèle n'est donc pas qu'une question de logiciel. C'est une question d'allocation de mémoire, et Apple la paie aujourd'hui en effectifs.
Ce que coûte réellement le token
Artificial Analysis a mesuré Claude Sonnet 5.5 d'Anthropic sur son propre indice. Le modèle atteint 56 points, deux de moins qu'Opus 5.5 à effort maximal, au même tarif catalogue que Sonnet 5 : 2 dollars par million de tokens en entrée et 10 dollars par million de tokens en sortie. Le piège est la consommation de tokens. À effort maximal, le modèle a consommé environ 193 000 tokens de sortie par tâche de l'Intelligence Index, le plus lourd que le cabinet ait mesuré. C'est environ 60 % de plus qu'Opus 5.5 au maximum et près de sept fois GPT-6 Astra au maximum. Le coût par tâche s'établit autour de 7,60 dollars, environ 50 % de plus que Sonnet 5.
Un prix au token plus bas ne signifie pas automatiquement des tâches moins chères. C'est pourquoi le routage est devenu une discipline à part entière. Unblocked, qui exploite des charges de travail d'agents, raconte avoir fait circuler son trafic GLM 5.2 entre Baseten, Fireworks et CoreWeave grâce à un routeur adaptatif. Celui-ci choisit un fournisseur par requête selon le coût et la vitesse mesurés. En round-robin, Fireworks a servi 51 % des tâches à des prix 25 % supérieurs à ceux de Baseten. Un ordre fixe a poussé Baseten à 98,5 %. CoreWeave affichait des prix environ 45 % inférieurs à ceux de Baseten, et la société n'avait aucune donnée de performance pour le placer.
La facturation a sa propre arithmétique. Flaviocopes a calculé ce que coûtent 10 000 dollars de ventes mensuelles à 200 commandes de 50 dollars : Stripe prend 350 dollars, Creem 470 dollars, Paddle 600 dollars et Gumroad 1 450 dollars. L'auteur précise que Creem sponsorise le site et affirme avoir vérifié chaque frais sur les pages tarifaires des prestataires le 29 septembre.
Les fabricants de matériel courent après la même courbe
Ultium Cells, la coentreprise de batteries de GM, a annoncé mardi que son usine de Spring Hill, dans le Tennessee, serait la première au monde à produire en série des cellules LMR prismatiques. La société affirme qu'elles offrent une densité énergétique supérieure de 33 % à celle des cellules LFP pour un coût comparable. Les travaux de modernisation commencent plus tard cette année et s'achèveront en 2028, avec 500 emplois à la clé. Le premier véhicule LMR est attendu en 2028.
MaxLinear avance le même argument de coût pour le réseau. Sa puce DOCSIS Puma 9, annoncée le 29 septembre, prend en charge les normes DOCSIS 3.1, 3.1+ et 4.0. Elle réduirait de 30 % à 50 % le coût des équipements chez l'abonné par rapport à la génération précédente, tout en ajoutant la prise en charge du Wi-Fi 8 et des options de mémoire DDR5 alors que l'offre de DDR4 se resserre. Les modems qui l'embarquent sont attendus en 2027.
Deux notes d'ingénierie plus discrètes vont dans le même sens. Bitdrift a publié blob-stream, une alternative à Kafka conçue pour éliminer le trafic réseau entre zones de disponibilité et les courtiers sans état. L'argument : les coûts inter-AZ dominent les factures de streaming cloud. Radim Marek a comparé REPACK (CONCURRENTLY) de PostgreSQL 19 à pg_repack et pg_squeeze sur un Hetzner ccx33 et un GCE n2-standard-4. La réécriture en ligne a généré 18,8 Go de WAL, contre 33,5 Go pour pg_repack sur la même table.
Rien de tout cela ne rend l'inférence bon marché. Cela rend la facture lisible, ce qui est autre chose.
Sources
10- 01Anthropic's IPO prospectus shows AI vision, surging costs: ReutersEN
- 02New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
- 03Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 04Routing LLM traffic across inference providers with TCP-style congestion controlEN
- 05What $10k a month in sales costs you on each payment providerEN
- 06GM's new EV battery tech will cut costs without sacrificing performance or rangeEN
- 07MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
- 08Announcing blob-stream: a Kafka alternative for no fuss, low cost high volume streamingEN
- 09What REPACK (CONCURRENTLY) costs while it runsEN
- 10Anthropic IPO prospectus reveals surging costs, $42B 2025 net loss: reportEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.