L'économie de l'inférence bascule : la facture de calcul de 7,33 milliards de dollars d'Anthropic face à la consommation de tokens de Sonnet 5.5
Le prospectus d'introduction en bourse d'Anthropic, consulté par Reuters, montre que l'entreprise a dépensé 7,33 milliards de dollars en calcul et en infrastructures en 2025, trois fois plus qu'en 2024. Dans le même temps, l'un de ses modèles les plus récents consomme plus de tokens de sortie par tâche que tout ce qu'Artificial Analysis a mesuré jusqu'ici.

Le 29 septembre, Artificial Analysis a publié une évaluation de Claude Sonnet 5.5, le modèle d'Anthropic. Au niveau d'effort maximal, il utilise environ 193 000 tokens de sortie par tâche de l'Intelligence Index. C'est la consommation la plus élevée jamais enregistrée par le cabinet, environ sept fois celle de GPT-6 Astra au même niveau d'effort. Il s'agit d'une mesure, pas d'un tour de financement ni du lancement d'une puce, et elle tombe le même jour que la plus grosse divulgation de coûts de l'année dans le secteur.
Le prospectus d'introduction en bourse d'Anthropic, révélé par Reuters et repris par CNBC et TradingView les 28 et 29 septembre, montre que l'entreprise a dépensé 7,33 milliards de dollars en calcul et en infrastructures l'an dernier, plus de la moitié de ses 12,65 milliards de dollars de charges d'exploitation totales. Elle prévoit aussi 518 milliards de dollars d'engagements liés au cloud, au calcul et aux infrastructures dans les années à venir. Les prix par token sont devenus la façon standard de comparer les modèles. Artificial Analysis note qu'Anthropic a fixé le prix de Sonnet 5.5 à l'identique de celui de Sonnet 5, soit 2 dollars par million de tokens d'entrée et 10 dollars par million de tokens de sortie, comme GPT-6 Sol. La même évaluation indique que le modèle coûte environ 7,60 dollars par tâche, soit à peu près 50 % de plus que le coût par tâche de Sonnet 5, simplement parce qu'il émet davantage de tokens pour atteindre des scores comparables.
La consommation de tokens, cette variable de coût que personne n'affiche au comptoir
Au niveau d'effort maximal, où il atteint des performances proches de celles d'Opus 5.5, Claude Sonnet 5.5 a utilisé environ 193 000 tokens de sortie par tâche de l'Intelligence Index. C'est la consommation de tokens la plus élevée que nous ayons mesurée.
Artificial Analysis signale aussi une réserve : les évaluations ont tourné sur un déploiement de préversion comportant un bug touchant les sorties structurées, corrigé pour la version publique, et le cabinet compte relancer les tests concernés. Sonnet 5.5 atteint 56 sur l'Intelligence Index, à deux points derrière Opus 5.5 à effort maximal, et obtient 64 % sur Terminal-Bench 4.0 contre 60 % pour Opus 5.5 et GPT-6 Astra.
Pendant ce temps, la facture pour servir ce trafic continue d'aller dans une seule direction. Selon un billet publié sur getunblocked.com le 29 septembre, l'entreprise route le trafic de son modèle à poids ouverts GLM 5.2 entre Baseten, Fireworks et CoreWeave. Elle a constaté que les tarifs catalogue de CoreWeave étaient environ 45 % inférieurs à ceux de Baseten. Son routeur adaptatif pondère le coût à 0,7 et la vitesse à 0,3, en partant du principe que le modèle est identique quel que soit le fournisseur qui le sert. Le billet ne cache rien de la configuration précédente : une répartition en tourniquet envoyait 51 % des tâches à Fireworks, à des prix 25 % plus élevés que ceux de Baseten, sans aucun bénéfice.
La mémoire, voilà où va l'argent
Du côté du matériel, la pression n'a pas faibli. Yahoo Finance rapportait le 30 septembre que le nouveau patron d'Apple, John Ternus, prépare des licenciements de faible ampleur au sein de grandes équipes et annule des projets, citant un rapport de Bloomberg, alors que les coûts de mémoire mordent. L'article cite le PDG sortant d'Apple, Tim Cook, lors de sa dernière conférence de résultats, décrivant ce qu'il a appelé une crue centennale des prix de la mémoire, avec des hausses exponentielles. Apple avait déjà publié fin juillet des prévisions de revenus prudentes, faute de puces mémoire en quantité suffisante.
Le même article note que SK Hynix, Samsung Electronics et Micron ont largement vendu la totalité de leur capacité de mémoire haut de gamme pour l'IA sur une bonne partie de 2026, tandis que Nvidia, Microsoft, Amazon et Meta construisent leurs infrastructures d'IA. L'offre devrait rester contrainte jusqu'en 2027. C'est la toile de fond contre laquelle il faut désormais lire toute projection de coût d'inférence : la question n'est pas seulement de savoir combien de tokens un modèle émet, mais combien coûte la mémoire à l'intérieur du cluster qui le sert.
Le dossier déposé par Anthropic, tel que rapporté par Reuters, pose le versant demande sans détour. Le chiffre d'affaires a été multiplié par douze en 2025 pour atteindre près de 4,6 milliards de dollars, mais l'entreprise affiche une perte nette de 42 milliards de dollars, dont une charge comptable d'environ 34 milliards de dollars liée à la valeur estimée croissante d'un financement convertible en actions. Elle avertit aussi que près d'un quart du chiffre d'affaires provient de deux clients, et que beaucoup de ses plus gros clients ne sont pas liés par des contrats de long terme.
Une question de prix sans réponse propre
L'écart entre les prix affichés par token et le coût réel par tâche n'est pas un détail comptable. Artificial Analysis place Sonnet 5.5 hors de la frontière de Pareto entre intelligence et coût par tâche. Les réglages d'effort plus faibles restent derrière des configurations GPT-6 Sol qui offrent des performances équivalentes avec moins de tokens de sortie. Le réglage d'effort élevé est décrit comme très légèrement derrière GPT-6 Sol en intelligence, pour un coût par tâche pratiquement identique.
D'autres sources du dossier vont dans le même sens, même si elles ne portent pas directement sur l'inférence. Un billet du 29 septembre sur flaviocopes.com compare les frais des prestataires de paiement sur un mois à 10 000 dollars. Les taux effectifs se situent entre 3,5 % et 6 % pour tout le monde, sauf Gumroad à 14,5 %. Rappel utile : la comparaison des prix apparents dépend beaucoup de l'unité choisie. Des frais fixes de 0,40 dollar représentent 0,8 % d'une commande de 50 dollars et 4 % d'une commande de 10 dollars.
Savoir si la tarification de l'inférence suit le même schéma reste la question ouverte. Le prospectus d'Anthropic décrit une entreprise qui parie que l'échelle finira par plier la courbe des coûts, alors que ses propres sorties de modèles rendent les tâches plus chères à servir. L'introduction en bourse devrait être repoussée après les élections de mi-mandat de novembre aux États-Unis, rapportait Reuters, citant des sources, avec une valorisation attendue supérieure à 2 000 milliards de dollars, plus du double de sa propre estimation de 965 milliards de dollars en mai.
Les investisseurs qui évalueront ce chiffre devront peser deux documents publiés à un jour d'intervalle : un prospectus affichant 518 milliards de dollars d'engagements d'infrastructure à venir, et un benchmark montrant que le nouveau modèle intermédiaire de l'entreprise consomme plus de tokens de sortie que tout ce qui avait été mesuré auparavant. Pris isolément, aucun des deux n'est fatal. Ensemble, ils posent la question que le secteur de l'IA évite depuis deux ans : combien coûte réellement une tâche menée à bien.
Sources
6- 01Anthropic's IPO prospectus shows AI vision, surging costs | ReutersEN
- 02Anthropic IPO prospectus reveals surging costs, $42B 2025 net lossEN
- 03Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 04Routing LLM traffic across inference providers with TCP-style congestion controlEN
- 05Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
- 06What $10k a month in sales costs you on each payment providerEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.