Qu'est-ce qu'un accélérateur IA ? Dans les puces qui font tourner l'inférence en datacenter
Les accélérateurs IA sont ces puces spécialisées installées à côté des processeurs classiques dans les baies des datacenters. Ce sont elles qui font les multiplications matricielles des chatbots et des générateurs d'images. Leur fabrication, et les entreprises capables de les produire, est plus intéressante que les sigles ne le laissent croire.

Chaque grand modèle de langage que vous avez utilisé a presque certainement tourné sur une puce qui n'est pas un processeur. Un accélérateur : du silicium conçu pour faire très vite un seul type d'arithmétique, la multiplication matricielle. Le reste de la machine n'existe que pour l'alimenter. Cette division du travail explique l'essentiel de l'agitation récente sur le marché des datacenters. Elle explique aussi pourquoi des entreprises qui vendaient des cœurs de processeur, de la mémoire ou du packaging se disputent désormais sur les teraFLOPS, la bande passante mémoire et le nombre de bancs qui tiennent sur une puce DRAM.
Le bloc de base, et pourquoi SiFive en vend un aujourd'hui
SiFive a passé des années à licencier des cœurs RISC-V que d'autres entreprises greffaient sur leurs propres moteurs d'IA. Selon The Register, au moins une partie des tensor processing units de Google utilise les cœurs X280 de SiFive pour piloter les accélérateurs d'apprentissage automatique et alimenter leurs unités de multiplication matricielle. Les conceptions de SiFive servent aussi de base aux cœurs de processeur de l'accélérateur Blackhole de Tenstorrent, a déclaré à la publication John Ronco, SVP et GM de SiFive UK.
En septembre 2024, l'entreprise a changé de position. Elle a annoncé la série Intelligence XM, un cluster d'accélérateurs IA licenciable, et non plus seulement la partie processeur. Le cluster de base contient quatre cœurs RISC-V Intelligence X reliés à un moteur de calcul matriciel maison. Chaque cluster supporte jusqu'à 1TB/sec de bande passante mémoire. Selon The Register, il devrait délivrer jusqu'à 16 TOPS en INT8 ou 8 teraFLOPS en BF16 par gigahertz.
"Pour certains clients, faire leur propre matériel reste la bonne solution", a déclaré Ronco. "Mais pour d'autres, ils voulaient davantage une offre clé en main de la part de SiFive."
Ce chiffre par gigahertz paraît étrange au premier abord. C'est un bloc de construction, pas une puce. The Register note que SiFive s'attend à ce que la plupart des puces fondées sur cette conception tournent autour de 1GHz, et que Ronco prévoit quatre à huit clusters par puce. À huit clusters et 1GHz, cela fait jusqu'à 64 teraFLOPS en BF16. La présentation produit suggère que 512 clusters sont possibles. D'après les calculs de The Register, on atteindrait alors environ quatre petaFLOPS de calcul matriciel BF16, au-dessus des 2,5 petaFLOPS que Nvidia annonce pour ses GPU Blackwell les mieux dotés. Ces chiffres sont théoriques. La performance réelle dépend de la fréquence, du budget d'énergie et de refroidissement, du nœud de gravure et de ce qui partage la puce. SiFive indique aussi qu'elle publiera une implémentation de référence open source de sa SiFive Kernel Library pour abaisser la barrière à l'adoption de RISC-V.
L'inférence est un problème de mémoire avant d'être un problème de calcul
Les fabricants d'accélérateurs parlent moins de calcul brut et davantage de mémoire, car c'est là que l'inférence ralentit réellement. d-Matrix a profité de sa présentation à Hot Chips 2026 pour poser l'arithmétique : les poids des modèles ne cessent de grossir, et le cache KV évolue avec la longueur de contexte multipliée par la taille du lot. ServeTheHome rapporte l'exemple de d-Matrix : 64 utilisateurs à 1M de contexte produisent environ 935GB de cache KV. La capacité et la bande passante deviennent toutes deux des problèmes, et toutes deux continuent de croître.
La SRAM atteint la cible de bande passante mais ne retient presque rien, environ 4GB pour une paire de cartes Corsair à environ 300 TB/s et 1ns de latence, selon ServeTheHome. Une cellule SRAM 6T est environ 10 fois plus grande qu'une cellule DRAM. La HBM résout la capacité mais bute sur un plafond pratique de bande passante autour de 20 TB/s pour les packages HBM4 comme le Vera Rubin de Nvidia et l'Instinct MI455 d'AMD. La bande passante HBM a en plus un coût énergétique : à 2,4 pJ/bit, pousser 100 TB/s à travers la HBM consomme environ 1,92 kW avant le trafic de fabric.
La réponse de d-Matrix consiste à empiler le calcul directement sur les puces DRAM. L'entreprise affirme qu'un empilement 1-Hi logic-on-top à pas plus de 0,5 W/mm2 peut être refroidi par liquide et maintenir la DRAM sous 100C. L'IO vertical 3D descend autour de 0,3 à 0,4 pJ, environ 10 fois moins que la HBM. Son implémentation Raptor place une puce logique TSMC N4 sur une puce DRAM 3D avec un empilement face-à-face de 36um. Une montée en échelle de 72 cartes est dimensionnée pour héberger un modèle de frontière comme Kimi K3 à 1M de contexte, avec 32GB par carte en poids 4 bits et un cache KV 8 bits. Ce détail d'ingénierie compte : il montre à quel point la conception d'un accélérateur porte désormais sur le déplacement des données plutôt que sur les unités multiply-accumulate. La puce de d-Matrix compte 840 bancs, 768 après redondance, répartis sur 256 canaux, soit 3 bancs par canal. Livrer un flit de 128B depuis des bancs de 32B demande donc deux accès et récupère 192B, ce qui gaspille environ 33 pour cent de la bande passante près de 33 TB/s. Le stream blocking récupère cette bande passante en partageant un accès partiel de 32B entre trois flits.
Le packaging, pas seulement le silicium
Une seconde contrainte n'a rien à voir avec la conception des puces. Tom's Hardware rapportait en mars 2026 que Nittobo, une entreprise japonaise, contrôle environ 90 pour cent de l'offre mondiale de T-glass, un tissu de fibre de verre à faible CTE utilisé dans le cœur organique des substrats de circuits intégrés. Chaque package de puce IA avancée en contient. La demande dépasse l'offre.
Les chiffres sont bruts. Nittobo triple la capacité de son usine de Fukushima, mais la nouvelle offre n'arrivera pas sur le marché avant mi-2027. Les prix ont augmenté de 20 à 30 pour cent, et les délais pour les matériaux en aval comme les laminés cuivrés sont passés des 8 à 10 semaines habituelles à plus de 20. Selon des données de Nvidia citées par Tom's Hardware, les tailles d'interposeur sont passées de 814mm2 pour Hopper à 1 700mm2 pour Blackwell, une hausse de 109 pour cent, Rubin et Feynman montant encore en échelle.
"Avec une offre de T-glass encore plus contrainte aujourd'hui, les fournisseurs ne donnent même plus de délais", a déclaré Bill Ho, analyste chez Yuanta.
Nittobo double la capacité de fil brut de son usine taïwanaise et a conclu un accord de collaboration avec Nanya Plastics pour externaliser une partie du tissage. D'ici 2027, environ 20 pour cent du tissu de verre de Nittobo devrait être tissé par Nanya, selon Tom's Hardware. Bank of America estime que le segment des matériaux électroniques de Nittobo verra ses ventes presque doubler, de 40,9 milliards de yens en 2025 à 87,7 milliards de yens d'ici mars 2028, avec des marges opérationnelles proches de 48 pour cent.
Qui livre réellement
Pendant que tout cela se discute, certaines jeunes entreprises mettent du silicium devant un public. Rebellions a montré son accélérateur REBEL-Quad en fonctionnement à Hot Chips 2025, selon ServeTheHome : quatre ASIC de calcul, quatre sites HBM3E pour 144GB de mémoire, construits sur Samsung SF4X et CoWoS-S, avec UCIe-A comme interconnexion de chiplets et une double interface PCIe Gen5 x16. L'entreprise a fait tourner une démo live de Llama 3.3 70B sur une carte de développement à 35,5 msec en moyenne par token de sortie. ServeTheHome notait que beaucoup d'entreprises d'accélérateurs n'arrivent jamais jusqu'à une démo publique en fonctionnement.
Côté client, Draw Things a rapporté que Metal FlashAttention v2.5 avec Neural Accelerators offre jusqu'à 4,6 fois de meilleures performances sur les M5 d'Apple que sur les M4, avec des améliorations brutes de 3,6 à 5,5 fois et des gains de bout en bout de 3,3 à 4,6 fois sur un iPad M5. Le logiciel est une preview : le support BF16 a d'abord été désactivé en raison de bugs non résolus et les shaders prennent plus de temps à se spécialiser. Les mesures ont été prises avec un ice pad sous l'iPad pour un refroidissement maximal, ce qui en dit autant sur la marge thermique que sur la puce.
Rien de tout cela ne tranche quelle architecture l'emporte. Cela montre en revanche que l'accélérateur de datacenter n'est plus une catégorie de produit unique. C'est un empilement de cœurs de processeur, de moteurs matriciels, de technologies mémoire, de matériaux de packaging et de bibliothèques logicielles, chacun avec son propre goulot d'étranglement et ses propres délais.
Sources
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.