Accélérateurs IA : la bataille des centres de données se joue dans le conditionnement
Les fabricants d'accélérateurs IA repensent la façon dont le calcul dialogue avec la mémoire. Le vrai goulot d'étranglement est plus en amont : un fabricant japonais de tissu de fibre de verre fournit environ 90 % d'un matériau dont chaque boîtier avancé a besoin, et les nouvelles capacités n'arriveront pas avant la mi-2027.

En 2026, toute discussion sur les accélérateurs IA bute sur le même mur : la bande passante mémoire. Le calcul coûte cher, mais il est disponible. C'est le va-et-vient des poids et du cache KV entre la mémoire et les cœurs qui décide du budget énergétique, de la taille du boîtier et de la date de livraison. Voilà pourquoi SiFive, d-Matrix et Rebellions ont tous présenté cette saison des conceptions qui attaquent l'interface mémoire plutôt que la matrice de multiplication-addition.
The Register a rapporté le 19 septembre 2024 que SiFive, longtemps fournisseur de cœurs CPU RISC-V pour le silicium IA d'autres entreprises, s'est mis à licencier son propre accélérateur. Le cluster Intelligence XM associe quatre cœurs RISC-V Intelligence X à un moteur de calcul matriciel maison. Chaque cluster supporte jusqu'à 1 To/s de bande passante mémoire et est annoncé à jusqu'à 16 TOPS en INT8 ou 8 téraFLOPS en BF16 par gigahertz. John Ronco, de SiFive, a déclaré à la publication que la plupart des puces construites sur cette conception utiliseront quatre à huit clusters. Soit entre 4 et 8 To/s de bande passante mémoire en pointe et jusqu'à 32 à 64 téraFLOPS de BF16 à 1 GHz.
Ces chiffres restent modestes face à un Nvidia H100.
Le plus intéressant est de savoir à qui SiFive vend. Ronco a indiqué que certains clients veulent toujours construire leur propre matériel, mais que d'autres préfèrent une offre clé en main. SiFive ne vise ni Google ni Tenstorrent, qui conçoivent déjà leurs propres accélérateurs. Elle vise des organisations qui veulent un bloc prêt à l'emploi à personnaliser et à envoyer en fonderie.
Le plafond reste flou : Ronco s'est montré hésitant sur l'échelle maximale de la conception, même si les diapositives produit suggèrent que 512 clusters XM sont envisageables. À une fréquence de 1 GHz, cela représenterait environ quatre pétaFLOPS de calcul matriciel BF16, contre 2,5 pétaFLOPS pour les GPU Blackwell les plus musclés de Nvidia. SiFive a aussi annoncé qu'elle proposerait une implémentation de référence open source de sa SiFive Kernel Library.
Empiler la DRAM sur la puce logique
La couverture du Hot Chips 2026 par ServeTheHome décrit une autre voie, celle de d-Matrix : placer la logique directement au-dessus de la DRAM. La conception Raptor de l'entreprise empile une puce logique TSMC N4 sur une puce DRAM 3D par empilement face à face de 36 microns. d-Matrix soutient que la SRAM atteint la cible de bande passante, environ 300 To/s pour une latence d'environ 1 ns sur une paire de cartes accélératrices Corsair SRAM, mais ne stocke qu'environ 4 Go. Et qu'une cellule SRAM 6T est environ dix fois plus grande qu'une cellule DRAM. La HBM résout le problème de capacité, mais d-Matrix cite un plafond pratique de bande passante autour de 20 To/s pour les boîtiers HBM4 tels que Nvidia Vera Rubin et AMD Instinct MI455.
La consommation en est la raison. À 2,4 pJ/bit, pousser 100 To/s à travers de la HBM consomme environ 1,92 kW avant même de compter le trafic de fabric. L'IO vertical 3D, à l'inverse, descend à environ 0,3 à 0,4 pJ, environ dix fois moins que la HBM, parce qu'il s'agit d'un chemin millimétrique sans PHY plutôt que d'une route d'interposeur centimétrique. Le compromis est thermique : d-Matrix indique qu'un empilement logique-sur-DRAM 1-Hi à pas plus de 0,5 W/mm2 peut être refroidi par liquide tout en maintenant la DRAM sous 100 °C.
Le détail d'ingénierie est ce qui rend ces affirmations vérifiables. Chaque moteur tensoriel a besoin d'un flit de 128 o par accès. Avec 32 o livrés par accès colonne depuis des bancs de 32 o, cela implique quatre bancs par canal. La puce de d-Matrix compte 840 bancs, 768 après 72 de réserve, répartis sur 256 canaux : trois bancs par canal. Un accès renvoie 96 o, donc livrer un flit de 128 o demande deux accès et récupère 192 o, gaspillant environ 33 % de bande passante près de 33 To/s. La solution de d-Matrix, le stream blocking, partage un accès partiel de 32 o entre trois flits, de sorte que quatre accès à 96 o alimentent trois flits à 128 o. La surlecture tombe à zéro. Une seconde astuce, le stream flipping, inverse chaque flit par rapport au précédent pour réduire les basculements. Elle récupère environ 20 % de la puissance d'E/S sans la broche de sideband qu'exige l'inversion de bus de données classique.
À 32 Go par carte, avec des poids 4 bits et un cache KV 8 bits, d-Matrix dimensionne une grappe de 72 cartes pour héberger un modèle de frontière comme Kimi K3 à 1 M de contexte. ServeTheHome note que l'entreprise a présenté ces travaux au Hot Chips 2026.
UCIe atteint une carte en fonctionnement
Rebellions a montré quelque chose de plus rare qu'une diapositive : du silicium qui tourne. ServeTheHome a rapporté le 25 août 2025 que le Rebellions REBEL-Quad a été démontré au Hot Chips 2025 sur une carte de développement faisant tourner Llama 3.3 70B à 35,5 ms en moyenne par token de sortie. Le boîtier est construit sur Samsung SF4X et CoWoS-S, avec quatre ASIC de calcul, quatre sites HBM3E pour 144 Go de mémoire et quatre condensateurs silicium intégrés. Il utilise UCIe-A comme interconnexion de chiplets et une carte à double interface PCIe Gen5 x16.
ServeTheHome a signalé le choix du PCIe comme un possible raté, étant donné que le GB300 de Nvidia inaugure le PCIe Gen6. La critique est juste pour une pièce destinée à l'inférence scale-out. Mais la démonstration compte plus que la fiche technique. UCIe est discuté depuis des années, et les fournisseurs ont tardé à annoncer qu'ils l'utilisent parce que l'interconnexion se trouve à l'intérieur du boîtier. Que Rebellions intègre autant d'éléments de silicium dans un seul grand boîtier et montre que cela fonctionne est un point de données dont l'écosystème des chiplets avait besoin.
Tous les accélérateurs n'ont pas besoin d'une baie de centre de données. Draw Things a publié le 11 novembre 2025 des résultats pour Metal FlashAttention v2.5 avec Neural Accelerators sur l'Apple M5, revendiquant jusqu'à 4,6 fois d'amélioration par rapport au M4 dans sa propre application de génération d'images et de vidéos. L'entreprise rapporte des gains de performance brute de 3,6 à 5,5 fois par rapport à un iPad M4 et de 3,3 à 4,6 fois de bout en bout. Un iPad M5 se situe dans la plage d'un M2 Max et souvent environ 80 % plus lent qu'un M3 Ultra (60c). Elle indique qu'un iPad M5 de 16 Gio peut générer une vidéo 480p de cinq secondes avec les modèles Wan 2.2 A14B. La sortie est un aperçu : Draw Things précise que le support BF16 a d'abord été désactivé en raison de bugs non résolus, puis rétabli dans une version du 17 novembre. Des longueurs de séquence d'attention impaires et de grandes dimensions de têtes provoquent encore des chutes de performance.
Le matériau dont personne hors du conditionnement n'a entendu parler
Tout ce travail de conception se heurte à un problème de chaîne d'approvisionnement qui n'a rien à voir avec l'architecture. Tom's Hardware a rapporté le 9 mars 2026 que Nittobo contrôle environ 90 % de l'offre mondiale de T-glass, un tissu de fibre de verre à faible CTE utilisé dans le cœur organique des substrats de CI, la couche d'interconnexion entre une puce et sa carte de circuit imprimé. Le T-glass maintient la stabilité dimensionnelle des grands boîtiers chauds. Le E-glass est moins cher mais sert surtout aux puces bas de gamme comme les microcontrôleurs et les anciens processeurs mobiles ; pour le conditionnement 2,5D et 3D massif, le T-glass est préféré.
Nittobo triple la capacité de son usine de Fukushima, mais la nouvelle offre n'atteindra le marché qu'à la mi-2027. Les prix ont augmenté de 20 % à 30 %, et les délais pour les matériaux en aval comme les laminés cuivrés sont passés d'un délai normal de 8 à 10 semaines à plus de 20. L'analyste de Yuanta Bill Ho a déclaré à Tom's Hardware que les fournisseurs ne communiquent plus de délais. Bilal Hachemi, de Yole Group, a indiqué que le T-glass n'est pas facile à remplacer car il présente des valeurs diélectriques et de CTE précises qui conviennent mieux aux puces IA, en particulier au cœur organique. Il ajoute que les marges historiquement faibles de l'industrie des substrats de CI font que même de modestes pics de demande déclenchent des pénuries.
Le moteur de la demande est la taille du boîtier. Selon des données de Nvidia citées par Tom's Hardware, les tailles d'interposeur sont passées de 814 mm2 pour Hopper à 1 700 mm2 pour Blackwell, une hausse de 109 %, Rubin et Feynman devant monter encore. Bank of America estime que le segment des matériaux électroniques de Nittobo va presque doubler ses ventes, de 40,9 milliards de yens en 2025 à 87,7 milliards de yens d'ici mars 2028, avec des marges opérationnelles proches de 48 %. Nittobo double la capacité de fil brut de son usine taïwanaise et a conclu un accord de collaboration avec Nanya Plastics pour externaliser une partie du tissage. D'ici 2027, environ 20 % du tissu de verre de Nittobo devrait être tissé par Nanya.
Nittobo s'associe à l'un de ses plus gros concurrents pour desserrer le goulot d'étranglement. C'est le signal le plus clair de l'endroit où se situe la contrainte. Les architectes d'accélérateurs peuvent continuer à réduire les picojoules par bit, mais si le tissu à l'intérieur du substrat est alloué des années à l'avance, la date de livraison se décide ailleurs.
Sources
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
- 05Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.