Pourquoi les accélérateurs IA sont plus difficiles à construire : T-glass, HBM et empilement 3D
Nittobo, une entreprise japonaise, contrôle environ 90 % de l'approvisionnement mondial en T-glass, un tissu de fibre de verre spécialisé. Selon Tom's Hardware, la tension gagne désormais les chaînes d'approvisionnement des accélérateurs IA : les prix ont grimpé de 20 à 30 % et les délais dépassent 20 semaines.

La plupart des articles sur le matériel IA commencent et finissent avec Nvidia et TSMC. Tom's Hardware a rapporté le 9 mars que le goulot d'étranglement s'est déplacé d'un cran vers le bas, dans un matériau que presque personne ne connaît : le T-glass. Ce tissu de verre à faible CTE entre dans le cœur organique des substrats de circuits intégrés, la couche d'interconnexion entre une puce et sa carte de circuit imprimé.
Ce que fait réellement le T-glass
Le T-glass maintient la stabilité dimensionnelle des grands boîtiers de puces qui chauffent. À mesure que les processeurs IA grossissent et chauffent davantage, garder ces boîtiers bien plats devient un problème de fabrication, pas une question théorique. Une autre fibre de verre, le E-glass, coûte moins cher, mais sert surtout aux puces d'entrée de gamme comme les microcontrôleurs et les anciens processeurs mobiles. Pour les gros boîtiers 2.5D et 3D, le T-glass est l'option privilégiée.
Nittobo domine ce marché. Ni elle ni aucune autre entreprise ne peut lancer une nouvelle ligne de production du jour au lendemain. Le matériau exige des fours électriques de fusion spécialisés fonctionnant entre 1 600 et 1 700 °C. Le procédé consiste à fondre du verre riche en silice, à le filer en fils puis à le tisser en un tissu ultramince. Monter en cadence demande des années d'investissement et de savoir-faire.
Nittobo triple la capacité de son usine de Fukushima, au Japon, mais la nouvelle production n'arrivera pas sur le marché avant la mi-2027. En attendant, les prix ont augmenté de 20 à 30 %, tandis que les délais des matériaux en aval, comme les stratifiés cuivrés, sont passés des 8 à 10 semaines habituelles à plus de 20. Bill Ho, analyste chez Yuanta, a déclaré à Tom's Hardware : « Avec un approvisionnement en T-glass encore plus contraint, les fournisseurs ne communiquent même plus de délais. »
Bilal Hachemi, analyste chez Yole Group, suit la chaîne d'approvisionnement des substrats de circuits intégrés. Il explique que le T-glass « a des valeurs diélectriques et de CTE spécifiques qui conviennent mieux aux puces IA, en particulier pour le cœur organique ». Il souligne aussi que le secteur des substrats travaille depuis toujours avec des marges faibles : une hausse de demande même modeste peut donc déclencher des pénuries. « Toute hausse de la demande de matériaux de build-up, de matériau ABF ou de T-glass peut provoquer une pénurie potentielle, car cela va contre les bases de ce secteur », a-t-il dit.
Ce qui rend cette pénurie aiguë, c'est celui qui la provoque. Les hyperscalers commandent des boîtiers de puces toujours plus grands, et chaque génération utilise un interposeur plus grand et un substrat plus complexe. Selon des données de Nvidia citées par Tom's Hardware, la taille des interposeurs est passée de 814 mm² pour l'architecture Hopper à 1 700 mm² pour Blackwell, soit une hausse de 109 %. Les générations à venir, Rubin et Feynman, monteront encore d'un cran.
Des boîtiers plus grands, plus de matériau
Bank of America estime que le chiffre d'affaires du segment des matériaux électroniques de Nittobo va presque doubler, passant de 40,9 milliards de yens (266 millions de dollars) en 2025 à 87,7 milliards d'ici mars 2028, avec des marges opérationnelles proches de 48 %. Takashi Enomoto, analyste chez Bank of America, indique que la demande de T-glass ultramince augmente elle aussi, portée par l'abandon du E-glass dans les appareils de pointe.
La course aux allocations a commencé. Hachemi qualifie d'inédit le fait que Nvidia se soit adressé directement à un fournisseur de matériaux en amont : « Pour la première fois, on voit Nvidia, le client final, contacter les fournisseurs de matériaux en amont pour sécuriser la capacité et s'assurer qu'il obtiendra la marchandise. » L'inquiétude : une fois que Nvidia aura verrouillé sa part, les acheteurs de puces concurrents se disputeront le reste.
Nittobo ne reste pas les bras croisés. Au-delà de l'expansion de Fukushima, l'entreprise double la capacité de fils bruts de son usine taïwanaise et réimporte des fils au Japon pour la fabrication du tissu. Elle a aussi conclu un accord de collaboration avec Nanya Plastics pour externaliser une partie du tissage. Le signe d'un marché très tendu : Nittobo s'associe à l'un de ses principaux concurrents pour desserrer le goulot. D'ici 2027, environ 20 % du tissu de verre de Nittobo devrait être tissé par Nanya.
Le mur de la mémoire, et la réponse par l'empilement
Le matériau d'emballage est une contrainte. La bande passante mémoire en est une autre, et elle fait l'objet d'un débat distinct qui traverse les conférences sur les puces cette année. Le compte rendu par ServeTheHome de la présentation de d-Matrix à Hot Chips 2026 pose le problème : les poids des modèles ne cessent de grossir, et le cache KV évolue avec la longueur de contexte multipliée par la taille du lot. Soixante-quatre utilisateurs à 1 M de contexte peuvent représenter environ 935 Go de cache KV.
La SRAM atteint la cible de bande passante, mais seulement à très petite échelle. Une paire de cartes accélératrices SRAM de Corsair atteint environ 300 To/s à une latence d'environ 1 ns, mais ne stocke qu'environ 4 Go. La HBM résout la moitié capacité mais peine sur la bande passante : d-Matrix cite un plafond pratique d'environ 20 To/s pour les boîtiers HBM4. Une telle bande passante a un prix en énergie. À 2,4 pJ/bit, pousser 100 To/s à travers de la HBM consomme environ 1,92 kW avant même de compter le trafic de fabrication.
La réponse de d-Matrix consiste à empiler le calcul directement sur les puces DRAM. Une puce logique TSMC N4 repose sur une puce DRAM 3D par empilement face à face de 36 um. L'entreprise décrit ce procédé comme éprouvé, peu coûteux, à gros volumes et à haut rendement. Le défi thermique est réel : d-Matrix affirme qu'un empilement 1-Hi avec la logique au-dessus, à pas plus de 0,5 W/mm², peut être refroidi par liquide tout en maintenant la DRAM sous 100 C. L'IO 3D vertical descend à environ 0,3 à 0,4 pJ, soit environ 10 fois moins que la HBM.
Il y a des compromis d'ingénierie. Chaque moteur tensoriel a besoin d'un flit de 128B par accès, et avec 3 bancs par canal un seul accès renvoie 96B, ce qui gaspille environ 33 % de la bande passante. La solution de d-Matrix, appelée stream blocking, partage un accès partiel de 32B entre trois flits, ce qui ramène la surlecture à zéro. À 32 Go par carte, une grappe de 72 cartes peut héberger un modèle de frontière comme Kimi K3 à 1 M de contexte.
Microsoft et Rebellions montrent la même tendance
Le Maia 200 de Microsoft, présenté à Hot Chips 2026 et suivi en direct par ServeTheHome, est une puce 3 nm de 140 milliards de transistors, avec 6 piles HBM3e, 7 To/seconde de bande passante HBM, 750 watts de TDP et 10 000 TFLOPS en FP4. La puce SoC mesure 820 mm². Microsoft la déploie dans les centres de données Azure avec une conception réseau uniquement scale-up : 128 baies et 6 000 puces, reliées par des commutateurs de niveau 0 et 1 sur Ethernet unifié. Les benchmarks d'attention montrent un pic effectif de 1,65 PFLOPS, et les tests collectifs atteignent presque 1,3 To/seconde en AllReduce BF16.
À Hot Chips 2025, Rebellions a montré une approche différente du même problème d'emballage. Le REBEL-Quad utilise quatre sites HBM3E pour 144 Go de mémoire et UCIe comme interconnexion de chiplets. Il est construit sur Samsung SF4X et CoWoS-S, avec quatre ASIC de calcul et quatre condensateurs en silicium intégrés par boîtier. ServeTheHome note qu'il s'agit d'une carte double PCIe Gen5 x16, et que l'entreprise a fait une démonstration en direct de Llama 3.3 70B à 35,5 ms en moyenne par token de sortie sur une carte de développement.
Le monde académique avance aussi. Stanford, Carnegie Mellon, Penn, le MIT et SkyWater Technology ont rapporté la première puce 3D monolithique fabriquée dans une fonderie américaine, présentée à la 71e conférence internationale IEEE sur les dispositifs électroniques en décembre 2025. Les premiers tests matériels montrent que le prototype dépasse d'environ un facteur quatre les puces 2D comparables. Les simulations de versions plus hautes laissent entrevoir jusqu'à douze fois plus de gains sur des charges de travail IA, dont certaines dérivées de LLaMA de Meta. Subhasish Mitra, le professeur de Stanford qui a dirigé les travaux, a déclaré que de telles percées permettront au secteur d'obtenir les gains de performance matérielle d'un facteur 1 000 que les futurs systèmes d'IA exigeront.
Rien de tout cela n'arrive au rythme qu'exige la pénurie actuelle. La contrainte du T-glass est un problème qui durera des années. La recherche sur l'empilement et l'emballage susceptible de relâcher la pression plus tard reste largement dans des diapositives de présentation et sur des cartes de développement.
Sources
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Scientists and U.S. foundry achieve 3D chip breakthrough to accelerate AIEN
- 05Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.