Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Pénurie de T-glass : la chaîne d'approvisionnement des accélérateurs IA sous tension

Le T-glass, un tissu de fibre de verre spécialisé dont le japonais Nittobo contrôle environ 90 % de l'offre mondiale, est devenu le nouveau goulot d'étranglement des accélérateurs IA. Les prix ont grimpé de 20 à 30 % et les délais dépassent désormais 20 semaines.

TechnologieAnalyseSophie LeclercPublié le: 27 septembre 20267 min de lectureSources 4
Pénurie de T-glass : la chaîne d'approvisionnement des accélérateurs IA sous tension

L'histoire des accélérateurs IA se raconte d'ordinaire à travers la feuille de route des GPU de Nvidia ou la capacité de fonderie de TSMC. Selon Tom's Hardware, une entreprise japonaise, Nittobo, contrôle environ 90 % de l'offre mondiale d'un tissu de fibre de verre spécialisé appelé T-glass. Ce matériau entre dans chaque boîtier de puce IA avancée. La demande dépasse aujourd'hui l'offre.

Le T-glass est un tissu de verre à faible CTE qui sert de cœur organique aux substrats de circuits intégrés, la couche d'interconnexion entre une puce et sa carte de circuit imprimé. Il maintient la stabilité dimensionnelle des grands boîtiers soumis à de fortes chaleurs. Or les processeurs IA grossissent et chauffent davantage, ce qui complique la tâche. Selon Tom's Hardware, garder les processeurs IA plats et fonctionnels repose sur la physique du T-glass.

Pourquoi l'offre ne peut pas être activée d'un simple geste

Nittobo triple la capacité de son usine de Fukushima, au Japon. La nouvelle production n'arrivera pas sur le marché avant la mi-2027. Ce calendrier compte, car le T-glass n'est pas une matière première que l'on substitue ou que l'on lance rapidement. Le matériau exige des fours de fusion électrique spécialisés fonctionnant entre 1 600 et 1 700 degrés Celsius. Le procédé consiste à fondre un verre riche en silice, à le filer en fils puis à le tisser en un tissu ultramince. Tom's Hardware rapporte que monter une telle production demande des années d'investissement et d'expertise.

Une autre fibre de verre, l'E-glass, s'utilise de la même manière, mais coûte moins cher et sert surtout aux puces d'entrée de gamme, microcontrôleurs et anciens processeurs mobiles. Le T-glass l'emporte par sa résistance thermique. Pour les puces plus puissantes, en particulier les imposants boîtiers 2.5D et 3D, c'est l'option privilégiée.

Bilal Hachemi, analyste chez Yole Group, suit la chaîne d'approvisionnement des substrats de circuits intégrés. Il a déclaré à Tom's Hardware Premium que remplacer le T-glass n'est pas simple, car il « possède des valeurs diélectriques et de CTE spécifiques qui conviennent mieux aux puces IA, surtout pour le cœur organique ». L'industrie des substrats travaille depuis toujours avec des marges faibles, note-t-il, si bien que même de modestes poussées de demande peuvent déclencher des pénuries. « Toute hausse de la demande de matériaux de build-up, de matériau ABF ou de T-glass peut provoquer une pénurie potentielle, parce que cela va à l'encontre des bases de cette industrie », a-t-il dit.

Les chiffres derrière la tension

La crise actuelle vient des hyperscalers, qui construisent des boîtiers de puces toujours plus grands et consomment donc davantage de T-glass par unité. Selon des données de Nvidia citées par Tom's Hardware, la taille des interposeurs est passée de 814 mm2 pour l'architecture Hopper à 1 700 mm2 pour Blackwell, soit une hausse de 109 %. Les générations Rubin et Feynman à venir monteront encore d'un cran.

Bank of America estime que les ventes du segment des matériaux électroniques de Nittobo vont presque doubler, de 40,9 milliards de yens (266 millions de dollars) en 2025 à 87,7 milliards de yens d'ici mars 2028, avec des marges opérationnelles proches de 48 %. Takashi Enomoto, analyste de recherche chez Bank of America, a déclaré que la demande de tissu T-glass « semble devoir croître plus que prévu initialement ». L'attention s'était portée sur le T-glass épais pour les semi-boîtiers de GPU et de CPU, ajoute-t-il, mais la demande de T-glass ultramince devrait désormais augmenter à mesure que les appareils de pointe délaissent l'E-glass.

La course aux allocations a déjà produit un spectacle inhabituel. Hachemi indique que voir Nvidia s'adresser directement à un fournisseur de matériaux en amont comme Nittobo est sans précédent. « Pour la première fois, nous voyons Nvidia, le client final, se tourner vers les fournisseurs de matériaux en amont pour sécuriser la capacité et s'assurer qu'il l'obtiendra », a-t-il déclaré à Tom's Hardware. L'inquiétude : une fois Nvidia ayant verrouillé sa part, les acheteurs de puces rivaux se disputeront le reste.

Nittobo ne compte pas uniquement sur Fukushima. L'entreprise double la capacité de production de fils bruts dans son usine taïwanaise et réimporte les fils au Japon pour la fabrication du tissu. Elle a aussi conclu un accord de collaboration avec Nanya Plastics pour externaliser une partie du tissage. D'ici 2027, environ 20 % du tissu de verre de Nittobo devrait être tissé par Nanya, selon Tom's Hardware.

Bill Ho, analyste chez Yuanta, résume la situation en aval sans détour : « Avec une offre de T-glass encore plus contrainte, les fournisseurs ne donnent plus de délais. » Les délais pour les stratifiés cuivrés, un matériau en aval, sont passés d'un délai normal de 8 à 10 semaines à plus de 20, et les prix ont augmenté de 20 à 30 %.

Un problème parallèle : la mémoire dont l'inférence a réellement besoin

Si les matériaux contraignent l'offre, la bande passante mémoire contraint la conception. À Hot Chips 2026, d-Matrix a présenté son accélérateur Raptor 3D-DRAM pour l'inférence générative. La manière dont le problème est posé, telle que rapportée par ServeTheHome, mérite d'être lue comme un état des lieux des blocages du matériel IA. Les poids des modèles ne cessent de croître, et le cache KV évolue avec la longueur de contexte multipliée par la taille du lot. La publication de ServeTheHome donne l'exemple de 64 utilisateurs à 1M de contexte produisant environ 935 GB de cache KV.

La SRAM atteint la cible de bande passante, mais seulement à très petite échelle. Une paire de cartes accélératrices SRAM Corsair atteint environ 300 TB/s à une latence d'environ 1 ns, pour une capacité d'environ 4 GB seulement. Une cellule SRAM 6T est en effet environ 10 fois plus grande qu'une cellule DRAM, et les fuites atteignent des dizaines de watts à l'échelle du GB. La HBM résout la capacité mais peine sur la bande passante : ServeTheHome rapporte que d-Matrix cite un plafond pratique autour de 20 TB/s pour les boîtiers HBM4 tels que le Vera Rubin de Nvidia et l'Instinct MI455 d'AMD. À 2,4 pJ/bit, pousser 100 TB/s à travers la HBM consommerait environ 1,92 kW avant même de compter le trafic de la matrice.

La réponse de d-Matrix consiste à empiler le calcul directement sur les puces DRAM, en utilisant une puce logique TSMC N4 sur une puce DRAM 3D avec un empilement face à face de 36 um. L'IO vertical 3D descend à environ 0,3 à 0,4 pJ, soit environ 10 fois moins que la HBM, selon ServeTheHome. À 32GB par carte avec des poids 4 bits et un cache KV 8 bits, d-Matrix dimensionne pour tenir un modèle de frontière tel que Kimi K3 à 1M de contexte dans une grappe de 72 cartes, affirme l'entreprise.

Le détail d'ingénierie est là où réside la difficulté. Chaque moteur tensoriel a besoin d'un flit de 128B par accès. Mais avec 3 bancs par canal, un seul accès renvoie 96B : livrer un flit prend donc deux accès et récupère 192B, gaspillant environ 33 % de la bande passante près de 33 TB/s. La réponse de d-Matrix, le stream blocking, partage un accès partiel de 32B entre trois flits. Déplacer 100 TB/s à 0,37 pJ/bit revient à 296 W rien que pour l'IO.

Les hyperscalers construisent les leurs, prudemment

Le Maia 200 de Microsoft, présenté à la même conférence et couvert par ServeTheHome, montre l'autre bout du compromis. La puce en 3 nm compte 140 milliards de transistors, six piles de HBM3e, 7TB/seconde de bande passante HBM, 10 000 TFLOPS de performance FP4 et un TDP de 750 Watts, avec une puce SoC de 820 mm2. Microsoft l'a associée à une topologie quadruple entièrement connectée et sans aucun réseau de scale-out : tout est en scale-up, sur 128 baies et 6 000 puces dans le schéma présenté. L'architecture de flux de données Software Defined Local Access de l'entreprise garde l'accès aux données local et fixe le flux de données au moment de la compilation, ce qui apporte du déterminisme et réduit le trafic de matrice.

Rien de tout cela ne desserre la contrainte matérielle. Le Zhenwu V900 d'Alibaba, annoncé avec 216GB de mémoire et 1 200GB/s de bande passante inter-puces et dont la production de masse est prévue pour le premier trimestre 2027, ajoute un acheteur de plus dans la file, comme le note la revue hebdomadaire du 25 septembre de SemiEngineering. Samsung prévoirait au moins de doubler sa production de la famille HBM4 en 2027, selon le Seoul Economic Daily. CXMT a déclaré pour sa part que sa DRAM G5 de cinquième génération est entrée en production de masse avec un demi-pas de zone active de 11,95 nm, sans toutefois divulguer ses rendements de fabrication. Plus de mémoire et plus d'accélérateurs signifient plus de substrat, et plus de substrat signifie plus de T-glass.

La conclusion est inconfortable : en 2027, la contrainte déterminante sur le calcul IA ne sera peut-être pas la lithographie ni l'offre de HBM, mais un tissu de verre tissé par une seule entreprise à Fukushima, avec un concurrent qui aide à le tisser et un délai que personne ne veut annoncer.

Commentaires 0

Sources

4
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
  4. 04Chip Industry Week In ReviewEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.