Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Ce qu'il y a vraiment dans un accélérateur d'IA : T-glass, HBM et le goulot du décodage

Une seule entreprise japonaise fournit environ 90 % du tissu de fibre de verre que l'on trouve dans chaque boîtier de puce d'IA avancée. Cette pénurie pèse aujourd'hui sur les feuilles de route des accélérateurs autant que l'architecture des GPU.

TechnologieExpliquéCamille RousseauPublié le: 28 septembre 20267 min de lectureSources 4
Ce qu'il y a vraiment dans un accélérateur d'IA : T-glass, HBM et le goulot du décodage

Nittobo détient environ 90 % du marché mondial du T-glass, un tissu de verre à faible CTE qui entre dans le cœur organique des substrats de circuits intégrés, rapporte Tom's Hardware. L'entreprise triple la capacité de son usine de Fukushima, mais la nouvelle production n'arrivera pas sur le marché avant la mi-2027.

Cet écart se lit déjà dans les prix et les délais. Les prix du T-glass ont grimpé de 20 % à 30 %, et les délais des matériaux en aval, comme les laminés cuivrés, sont passés de 8 à 10 semaines en temps normal à plus de 20. « Avec une offre de T-glass encore plus contrainte, les fournisseurs ne donnent plus de délais », a déclaré à Tom's Hardware Bill Ho, analyste chez Yuanta. La tension se voit d'abord sur les devis, que les commerciaux ne peuvent plus tenir au-delà de quelques jours. Elle se retrouve ensuite dans les calendriers sur lesquels les concepteurs fabless calent leurs fenêtres de lancement. Personne dans la chaîne ne veut dire publiquement combien de temps durera la pénurie : personne ne veut être celui qui s'est trompé.

Pourquoi le substrat compte plus que le nombre de transistors

Un accélérateur d'IA n'est pas une puce unique. C'est un boîtier : des puces logiques, des piles de mémoire, un interposeur et un substrat qui relie le tout à une carte de circuit imprimé. Le cœur organique du substrat doit rester plat pendant que le boîtier chauffe et refroidit, car un boîtier déformé casse les connexions microscopiques entre les puces. Le T-glass lui garde sa stabilité dimensionnelle, et ses valeurs diélectriques et de dilatation thermique sont réglées exactement pour ce rôle.

Bilal Hachemi, analyste chez Yole Group, suit la chaîne d'approvisionnement des substrats de circuits intégrés. Il a expliqué à Tom's Hardware Premium que remplacer le T-glass n'a rien de simple. Ce matériau « a des valeurs diélectriques et de CTE spécifiques qui conviennent mieux aux puces d'IA, en particulier pour le cœur organique », a-t-il dit. Il pointe aussi une structure industrielle qui transforme de petits chocs de demande en pénuries. Le métier des substrats de circuits intégrés a toujours tourné sur de faibles marges. « Toute hausse de la demande de matériaux de buildup, de matériau ABF ou de T-glass peut provoquer une pénurie potentielle, parce que cela va contre les bases de cette industrie », dit-il. Cette structure est antérieure à l'essor de l'IA. Elle a été bâtie pour un marché où la demande de substrats croissait lentement et de façon prévisible. Elle n'a pas été reconstruite pour un marché où un seul cycle produit peut doubler les commandes en un an.

La demande, elle, ne fait pas dans la dentelle. Chaque génération d'accélérateur d'IA utilise un interposeur plus grand et un substrat plus complexe, donc plus de matériau par unité. Selon des données de Nvidia citées par Tom's Hardware, la taille des interposeurs est passée de 814 mm² pour Hopper à 1 700 mm² pour Blackwell, soit une hausse de 109 %, les générations Rubin et Feynman à venir montant encore en échelle.

Bank of America estime que le segment des matériaux électroniques de Nittobo verra ses ventes presque doubler, de 40,9 milliards de ¥ (266 millions de $) en 2025 à 87,7 milliards de ¥ d'ici mars 2028, avec des marges opérationnelles proches de 48 %. « La demande de tissu de T-glass devrait croître plus que prévu initialement », a déclaré Takashi Enomoto, analyste de recherche chez Bank of America. Il ajoute que l'attention s'est portée sur le T-glass épais pour les boîtiers de GPU et de CPU, mais que la demande de T-glass ultra-fin devrait monter à mesure que les dispositifs de pointe délaissent l'E-glass.

Nittobo n'attend pas. Au-delà de Fukushima, l'entreprise double la capacité de fil brut de son usine taïwanaise et renvoie le fil au Japon pour le tissage. Elle a aussi signé un accord de collaboration avec Nanya Plastics pour externaliser une partie du tissage. Tom's Hardware note le symbole : Nittobo s'associe à l'un de ses plus gros concurrents. D'ici 2027, environ 20 % du tissu de verre de Nittobo devrait être tissé par Nanya.

La mémoire est l'autre moitié du goulot

Si le substrat décide si un boîtier peut être construit, la mémoire décide à quelle vitesse il peut répondre. d-Matrix a profité de sa présentation Hot Chips 2026 sur l'accélérateur Raptor, couverte par ServeTheHome, pour poser l'arithmétique. Les poids des modèles continuent de grossir, et le cache KV évolue avec la longueur de contexte multipliée par la taille de lot. Résultat : 64 utilisateurs à 1M de contexte peuvent représenter environ 935 Go de cache KV.

Le partage entre calcul et mémoire se lit dans les deux phases de l'inférence. Le prefill traite beaucoup de tokens de prompt en parallèle et dépend du débit de calcul. Le decode produit un token à la fois et dépend typiquement de la bande passante mémoire. Comme le decode domine le temps d'exécution réel, c'est sur la bande passante que se gagnent les gains. La SRAM atteint la cible de bande passante, mais seulement à très petite échelle : une paire de cartes accélératrices SRAM Corsair atteint environ 300 To/s à environ 1 ns de latence et ne contient qu'environ 4 Go. Une cellule SRAM 6T est environ 10 fois plus grande qu'une cellule DRAM.

La HBM résout la capacité, pas la bande passante. d-Matrix cite un plafond pratique autour de 20 To/s pour les boîtiers HBM4 comme le Nvidia Vera Rubin et l'AMD Instinct MI455, limité par la vitesse des broches, la largeur d'E/S et une façade de boîtier d'environ 8 à 16 piles. La bande passante a aussi un prix en énergie : à 2,4 pJ/bit, pousser 100 To/s à travers la HBM coûte environ 1,92 kW avant même de compter le trafic de fabric.

« Pour la première fois, nous voyons Nvidia, le client final, contacter les fournisseurs de matériaux en amont pour sécuriser la capacité et s'assurer de l'obtenir. » Bilal Hachemi, Yole Group, à Tom's Hardware

La réponse de d-Matrix est d'empiler le calcul directement sur les puces DRAM. Une puce logique TSMC N4 repose sur une puce DRAM 3D par empilement face à face de 36 um. L'E/S 3D verticale descend à environ 0,3 à 0,4 pJ, soit environ 10 fois moins que la HBM, parce que c'est un chemin à l'échelle du millimètre et non une route d'interposeur à l'échelle du centimètre. L'entreprise affirme qu'un empilement 1-Hi logique au-dessus, à pas plus de 0,5 W/mm², peut être refroidi par liquide et garder la DRAM sous 100 C.

L'intégration est là où l'élégance s'arrête. Chaque moteur tensoriel a besoin d'un flit de 128B par accès. Avec 32B livrés par accès colonne depuis des bancs de 32B, cela fait 4 bancs par canal. La puce compte 840 bancs, 768 après 72 de réserve, répartis sur 256 canaux, soit seulement 3 bancs par canal. Le stream blocking corrige le décalage en partageant un accès partiel de 32B entre trois flits : 4 accès à 96B alimentent 3 flits à 128B. À 32 Go par carte avec des poids 4 bits et un cache KV 8 bits, d-Matrix loge un modèle de frontière comme Kimi K3 à 1M de contexte dans une seule baie de 72 cartes.

La boucle de conception s'automatise, de façon inégale

Le packaging et la mémoire sont des contraintes physiques. Le temps de conception en est une économique. Tim Costa, vice-président et directeur général de l'ingénierie computationnelle chez Nvidia, a déclaré aux journalistes que d'ici 2030 l'industrie devrait produire 2 000 milliards de puces et traiter environ 41 millions de wafers par mois, avec des boîtiers individuels approchant le billion de transistors. « Le processus de conception traditionnel ne peut tout simplement pas suivre ce rythme », a-t-il dit, selon The Next Platform.

Nvidia déploie son CPU Vera CV100 basé sur Arm dans ses propres flux EDA, notamment la simulation, la vérification formelle et l'implémentation physique. Costa a dit que les premiers tests montrent Vera exécutant Synopsys VCS et Cadence Jasper à 1,5 fois la performance des systèmes AMD Epyc Torrent. Cadence affirme que ses AI Super Agents peuvent lancer des centaines de simulations simultanément et livrer des cycles de validation au niveau transfert de registre 40 fois plus rapides ; Synopsys dit que son flux de vérification autonome peut livrer du RTL validé 50 fois plus vite. Ce sont des chiffres de fournisseurs. SemiEngineering note que le virage vers des agents spécialisés crée de nouveaux problèmes d'orchestration, d'intégration et de garde-fous, les résultats générés par IA exigeant encore une vérification avant validation.

Un point de données du ChipStack AI Super Agent de Cadence, rapporté par SemiEngineering, suggère que les gains ne portent pas seulement sur la vitesse. L'entreprise rapporte environ 24 % de surface en moins et 18 % de puissance en moins par rapport à une génération de code par modèle de fondation pur.

Rien de tout cela ne supprime la contrainte amont. Un interposeur plus grand demande plus de T-glass. Un modèle plus gros demande plus de bande passante mémoire. Nvidia allant directement chez Nittobo, ce que Hachemi qualifie de sans précédent dans cette partie de la chaîne, est un signal sur l'endroit où se situe la vraie rareté. L'inquiétude qu'il nomme est simple : une fois que Nvidia verrouille sa part, les acheteurs de puces rivaux se battent pour ce qui reste. Les nouvelles fabs prennent des années, et un nouveau four de tissu de verre tournant entre 1 600 et 1 700 °C aussi.

Commentaires 0

Sources

4
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Nvidia Accelerates Chip Engineering With AI AgentsEN
  4. 04Chip Industry Week In ReviewEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.