Was wirklich in einem KI-Beschleuniger steckt: T-Glass, HBM und der Decode-Flaschenhals
Ein einziges japanisches Unternehmen kontrolliert rund 90% des weltweiten Angebots an einem Glasfasergewebe, das in jedem fortschrittlichen KI-Chipgehäuse sitzt. Der Engpass prägt die Roadmaps der Beschleuniger inzwischen ebenso stark wie die GPU-Architektur.

Nittobo hält nach Angaben von Tom's Hardware etwa 90% des Weltmarkts für T-Glass. Das Glasgewebe hat einen niedrigen CTE und sitzt im organischen Kern von IC-Substraten. Nittobo verdreifacht die Kapazität am Standort Fukushima, doch das neue Angebot erreicht den Markt erst Mitte 2027.
Diese Lücke zeigt sich bereits in Preisen und Lieferplänen. Die Preise für T-Glass sind um 20% bis 30% gestiegen. Die Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normalerweise 8 bis 10 Wochen auf über 20 verlängert. "With T-glass supply even more constrained now, suppliers are no longer providing lead times," sagte Bill Ho, Analyst bei Yuanta, zu Tom's Hardware. Der Druck zeigt sich zuerst in Angeboten, die Vertriebsteams nicht länger als ein paar Tage halten können. Danach zeigt er sich in den Zeitplänen, um die Fabless-Designer ihre Startfenster bauen. Niemand in der Kette will öffentlich sagen, wie lange die Knappheit anhält, weil niemand derjenige sein will, der falsch lag.
Warum das Substrat mehr zählt als die Transistorzahl
Ein KI-Beschleuniger ist nicht ein Chip. Er ist ein Gehäuse: Logik-Dies, Speicherstapel, ein Interposer und ein Substrat, das alles mit einer Leiterplatte verbindet. Der organische Kern des Substrats muss flach bleiben, während sich das Gehäuse erwärmt und abkühlt, denn ein verzogenes Gehäuse bricht die mikroskopischen Verbindungen zwischen den Dies. T-Glass hält es maßstabil, und seine Dielektrizitäts- und Wärmeausdehnungswerte sind genau auf diese Aufgabe abgestimmt.
Bilal Hachemi, Analyst bei Yole Group, der die Lieferkette für IC-Substrate verfolgt, sagte zu Tom's Hardware Premium, ein Ersatz sei nicht einfach. T-Glass "has specific dielectric and CTE values that work better for the AI chips, especially for the organic core," sagte er. Er verwies auch auf eine Branchenstruktur, die kleine Nachfrageschocks in Engpässe verwandelt. Das IC-Substratgeschäft arbeitet historisch mit dünnen Margen, daher kann "any increase in demand for build-up materials, ABF material, or T-glass can cause potential shortage, because it's against the basics of this industry." Diese Struktur ist älter als der KI-Boom. Sie wurde für einen Markt gebaut, in dem die Substratnachfrage langsam und berechenbar wuchs. Für einen Markt, in dem ein einziger Produktzyklus die Bestellungen in einem Jahr verdoppeln kann, wurde sie nicht neu gebaut.
Die Nachfrageseite ist wenig subtil. Jede Generation von KI-Beschleunigern nutzt einen größeren Interposer und ein komplexeres Substrat, was mehr Material pro Einheit bedeutet. Nach Daten von Nvidia, die Tom's Hardware zitiert, sind die Interposer-Größen von 814mm² für Hopper auf 1,700mm² für Blackwell gewachsen, ein Plus von 109%. Die kommenden Generationen Rubin und Feynman skalieren weiter.
Bank of America schätzt, dass der Geschäftsbereich Electronic Materials von Nittobo seinen Umsatz von 40,9 Milliarden Yen (266 Millionen Dollar) im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird, mit operativen Margen von annähernd 48%. "Demand for T-glass cloth seems likely to grow more than originally expected," sagte Takashi Enomoto, Research-Analyst bei der Bank of America. Er ergänzte, der Fokus habe auf dickem T-Glass für GPU- und CPU-Gehäuse gelegen. Die Nachfrage nach ultradünnem T-Glass dürfte jedoch steigen, wenn Spitzenbauteile von E-Glass abrücken.
Nittobo wartet nicht. Über Fukushima hinaus verdoppelt das Unternehmen die Rohgarnkapazität im taiwanischen Werk und verschifft Garn zum Weben zurück nach Japan. Außerdem gibt es eine Kooperationsvereinbarung mit Nanya Plastics, um einen Teil des Webens auszulagern. Tom's Hardware nennt die Symbolik: Nittobo arbeitet mit einem seiner größten Konkurrenten zusammen. Bis 2027 sollen rund 20% des Glasgewebes von Nittobo von Nanya gewebt werden.
Speicher ist die andere Hälfte des Engpasses
Wenn das Substrat entscheidet, ob ein Gehäuse gebaut werden kann, entscheidet der Speicher, wie schnell es antworten kann. d-Matrix nutzte seinen Vortrag zu Hot Chips 2026 über den Raptor-Beschleuniger, über den ServeTheHome berichtete, um die Arithmetik darzulegen. Die Modellgewichte wachsen weiter, und der KV-Cache skaliert mit der Kontextlänge multipliziert mit der Batch-Größe. 64 Nutzer bei 1M Kontext können also rund 935 GB KV-Cache bedeuten.
Die Aufteilung zwischen Rechenleistung und Speicher zeigt sich in den zwei Phasen der Inferenz. Prefill verarbeitet viele Prompt-Token parallel und ist rechenleistungsgebunden. Decode erzeugt jeweils ein Token und ist typischerweise speicherbandbreitengebunden. Da Decode die Laufzeit dominiert, liegen die Gewinne bei der Bandbreite. SRAM erreicht das Bandbreitenziel, aber nur in winzigem Maßstab: Ein Paar Corsair-SRAM-Beschleunigerkarten erreicht rund 300 TB/s bei etwa 1 ns Latenz und fasst nur etwa 4 GB. Eine 6T-SRAM-Zelle ist etwa 10-mal größer als eine DRAM-Zelle.
HBM löst die Kapazität, nicht die Bandbreite. d-Matrix nennt eine praktische Obergrenze von rund 20 TB/s für HBM4-Pakete wie Nvidia Vera Rubin und AMD Instinct MI455. Begrenzt wird sie durch Pin-Geschwindigkeit, I/O-Breite und Gehäusefläche von etwa 8 bis 16 Stapeln. Bandbreite hat auch einen Leistungspreis: Bei 2,4 pJ/bit kostet es etwa 1,92 kW, 100 TB/s durch HBM zu schieben, bevor irgendein Fabric-Verkehr gezählt wird.
"For the first time, we are seeing Nvidia, the end customer, reaching out to the upstream material suppliers to secure the capacity and make sure they will get it." Bilal Hachemi, Yole Group, zu Tom's Hardware
Die Antwort von d-Matrix ist, Rechenleistung direkt auf DRAM-Dies zu stapeln. Ein TSMC-N4-Logik-Die sitzt auf einem 3D-DRAM-Die mit 36 um Face-to-Face-Stapelung. Vertikales 3D-IO liegt bei rund 0,3 bis 0,4 pJ, etwa 10-mal niedriger als HBM, weil es ein Pfad im Millimeterbereich ist und keine Interposer-Route im Zentimeterbereich. Das Unternehmen sagt, ein 1-Hi-Logic-on-Top-Stapel mit höchstens 0,5 W/mm² lasse sich flüssig kühlen und halte DRAM unter 100 C.
Bei der Integration endet die Eleganz. Jede Tensor-Engine braucht ein 128B-Flit pro Zugriff, und da pro Spaltenzugriff aus 32B-Bänken 32B geliefert werden, ergibt das 4 Bänke pro Kanal. Das Die hat 840 Bänke, 768 nach 72 Reserven, verteilt auf 256 Kanäle, also nur 3 Bänke pro Kanal. Stream Blocking behebt die Diskrepanz, indem ein partieller 32B-Zugriff über drei Flits geteilt wird, sodass 4 Zugriffe mit 96B drei Flits mit 128B speisen. Bei 32GB pro Karte mit 4-Bit-Gewichten und einem 8-Bit-KV-Cache bringt d-Matrix ein Frontier-Modell wie Kimi K3 bei 1M Kontext in einem einzigen Rack mit 72 Karten unter.
Die Designschleife wird automatisiert, ungleichmäßig
Verpackung und Speicher sind physische Einschränkungen. Die Designzeit ist eine wirtschaftliche. Tim Costa, Vice President und General Manager of Computational Engineering bei Nvidia, sagte zu Journalisten, bis 2030 werde die Branche voraussichtlich 2 Billionen Chips produzieren und monatlich etwa 41 Millionen Wafer verarbeiten. Einzelne Gehäuse erreichten dann eine Billion Transistoren. "The traditional design process just can't keep pace with that scale of challenge," sagte er, laut The Next Platform.
Nvidia setzt seine Arm-basierte Vera CV100 CPU in den eigenen EDA-Workflows ein, einschließlich Simulation, formaler Verifikation und physischer Implementierung. Costa sagte, frühe Tests zeigten Vera mit Synopsys VCS und Cadence Jasper bei 1,5-facher Leistung von AMD-Epyc-Torrent-Systemen. Cadence behauptet, seine AI Super Agents könnten Hunderte Simulationen gleichzeitig ausführen und 40-mal schnellere Validierungszyklen auf Register-Transfer-Ebene liefern. Synopsys sagt, sein autonomer Verifikations-Workflow könne validiertes RTL 50-mal schneller liefern. Das sind Anbieterzahlen, und SemiEngineering merkt an, dass die Verschiebung zu spezialisierten Agenten neue Probleme bei Orchestrierung, Integration und Leitplanken schafft. KI-generierte Ergebnisse müssen vor der Freigabe weiterhin verifiziert werden.
Ein Datenpunkt aus dem ChipStack AI Super Agent von Cadence, über den SemiEngineering berichtete, deutet darauf hin, dass die Gewinne nicht nur die Geschwindigkeit betreffen. Das Unternehmen meldet etwa 24% weniger Fläche und 18% weniger Leistung gegenüber reiner Foundation-Model-Codegenerierung.
Nichts davon beseitigt die Einschränkung vorgelagert. Ein größerer Interposer braucht mehr T-Glass. Ein größeres Modell braucht mehr Speicherbandbreite. Dass Nvidia direkt zu Nittobo geht, was Hachemi in diesem Teil der Lieferkette als beispiellos bezeichnete, ist ein Signal dafür, wo die echte Knappheit sitzt. Die Sorge, die er nennt, ist schlicht: Sobald Nvidia seinen Anteil gesichert hat, kämpfen konkurrierende Chipkäufer um das, was übrig bleibt. Neue Fabs dauern Jahre, und ein neuer Glasgewebe-Ofen, der zwischen 1.600 und 1.700°C läuft, ebenso.
Quellen
4- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Nvidia Accelerates Chip Engineering With AI AgentsEN
- 04Chip Industry Week In ReviewEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.