Warum KI-Beschleuniger schwerer zu bauen sind: T-Glass, HBM und 3D-Stapelung
Ein japanisches Unternehmen namens Nittobo kontrolliert rund 90% des weltweiten Angebots an speziellem Glasfasergewebe, das als T-Glass bekannt ist. Laut Tom's Hardware trifft dieser Engpass nun die Lieferketten für KI-Beschleuniger: Die Preise sind um 20 bis 30% gestiegen, die Lieferzeiten liegen über 20 Wochen.

Die meisten Berichte über KI-Hardware beginnen und enden mit Nvidia und TSMC. Tom's Hardware meldete am 9. März, dass der Engpass eine Ebene tiefer gewandert ist, in ein Material, von dem die meisten Menschen noch nie gehört haben: T-Glass. Das Glasgewebe mit niedrigem CTE steckt im organischen Kern von IC-Substraten, der Verbindungsschicht zwischen einem Chip und seiner Leiterplatte.
Was T-Glass tatsächlich bewirkt
T-Glass hält große, hitzeintensive Chipgehäuse dimensional stabil. Je größer KI-Prozessoren werden und je heißer sie laufen, desto mehr wird die Physik, sie flach zu halten, zu einem Fertigungsproblem statt zu einem theoretischen. Eine andere Glasfaser, E-Glass, ist billiger, wird aber hauptsächlich in einfacheren Chips wie Mikrocontrollern und älteren Mobilprozessoren verwendet. Für massives 2.5D- und 3D-Packaging ist T-Glass die bevorzugte Option.
Nittobo beherrscht diesen Markt. Weder das Unternehmen noch ein anderes kann über Nacht eine neue Produktionslinie hochziehen. Das Material erfordert spezialisierte elektrische Schmelzöfen, die bei 1.600 bis 1.700°C laufen. Der Prozess umfasst das Schmelzen von kieselsäurereichem Glas, das Spinnen zu Garn und das Weben zu einem ultradünnen Gewebe. Um das zu skalieren, braucht es Jahre an Investitionen und Fachwissen.
Nittobo verdreifacht die Kapazität in seinem Werk in Fukushima in Japan, aber das neue Angebot wird erst Mitte 2027 auf den Markt kommen. In der Zwischenzeit sind die Preise um 20 bis 30% gestiegen. Die Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normalen 8 bis 10 Wochen auf über 20 verlängert. Bill Ho, Analyst bei Yuanta, sagte zu Tom's Hardware: "Da das T-Glass-Angebot jetzt noch knapper ist, geben die Lieferanten keine Lieferzeiten mehr an."
Bilal Hachemi, Analyst bei Yole Group, der die Lieferkette für IC-Substrate verfolgt, sagte, T-Glass "hat spezifische Dielektrizitäts- und CTE-Werte, die für die KI-Chips besser funktionieren, besonders für den organischen Kern." Er wies auch darauf hin, dass die IC-Substratindustrie historisch mit dünnen Margen gearbeitet hat. Selbst bescheidene Nachfrageschübe können deshalb Engpässe auslösen. "Jeder Anstieg der Nachfrage nach Build-up-Materialien, ABF-Material oder T-Glass kann zu einem potenziellen Engpass führen, denn das widerspricht den Grundlagen dieser Industrie", sagte er.
Akut wird diese Knappheit durch die, die sie antreiben. Hyperscaler bestellen immer größere Chipgehäuse, und jede Generation verwendet einen größeren Interposer und ein komplexeres Substrat. Laut Daten von Nvidia, die Tom's Hardware zitiert, sind die Interposer-Größen von 814mm² für die Hopper-Architektur auf 1.700mm² für Blackwell gewachsen, ein Anstieg um 109%. Die kommenden Generationen Rubin und Feynman skalieren weiter.
Größere Gehäuse, mehr Material
Die Bank of America schätzt, dass das Segment für elektronische Materialien von Nittobo seinen Umsatz fast verdoppelt, von ¥40,9 Milliarden ($266 Millionen) im Jahr 2025 auf ¥87,7 Milliarden bis März 2028, mit operativen Margen von nahezu 48%. Takashi Enomoto, Research-Analyst bei der Bank of America, sagte, die Nachfrage nach ultradünnem T-Glass steige nun ebenfalls, weil Spitzengeräte von E-Glass abrücken.
Das Gerangel um Zuteilung hat begonnen. Hachemi beschrieb, dass Nvidia sich direkt an einen vorgelagerten Materiallieferanten wandte, als beispiellos: "Zum ersten Mal sehen wir, dass Nvidia, der Endkunde, sich an die vorgelagerten Materiallieferanten wendet, um die Kapazität zu sichern und sicherzustellen, dass sie sie bekommen." Die Sorge ist, dass rivalisierende Chipkäufer um den Rest kämpfen werden, sobald Nvidia seinen Anteil festgeschrieben hat.
Nittobo sitzt nicht still. Neben der Erweiterung in Fukushima verdoppelt das Unternehmen die Rohgarnkapazität in seinem Werk in Taiwan und importiert Garn zurück nach Japan für die Gewebeherstellung. Es hat auch eine Kooperationsvereinbarung mit Nanya Plastics geschlossen, um einen Teil des Webens auszulagern. Das zeigt, wie eng der Markt ist: Nittobo arbeitet mit einem seiner größten Konkurrenten zusammen, um den Engpass zu lindern. Bis 2027 werden etwa 20% des Glasgewebes von Nittobo voraussichtlich von Nanya gewebt.
Die Speichermauer und die Stapelantwort
Verpackungsmaterial ist die eine Einschränkung. Speicherbandbreite ist die andere, und sie ist Gegenstand einer separaten Debatte, die sich durch die diesjährigen Chipkonferenzen zieht. Der Bericht von ServeTheHome über die Hot-Chips-2026-Präsentation von d-Matrix legt das Problem dar: Modellgewichte wachsen weiter, und der KV-Cache skaliert mit der Kontextlänge multipliziert mit der Batch-Größe. 64 Nutzer bei 1M Kontext können etwa 935 GB KV-Cache bedeuten.
SRAM erreicht das Bandbreitenziel, aber nur in winzigem Maßstab. Ein Paar Corsair-SRAM-Beschleunigerkarten erreicht etwa 300 TB/s bei etwa 1 ns Latenz, fasst aber nur etwa 4 GB. HBM löst die Kapazitätshälfte, kämpft aber bei der Bandbreite. d-Matrix nennt eine praktische Obergrenze von etwa 20 TB/s für HBM4-Pakete. So hohe Bandbreite hat einen Strompreis: Bei 2,4 pJ/Bit verbraucht das Schieben von 100 TB/s durch HBM etwa 1,92 kW, bevor jeglicher Fabric-Verkehr gezählt wird.
Die Antwort von d-Matrix ist, Rechenleistung direkt auf DRAM-Dies zu stapeln. Ein TSMC-N4-Logik-Die sitzt auf einem 3D-DRAM-Die unter Verwendung von 36 um Face-to-Face-Stapelung. Das Unternehmen beschreibt den Prozess als bewährt, kostengünstig, in hohen Stückzahlen und mit hoher Ausbeute. Die thermische Herausforderung ist real: d-Matrix sagt, dass ein 1-Hi-Logic-on-Top-Stapel mit nicht mehr als 0,5 W/mm² flüssig gekühlt werden kann und den DRAM unter 100 C hält. Vertikales 3D-IO kommt auf etwa 0,3 bis 0,4 pJ, etwa 10-mal niedriger als HBM.
Es gibt technische Kompromisse. Jede Tensor-Engine benötigt ein 128B-Flit pro Zugriff, und mit 3 Bänken pro Kanal liefert ein einzelner Zugriff 96B, was etwa 33% der Bandbreite verschwendet. Die Lösung von d-Matrix, Stream-Blocking genannt, teilt einen partiellen 32B-Zugriff über drei Flits, sodass der Overfetch auf null sinkt. Bei 32GB pro Karte kann ein Scale-up mit 72 Karten ein Frontier-Modell wie Kimi K3 bei 1M Kontext beherbergen.
Microsoft und Rebellions zeigen denselben Trend
Microsofts Maia 200, vorgestellt auf den Hot Chips 2026 und live von ServeTheHome berichtet, ist ein 3nm-Chip mit 140 Milliarden Transistoren, 6 HBM3e-Stapeln, 7TB/Sekunde HBM-Bandbreite, 750 Watt TDP und 10.000 TFLOPS FP4-Leistung. Das SoC-Die ist 820mm². Microsoft setzt ihn in Azure-Rechenzentren mit einem reinen Scale-up-Netzwerkdesign ein: 128 Racks und 6.000 Chips, verbunden über Tier-0- und Tier-1-Switches über einheitliches Ethernet. Attention-Benchmarks zeigen eine effektive Spitze von 1,65 PFLOPS, und Collective-Benchmarking erreicht fast 1,3TB/Sekunde bei BF16 AllReduce.
Auf den Hot Chips 2025 zeigte Rebellions einen anderen Ansatz für dasselbe Verpackungsproblem. Der REBEL-Quad nutzt vier HBM3E-Sites für 144GB Speicher und UCIe als Chiplet-Interconnect, gebaut auf Samsung SF4X und CoWoS-S mit vier Compute-ASICs und vier integrierten Siliziumkondensatoren pro Paket. ServeTheHome merkte an, dass es eine Dual-PCIe-Gen5-x16-Karte ist und dass das Unternehmen eine Live-Demo von Llama 3.3 70B mit durchschnittlich 35,5 msec pro Ausgabe-Token auf einem Entwicklungsboard vorführte.
Auch die akademische Seite bewegt sich. Stanford, Carnegie Mellon, Penn, MIT und SkyWater Technology berichteten über den ersten monolithischen 3D-Chip, der in einer US-Fab gebaut wurde, vorgestellt auf der 71. IEEE International Electron Devices Meeting im Dezember 2025. Frühe Hardware-Tests zeigen, dass der Prototyp vergleichbare 2D-Chips um etwa den Faktor vier übertrifft. Simulationen höherer Versionen deuten auf eine bis zu zwölffache Verbesserung bei KI-Workloads hin, einschließlich solcher, die von Metas LLaMA abgeleitet sind. Subhasish Mitra, der Stanford-Professor, der die Arbeit leitete, sagte, Durchbrüche wie dieser seien der Weg, auf dem die Branche zu den 1.000-fachen Hardware-Leistungsverbesserungen kommt, die künftige KI-Systeme verlangen werden.
Nichts davon kommt in dem Zeitrahmen, den der aktuelle Mangel verlangt. Die T-Glass-Einschränkung ist ein jahrelanges Problem. Die Stapelungs- und Verpackungsforschung, die den Druck später lindern könnte, steckt noch weitgehend in Präsentationsfolien und Entwicklungsboards.
Quellen
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Scientists and U.S. foundry achieve 3D chip breakthrough to accelerate AIEN
- 05Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.