Wie KI-Beschleuniger entstehen: Verpackung, Speicher und Engpässe im Design
Beim Rennen um KI-Beschleuniger geht es längst nicht mehr nur darum, wer den schnellsten Logikchip drucken kann. Drei Berichte aus der Lieferkette zeigen für 2026: Die Engpässe sitzen im Material, im Speicherstapel und im Entwicklungsprozess rund um den Chip.

KI-Beschleuniger werden meist über ihre Rechenleistung beschrieben. Nvidias GPUs, Microsofts Maia, d-Matrixs Raptor: Genannt werden Teraflops, Transistorzahlen und Speicherbandbreite. Die schwierigere Geschichte handelt von dem, was dieses Silizium umgibt. Im Jahr 2026 wurde diese Geschichte unübersichtlich.
Drei getrennte Berichte von Tom's Hardware, ServeTheHome und The Next Platform beschreiben drei verschiedene Engpässe. Ein spezielles Glasgewebe steckt in jedem fortschrittlichen Package. Eine Speicherarchitektur tauscht Kapazität gegen Bandbreite. Und eine Entwicklungspipeline wird selbst um KI-Agenten herum neu aufgebaut.
Ein Anteil von 90% bei einem Material, von dem die meisten nie gehört haben
Der erste Engpass ist ein Material namens T-Glas. Laut Tom's Hardware kontrolliert ein japanisches Unternehmen namens Nittobo rund 90% des weltweiten Angebots. T-Glas ist ein Glasfasergewebe mit niedrigem CTE. Es steckt im organischen Kern von IC-Substraten, also in der Verbindungsschicht zwischen einem Chip und seiner Leiterplatte. Große, hitzeintensive Packages hält es maßstabil, während sie dichter werden.
Das wird wichtiger, je größer KI-Prozessoren werden. Tom's Hardware zitiert Nvidia-Daten, denen zufolge die Interposer-Größen von 814mm² bei Hopper auf 1.700mm² bei Blackwell steigen, ein Zuwachs von 109%. Die kommenden Generationen Rubin und Feynman skalieren noch weiter. Jede Generation verbraucht mehr T-Glas pro Einheit. Eine neue T-Glas-Linie lässt sich zudem nicht schnell aus dem Boden stampfen. Sie braucht spezielle elektrische Schmelzöfen, die zwischen 1.600 und 1.700°C laufen, dazu Jahre an Investitionen und Know-how, um siliciumreiches Glas zu schmelzen, zu Garn zu spinnen und zu ultradünnem Gewebe zu weben.
Die Zahlen zeigen den Druck bereits. Tom's Hardware berichtet, dass die Preise um 20 bis 30% gestiegen sind. Die Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normalen 8 bis 10 Wochen auf über 20 verlängert. "Da das T-Glas-Angebot jetzt noch knapper ist, geben die Lieferanten keine Lieferzeiten mehr an", sagte Bill Ho, Analyst bei Yuanta, in dem Artikel.
Nittobo verdreifacht die Kapazität in seinem Werk in Fukushima, doch das neue Angebot erreicht den Markt erst Mitte 2027. Das Unternehmen verdoppelt zudem die Rohgarnkapazität in seinem Werk in Taiwan und importiert Garn zurück nach Japan für die Gewebeherstellung. Mit Nanya Plastics hat es eine Kooperationsvereinbarung geschlossen, um einen Teil des Webens auszulagern. Bis 2027 sollen rund 20% von Nittobos Glasgewebe von Nanya gewebt werden, wie aus der Offenlegung des Unternehmens hervorgeht. Dass Nittobo mit einem Wettbewerber zusammenarbeitet, zeigt, wie angespannt der Markt ist.
Bilal Hachemi, Analyst bei Yole Group, verfolgt die IC-Substrat-Lieferkette. Gegenüber Tom's Hardware Premium sagte er, T-Glas lasse sich nicht leicht ersetzen, weil es "spezifische Dielektrikum- und CTE-Werte hat, die für die KI-Chips besser funktionieren, besonders für den organischen Kern". Er verwies auch auf die dünnen Branchenmargen: "Jeder Anstieg der Nachfrage nach Build-up-Materialien, ABF-Material oder T-Glas kann zu einem möglichen Engpass führen, denn das widerspricht den Grundlagen dieser Branche", sagte er.
Die Bank of America schätzt, dass Nittobos Segment für elektronische Materialien den Umsatz von 40,9 Milliarden Yen (266 Millionen Dollar) im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird, bei operativen Margen von annähernd 48%. "Die Nachfrage nach T-Glas-Gewebe scheint stärker zu wachsen als ursprünglich erwartet", sagte Takashi Enomoto, Research-Analyst bei der Bank of America, im selben Beitrag.
Das auffälligste Detail ist vielleicht, wer jetzt an die Tür klopft. Hachemi sagte, es sei beispiellos, dass Nvidia sich direkt an einen vorgelagerten Materiallieferanten wie Nittobo wendet. "Zum ersten Mal sehen wir, dass Nvidia, der Endkunde, sich an die vorgelagerten Materiallieferanten wendet, um sich die Kapazität zu sichern und sicherzustellen, dass sie sie bekommen", sagte er. Die Sorge folgt unmittelbar: Sobald der größte Abnehmer seinen Anteil festgeschrieben hat, konkurrieren die rivalisierenden Chipabnehmer um das, was übrig bleibt.
Der Speicher ist die andere Wand
Der zweite Engpass liegt im Inneren des Beschleuniger-Packages. Auf den Hot Chips 2026 stellte d-Matrix seinen Raptor 3D-DRAM-Beschleuniger für generative Inferenz vor, und der Bericht von ServeTheHome legt die Kompromisse klar dar. Die Modellgewichte wachsen weiter, und der KV-Cache skaliert mit der Kontextlänge multipliziert mit der Batch-Größe. ServeTheHome nennt das Beispiel von 64 Nutzern bei 1M Kontext, was rund 935 GB KV-Cache bedeuten kann. Das ist zugleich ein Kapazitäts- und ein Bandbreitenproblem.
SRAM erreicht das Bandbreitenziel, hält aber fast nichts: Ein Paar Corsair-SRAM-Beschleunigerkarten erreicht rund 300 TB/s bei etwa 1 ns Latenz, fasst aber nur etwa 4 GB. HBM löst das Kapazitätsproblem, kämpft jedoch mit der Bandbreite. d-Matrix nennt eine praktische Obergrenze von rund 20 TB/s für HBM4-Packages wie Nvidias Vera Rubin und AMDs Instinct MI455. 100 TB/s durch HBM bei 2,4 pJ/bit würden etwa 1,92 kW verbrauchen, bevor überhaupt Fabric-Verkehr anfällt, so ServeTheHome.
Die Antwort von d-Matrix besteht darin, die Recheneinheit direkt auf die DRAM-Dies zu stapeln. Vertikales 3D-IO kommt auf rund 0,3 bis 0,4 pJ, etwa 10-mal weniger als HBM, weil es ein Pfad im Millimeterbereich ist und keine Interposer-Route im Zentimeterbereich. Das Unternehmen verwendet einen TSMC-N4-Logik-Die, der auf einem 3D-DRAM-Die mit 36 um Face-to-Face-Stapelung sitzt. Bei 32GB pro Karte, mit 4-Bit-Gewichten und einem 8-Bit-KV-Cache, kann ein Scale-up mit 72 Karten ein Frontier-Modell wie Kimi K3 bei 1M Kontext beherbergen, so ServeTheHome.
Nichts davon ist kostenlos. d-Matrix zufolge lässt sich ein 1-Hi-Logic-on-Top-Stapel mit höchstens 0,5 W/mm² flüssig kühlen und hält den DRAM unter 100 C. Das Unternehmen musste zudem ein unangenehmes Rechenproblem lösen. Jede Tensor-Engine braucht pro Zugriff ein 128B-Flit, doch sein Die hat 840 Bänke, nach 72 Ersatzbänken 768, verteilt auf 256 Kanäle. Das ergibt 3 Bänke pro Kanal. Ein einzelner Zugriff liefert 96B, also braucht ein 128B-Flit zwei Zugriffe und holt 192B. Damit gehen etwa 33% der Bandbreite nahe 33 TB/s verloren. Die Lösung heißt Stream Blocking: Ein partieller 32B-Zugriff wird auf drei Flits aufgeteilt, sodass 4 Zugriffe mit 96B drei Flits mit 128B versorgen.
Die Designschleife selbst wird automatisiert
Der dritte Engpass ist kein Material und kein Speichertyp, sondern der Entwicklungsprozess. The Next Platform berichtete am 27. Juli, dass Nvidia KI-Agenten in die Chipentwicklung drängt. Zitiert wird Tim Costa, Vice President und General Manager of Computational Engineering bei Nvidia. Er sagte Journalisten, die Branche werde bis 2030 voraussichtlich 2 Billionen Chips produzieren und etwa 41 Millionen Wafer pro Monat verarbeiten. Einzelne Packages steuern dabei auf eine Billion Transistoren zu.
"Der entscheidende Punkt ist keine einzelne Zahl; es ist das Zusammenspiel von Skalierung, Architektur, Verpackung und Systemkomplexität", sagte Costa. "Der traditionelle Designprozess kann mit dieser Größenordnung an Herausforderung einfach nicht Schritt halten."
Nvidia setzt seine Arm-basierte CPU Vera CV100 in den EDA-Workflows ein, mit denen seine künftigen CPUs und GPUs entstehen, einschließlich Simulation, formaler Verifikation und physischer Implementierung. Laut Costa zeigt frühes Engineering-Testing, dass Vera auf den Plattformen VCS von Synopsys und Jasper von Cadence 1,5-mal die Leistung von AMDs Epyc-Torrent-Systemen liefert. Vera hat 88 kundenspezifische Olympus-CPU-Kerne und ein LPDDR5X-Speichersubsystem mit 1,2 TB/sec. Nvidias CPU der nächsten Generation, Rosa, soll 2028 als Teil der Feynman-Datacenter-Plattform erscheinen.
Die Werkzeughersteller erheben eigene Ansprüche. Cadence sagte, seine AI Super Agents könnten Hunderte von Simulationen in weniger als einem Tag umsetzen, eine Arbeit, die derzeit fünf Wochen dauert, und damit 40-mal schnellere Register-Transfer-Level-Validierungszyklen liefern. Synopsys demonstrierte auf der Design Automation Conference einen vollständig autonomen Design-Verification-Workflow und sagte, er könne validiertes RTL 50-mal schneller liefern als andere Plattformen.
Diese Vielfachen sind mit Vorsicht zu behandeln. Sie stammen von den Anbietern, die die Werkzeuge verkaufen. The Next Platform weist zudem auf die breitere Branchenherausforderung von Orchestrierung, Integration und Leitplanken hin: KI-generierte Ergebnisse müssen vor der Freigabe noch verifiziert werden.
Microsofts Maia 200, vorgestellt auf den Hot Chips 2026 und von ServeTheHome behandelt, zeigt, wie die daraus resultierenden Designs aussehen. Es ist ein 3nm-Chip mit 140 Milliarden Transistoren, 6 Stapeln HBM3e, 7TB/second HBM-Bandbreite, einer TDP von 750 Watt, 10.000 TFLOPS FP4-Leistung und einem 820mm² großen SoC-Die. Microsoft verwendet eine vollständig verbundene Quad-Topologie ohne Scale-out-Netzwerk, nur Scale-up: Die Folie zeigt 128 Racks mit 6.000 Chips. Das Unternehmen hat auch den Software-Stack mitentwickelt, mit der Microsoft Collective Communication Library im Kern, weil der softwaredefinierte Datenfluss der Hardware darauf abgestimmte Kernel erfordert.
Fügt man die drei Geschichten zusammen, ergibt sich ein stimmiges Bild. Der Beschleuniger ist kein Chip mehr. Er ist ein Package, das von einem nahezu monopolistischen Materiallieferanten abhängt, von einer Speicherarchitektur, die mit der Arbeitslast gemeinsam entworfen werden muss, und von einer Designpipeline, die mit KI neu aufgebaut wird, um mit ihrer eigenen Komplexität Schritt zu halten. Jede Ebene hat ihre eigenen Lieferzeiten, und die langsamste gibt das Tempo vor.
Quellen
4- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
- 04Nvidia Accelerates Chip Engineering With AI AgentsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.