Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

KI-Beschleuniger: der Packaging-Engpass, den niemand einpreist, und die Startups, die gegen HBM wetten

Ein japanisches Unternehmen, von dem die meisten Rechenzentrumsbetreiber nie gehört haben, kontrolliert rund 90% des weltweiten Angebots an einem Glasgewebe, das in jedem fortschrittlichen KI-Chip-Package steckt. Seine nächste Produktionslinie kommt erst Mitte 2027.

TechnologieAnalyseKatrin HoffmannVeröffentlicht: 27. September 20265 Min. LesezeitQuellen 5
KI-Beschleuniger: der Packaging-Engpass, den niemand einpreist, und die Startups, die gegen HBM wetten

Nittobos T-Glas ist ein Glasgewebe mit niedrigem CTE. Es sitzt im organischen Kern von IC-Substraten, der Verbindungsschicht zwischen einem Chip und seiner Leiterplatte. Laut Tom's Hardware hält das Unternehmen rund 90% des weltweiten Angebots. Die Nachfrage hat das Angebot so stark überholt, dass sich die Lieferzeiten für kupferkaschierte Laminate stromabwärts von normalen 8 bis 10 Wochen auf über 20 verlängert haben. Die Preise sind um 20 bis 30% gestiegen.

Diese Zahl ist wichtiger, als sie aussieht. Jede Generation von KI-Beschleunigern bekommt einen größeren Interposer und ein komplexeres Substrat. Jeder Chip verbraucht also mehr von dem Material. Nvidias eigene Daten, zitiert von Tom's Hardware, nennen Interposer-Größen von 814mm² für Hopper und 1.700mm² für Blackwell, ein Plus von 109%. Rubin und Feynman skalieren weiter. Die Angebotsseite kann nicht schnell antworten: T-Glas braucht elektrische Schmelzöfen, die zwischen 1.600 und 1.700°C laufen. Nittobo verdreifacht die Kapazität in seinem Werk in Fukushima. Neue Produktion kommt erst Mitte 2027 auf den Markt.

In dem Bericht zitierte Analysten beschreiben einen Markt, in dem Substitution schwierig ist. "Es ist nicht einfach, das T-Glas zu ersetzen", sagte Bilal Hachemi von der Yole Group zu Tom's Hardware. Er verwies auf spezifische Dielektrikum- und CTE-Werte, die für KI-Chips geeignet sind, besonders den organischen Kern. Der Yuanta-Analyst Bill Ho sagte, Lieferanten hätten ganz aufgehört, Lieferzeiten zu nennen. Takashi Enomoto von der Bank of America erwartet, dass sich Nittobos Umsatz mit elektronischen Materialien von ¥40,9 Milliarden (266 Millionen US-Dollar) im Jahr 2025 auf ¥87,7 Milliarden bis März 2028 fast verdoppelt, mit operativen Margen von annähernd 48%.

Ein Detail sticht hervor. Hachemi sagte, dass Nvidia direkt zu einem vorgelagerten Materiallieferanten zu gehen in diesem Teil der Kette beispiellos war. Wenn der größte Käufer zuerst Kapazität sperrt, verhandeln alle anderen über den Rest.

Speicherbandbreite ist die andere Wand

Während das Packaging enger wird, streiten Beschleuniger-Designer über den Speicher. Auf den Hot Chips 2026 präsentierte d-Matrix Raptor, einen Beschleuniger, der einen TSMC-N4-Logik-Die auf einen 3D-DRAM-Die stapelt, mittels 36-Mikron-Face-to-Face-Stacking, laut ServeTheHome. Das Argument ist, dass weder SRAM noch HBM allein für Inferenz passen. SRAM liefert Bandbreite, hält aber wenig Kapazität. HBM liefert Kapazität, stößt aber an Pin-Geschwindigkeit, Stack-Anzahl und Package-Beachfront. d-Matrix nennt eine praktische Obergrenze von etwa 20 TB/s für HBM4-Packages.

Bandbreite hat eine Stromrechnung. Der Bericht von ServeTheHome setzt HBM bei 2,4 pJ/Bit an, das heißt 100 TB/s kosten etwa 1,92 kW vor Fabric-Verkehr. Vertikales 3D-IO liegt bei etwa 0,3 bis 0,4 pJ, rund zehnmal niedriger, weil es ein Pfad im Millimeterbereich ist und keine Interposer-Route im Zentimeterbereich.

d-Matrix' Zahlen sind konkret und unglamourös. Jede Tensor-Engine braucht ein 128B-Flit pro Zugriff, aber 32B-Bänke über 256 Kanäle ergeben 3 Bänke pro Kanal nach Reservespeicher, was 96B pro Zugriff zurückgibt. Zwei Zugriffe holen 192B, um 128B zu liefern, und verschwenden damit etwa 33% der Bandbreite nahe 33 TB/s. Die Lösung des Unternehmens, Stream Blocking, teilt einen partiellen Zugriff über drei Flits, sodass 384B hinein zu 384B heraus passen, mit Overfetch, der auf null fällt. Bei 32GB pro Karte mit 4-Bit-Gewichten und einem 8-Bit-KV-Cache sagt d-Matrix, dass ein Scale-up mit 72 Karten ein Frontier-Modell bei 1M Kontext beherbergen kann.

Chiplets und der RISC-V-Lizenzwandel

Packaging-Einschränkungen und Speicher-Abwägungen treiben Anbieter zu unterschiedlichen Integrationsstrategien. Rebellions zeigte seinen REBEL-Quad auf den Hot Chips 2025: vier Compute-ASICs, vier HBM3E-Sites für 144GB und UCIe-A als Die-to-Die-Interconnect, gebaut auf Samsung SF4X und CoWoS-S, laut ServeTheHome. Die Karte läuft mit dual PCIe Gen5 x16, und das Unternehmen führte Llama 3.3 70B auf einem Entwicklungsboard bei durchschnittlich 35,5 msec pro Ausgabe-Token vor.

ServeTheHome merkte an, dass die PCIe-Wahl unbequem gegen Nvidias Bewegung in Richtung Gen6 steht, behandelte aber die Live-Demo als die bedeutendere Tatsache: ein funktionierender UCIe-basierter Chip in der Öffentlichkeit, was selten genug ist, um es zu erwähnen. Auf der Compute-Seite hat SiFive den Wechsel vollzogen, von der Lizenzierung von RISC-V-CPU-Kernen an andere KI-Silizium-Unternehmen zum Verkauf eines eigenen Beschleuniger-Designs. The Register berichtete am 19. September 2024, dass SiFives Intelligence-XM-Cluster vier Intelligence-X-CPU-Kerne mit einer hauseigenen Matrix-Math-Engine kombinieren, mit bis zu 1TB/sec Speicherbandbreite pro Cluster und bis zu 16 TOPS INT8 oder 8 teraFLOPS BF16 pro Gigahertz.

John Ronco, SiFives SVP und GM für das Vereinigte Königreich, sagte zu The Register, dass einige Kunden immer noch ihre eigene Hardware wollen, andere aber einen One-Stop-Shop wollten. Er erwartete, dass die meisten auf dem Design gebauten Chips vier bis acht Cluster nutzen, und war zurückhaltend, wie weit es skaliert, obwohl das Slide-Deck des Unternehmens 512 Cluster als möglich nahelegt. Zum Vergleich: Nvidias Top-Blackwell-Teile sind mit 2,5 petaFLOPS BF16 bewertet.

SiFive liefert bereits RISC-V-Designs, die in Googles Tensor Processing Units und in Tenstorrents Blackhole verwendet werden. CEO Patrick Little behauptete in einer vorbereiteten Erklärung, das Unternehmen beliefere fünf der "Magnificent 7"-Firmen. The Register kennzeichnete diese Behauptung als wahrscheinlich nicht alle KI-bezogen.

Sanktionen zeichnen die Karte weiter neu

Die Lieferkette wird auch durch Exportkontrollen neu gezeichnet. The Register berichtete am 28. Oktober 2024, dass TSMC den chinesischen Designer Sophgo angeblich abgeschnitten habe, wegen des Verdachts, Komponenten an Huawei liefern zu wollen. Reuters, unter Berufung auf zwei mit der Sache vertraute Personen, identifizierte den Kunden, der einen Chip bestellte, der Huaweis Ascend 910B ähnelt. Sophgo bestritt jede direkte oder indirekte Geschäftsbeziehung zu Huawei und sagte, es habe TSMC einen detaillierten Untersuchungsbericht vorgelegt. Bitmain, mit Sophgo verbunden, nannte die Vorwürfe falsch und haltlos.

The Register merkte an, dass Bitmains Vorgeschichte nicht sauber ist: 2021 durchsuchten Staatsanwälte seine Büros in Taiwan und beschuldigten zwei verbundene Firmen, illegal taiwanische Ingenieure anwerben zu wollen. TSMC stellte 2020 unter US-Regeln das Geschäft mit Huawei ein.

Huaweis Ascend 910B ist mit 320 teraFLOPS FP16 oder 640 teraFLOPS Int8 bewertet, laut diesem Bericht ungefähr auf Augenhöhe mit Nvidias vier Jahre altem A100. Langsamer als die aktuelle Frontier, aber verfügbar. Das ist der Teil, der zählt, wenn Exportobergrenzen weiter enger werden.

Kommentare 0

Quellen

5
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  4. 04SiFive expands from RISC-V cores for AI chips to designing its own full-fat acceleratorEN
  5. 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.