Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

KI-Beschleuniger: Der Wettkampf im Rechenzentrum verlagert sich in die Packaging-Lieferkette

Anbieter von KI-Beschleunigern entwerfen derzeit neu, wie Rechenleistung mit dem Speicher kommuniziert. Der eigentliche Engpass sitzt aber weiter oben in der Kette: Ein japanischer Hersteller von Glasfasergewebe kontrolliert rund 90% eines Materials, das jedes fortschrittliche Package braucht. Neue Kapazität kommt erst Mitte 2027.

TechnologieAnalyseKatrin HoffmannVeröffentlicht: 27. September 20267 Min. LesezeitQuellen 5
KI-Beschleuniger: Der Wettkampf im Rechenzentrum verlagert sich in die Packaging-Lieferkette

Jede Diskussion über KI-Beschleuniger stößt 2026 irgendwann an dieselbe Grenze: die Speicherbandbreite. Rechenleistung ist teuer, aber verfügbar. Beim Verschieben von Gewichten und KV-Cache in den Speicher und wieder heraus entscheiden sich Leistungsbudget, Package-Größe und Liefertermin. Deshalb haben SiFive, d-Matrix und Rebellions in diesem Zyklus Entwürfe vorgestellt, die die Speicherschnittstelle angreifen und nicht das Multiply-Accumulate-Array.

The Register berichtete am 19. September 2024, dass SiFive seinen eigenen Beschleuniger lizenziert. Das Unternehmen war lange Zulieferer von RISC-V-CPU-Kernen für das KI-Silizium anderer Firmen. Das Intelligence-XM-Cluster kombiniert vier Intelligence-X-RISC-V-Kerne mit einer eigenen Matrix-Math-Engine. Jedes Cluster unterstützt bis zu 1TB/sec Speicherbandbreite und erreicht laut Datenblatt bis zu 16 TOPS INT8 oder 8 teraFLOPS BF16 pro Gigahertz. John Ronco von SiFive sagte der Publikation, die meisten Chips auf Basis des Entwurfs würden vier bis acht Cluster nutzen. Das ergibt 4 bis 8TB/sec Spitzen-Speicherbandbreite und bis zu 32 bis 64 teraFLOPS BF16 bei 1GHz.

Diese Zahlen sind bescheiden neben einer Nvidia H100.

Interessant ist, an wen SiFive verkauft. Ronco sagte, einige Kunden wollten weiterhin eigene Hardware bauen, andere wollten einen One-Stop-Shop. SiFive zielt nicht auf Google oder Tenstorrent, die bereits eigene Beschleuniger fertigen. Das Unternehmen zielt auf Organisationen, die einen fertigen Block zum Anpassen und zum Versand an eine Fab wollen.

Die Obergrenze ist unklar. Ronco war zurückhaltend, wie weit der Entwurf skaliert, doch die Produkt-Folien legen 512 XM-Cluster als Möglichkeit nahe. Bei 1GHz Takt wären das rund vier PetaFLOPS BF16-Matrixrechenleistung, gegenüber 2,5 PetaFLOPS für Nvidias am höchsten spezifizierte Blackwell-GPUs. SiFive kündigte außerdem eine Open-Source-Referenzimplementierung seiner SiFive Kernel Library an.

DRAM auf dem Logik-Die stapeln

Die Berichterstattung von ServeTheHome über Hot Chips 2026 beschreibt, dass d-Matrix einen anderen Weg geht: Logik direkt auf DRAM zu setzen. Der Raptor-Entwurf des Unternehmens stapelt einen TSMC-N4-Logik-Die auf einen 3D-DRAM-Die mittels 36-Mikrometer-Face-to-Face-Stapelung. d-Matrix argumentiert, SRAM erreiche das Bandbreitenziel, rund 300 TB/s bei etwa 1 ns Latenz für ein Paar Corsair-SRAM-Beschleunigerkarten, fasse aber nur rund 4GB, und eine 6T-SRAM-Zelle sei etwa zehnmal größer als eine DRAM-Zelle. HBM löst die Kapazitätsfrage, doch d-Matrix nennt eine praktische Bandbreitenobergrenze von rund 20 TB/s für HBM4-Packages wie Nvidia Vera Rubin und AMD Instinct MI455.

Die Leistungsaufnahme ist der Grund. Bei 2,4 pJ/Bit verbraucht der Transport von 100 TB/s durch HBM etwa 1,92 kW, bevor irgendein Fabric-Verkehr gezählt wird. Vertikales 3D-IO liegt dagegen bei rund 0,3 bis 0,4 pJ, etwa zehnmal niedriger als HBM, weil es ein PHY-loser Pfad im Millimeterbereich ist und keine Interposer-Route im Zentimeterbereich. Der Kompromiss ist thermisch: d-Matrix sagt, ein 1-Hi-Logic-on-Top-Stapel mit höchstens 0,5 W/mm2 lasse sich flüssigkeitskühlen und halte DRAM unter 100C.

Das Engineering-Detail macht die Behauptungen überprüfbar. Jede Tensor-Engine braucht ein 128B-Flit pro Zugriff. Da pro Spaltenzugriff aus 32B-Bänken 32B geliefert werden, bedeutet das vier Bänke pro Kanal. Der Die von d-Matrix hat 840 Bänke, nach 72 Reservespeichern 768, über 256 Kanäle: drei Bänke pro Kanal. Ein einzelner Zugriff liefert 96B, ein 128B-Flit braucht also zwei Zugriffe und holt 192B. Dadurch werden nahe 33 TB/s etwa 33% der Bandbreite verschwendet. Der Fix von d-Matrix, Stream Blocking, teilt einen partiellen 32B-Zugriff auf drei Flits, sodass vier Zugriffe mit 96B drei Flits mit 128B speisen. Der Overfetch sinkt auf null. Ein zweiter Trick, Stream Flipping, invertiert jeden Flit gegenüber dem vorherigen, um Schaltvorgänge zu senken und rund 20% der I/O-Leistung zurückzugewinnen, ohne den Sideband-Pin, den konventionelle Datenbus-Inversion braucht.

Bei 32GB pro Karte, mit 4-Bit-Gewichten und einem 8-Bit-KV-Cache, dimensioniert d-Matrix eine Scale-up-Konfiguration aus 72 Karten, um ein Frontier-Modell wie Kimi K3 bei 1M Kontext zu beherbergen. ServeTheHome merkt an, dass das Unternehmen die Arbeit auf den Hot Chips 2026 vorgestellt hat.

UCIe erreicht eine laufende Platine

Rebellions zeigte etwas Selteneres als eine Folie: laufendes Silizium. ServeTheHome berichtete am 25. August 2025, dass der Rebellions REBEL-Quad auf den Hot Chips 2025 auf einem Entwicklungsboard demonstriert wurde, das Llama 3.3 70B mit durchschnittlich 35,5 msec pro Ausgabe-Token ausführt. Das Package basiert auf Samsung SF4X und CoWoS-S, mit vier Compute-ASICs, vier HBM3E-Stellen für 144GB Speicher und vier integrierten Siliziumkondensatoren. Es nutzt UCIe-A als Chiplet-Interconnect und eine Dual-PCIe-Gen5-x16-Schnittstellenkarte.

ServeTheHome wertete die PCIe-Wahl als möglichen Fehlgriff, da Nvidias GB300 PCIe Gen6 einläutet. Das ist eine berechtigte Kritik an einem Teil, das auf Scale-out-Inferenz zielt. Doch die Demo zählt mehr als das Datenblatt. UCIe wird seit Jahren diskutiert, und Anbieter haben nur langsam vermarktet, dass sie es nutzen, weil der Interconnect im Package sitzt. Dass Rebellions so viele Siliziumstücke in einem großen Package integriert und es funktionierend zeigt, ist ein Datenpunkt, den das Chiplet-Ökosystem gebraucht hat.

Nicht jeder Beschleuniger braucht ein Rechenzentrumsrack. Draw Things veröffentlichte am 11. November 2025 Ergebnisse zu Metal FlashAttention v2.5 mit Neural Accelerators auf Apples M5 und beansprucht bis zu 4,6x Verbesserung gegenüber M4 in der eigenen Bild- und Videogenerierungs-App. Das Unternehmen berichtet 3,6x bis 5,5x rohe Leistungsgewinne gegenüber M4 iPad und 3,3x bis 4,6x Ende-zu-Ende. Ein M5 iPad arbeitet demnach im Bereich eines M2 Max und ist oft rund 80% langsamer als ein M3 Ultra (60c). Es sagt, ein 16GiB M5 iPad könne mit Wan 2.2 A14B-Modellen fünf Sekunden 480p-Video erzeugen. Die Veröffentlichung ist eine Vorschau: Draw Things sagt, BF16-Unterstützung sei anfangs wegen ungelöster Fehler aus gewesen und später in einem Build vom 17. November wiederhergestellt worden. Ungerade Attention-Sequenzlängen und große Head-Dimensionen verursachten weiterhin Leistungseinbrüche.

Das Material, von dem außerhalb des Packagings niemand gehört hat

All diese Entwurfsarbeit stößt auf ein Lieferkettenproblem, das nichts mit Architektur zu tun hat. Tom's Hardware berichtete am 9. März 2026, dass Nittobo rund 90% des weltweiten Angebots an T-Glass kontrolliert, einem Glasfasergewebe mit niedrigem CTE für den organischen Kern von IC-Substraten, der Verbindungsschicht zwischen einem Chip und seiner Leiterplatte. T-Glass hält große, heiße Packages dimensional stabil. E-Glass ist billiger, wird aber vor allem in Chips der unteren Preisklasse wie Mikrocontrollern und älteren Mobilprozessoren verwendet. Für massives 2.5D- und 3D-Packaging ist T-Glass bevorzugt.

Nittobo verdreifacht die Kapazität in seinem Werk in Fukushima, doch das neue Angebot erreicht den Markt erst Mitte 2027. Die Preise sind um 20% bis 30% gestiegen, und Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normal 8 bis 10 Wochen auf über 20 gestreckt. Yuanta-Analyst Bill Ho sagte Tom's Hardware, Zulieferer gäben keine Lieferzeiten mehr an. Bilal Hachemi von Yole Group sagte, T-Glass sei nicht leicht zu ersetzen, weil es spezifische Dielektrizitäts- und CTE-Werte habe, die für KI-Chips besser funktionierten, besonders für den organischen Kern. Außerdem seien die historisch dünnen Margen der IC-Substratbranche so, dass schon mäßige Nachfrageschübe Knappheiten auslösten.

Der Nachfretreiber ist die Package-Größe. Laut Daten von Nvidia, die Tom's Hardware zitiert, sind die Interposer-Größen von 814mm2 für Hopper auf 1.700mm2 für Blackwell gewachsen, ein Anstieg um 109%, wobei Rubin und Feynman weiter skalieren. Bank of America schätzt, dass Nittobos Segment für elektronische Materialien den Umsatz von 40,9 Milliarden Yen im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird, mit operativen Margen nahe 48%. Nittobo verdoppelt die Rohgarnkapazität in seinem Werk in Taiwan und hat eine Kooperationsvereinbarung mit Nanya Plastics geschlossen, um einen Teil des Webens auszulagern. Bis 2027 sollen rund 20% von Nittobos Glasgewebe von Nanya gewebt werden.

Nittobo arbeitet mit einem seiner größten Konkurrenten zusammen, um den Engpass zu lindern. Das ist das deutlichste Signal dafür, wo die Einschränkung sitzt. Beschleuniger-Architekten können weiter Pikojoule pro Bit einsparen. Wenn aber das Gewebe im Substrat Jahre im Voraus zugeteilt wird, entscheidet sich der Liefertermin ganz woanders.

Kommentare 0

Quellen

5
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  4. 04Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
  5. 05Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.