Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

In KI-Rechenzentren: RISC-V-Kerne, T-Glass-Knappheit und 3D-DRAM

Bei KI-Beschleunigern verschiebt sich gerade dreierlei zugleich: Wer die Bausteine lizenziert, wer die Verpackungsmaterialien bekommt und wie der Speicher unter der Recheneinheit gestapelt wird. The Register berichtete am 19. September 2024, dass SiFive nun eigene Beschleuniger-Baupläne anbietet, nicht nur RISC-V-CPU-Kerne.

TechnologieErklärtKatrin HoffmannVeröffentlicht: 27. September 20266 Min. LesezeitQuellen 3
In KI-Rechenzentren: RISC-V-Kerne, T-Glass-Knappheit und 3D-DRAM

SiFive ist seit Langem für RISC-V-CPU-Kerne bekannt, die andere Firmen an ihre KI-Chips anbauen. Diese Woche kündigte das Unternehmen an, einen kompletten eigenen Machine-Learning-Beschleuniger zu lizenzieren. Die Intelligence XM-Serie ist ein Cluster aus vier SiFive Intelligence X RISC-V CPU-Kernen, die mit einer hauseigenen Matrix-Mathe-Engine verdrahtet sind, so The Register.

John Ronco, SVP und GM von SiFive für Großbritannien, sagte zu The Register, einige Kunden wollten weiterhin eigene Hardware bauen, andere aber „wollten eher einen One-Stop-Shop von SiFive". Die frühere Arbeit des Unternehmens stellte seine CPU-Kerne neben Matrix-Engines von Drittanbietern, wie bei Googles Tensor Processing Units. Die XM-Cluster drehen das um: SiFive liefert jetzt das gesamte Beschleuniger-Design, das Kunden anpassen und an eine Fab schicken können.

Was ein einzelner Cluster tatsächlich leistet

Jeder Basis-XM-Cluster unterstützt bis zu 1TB/s Speicherbandbreite über eine kohärente Hub-Schnittstelle. SiFive erwartet bis zu 16 TOPS INT8 oder 8 teraFLOPS BF16 pro Gigahertz.

Zahlen pro Gigahertz können irreführen, denn das ist kein fertiger Chip. Die endgültige Leistung hängt davon ab, wie viele Cluster ein Kunde platziert, wie sie verdrahtet sind, was sonst noch auf dem Die sitzt und welches Strom- und Kühlbudget gilt. Ronco erwartet, dass die meisten Designs zwischen vier und acht Cluster nutzen. Bei 1GHz Takt ergibt das zwischen 4 und 8TB/s Spitzen-Speicherbandbreite und bis zu 32 bis 64 teraFLOPS BF16. Eine Nvidia H100 liefert fast ein PetaFLOPS dichtes BF16, der Vergleich schmeichelt also Nvidia. Aber FLOPS sind nicht alles bei bandbreitenbegrenzter Arbeit wie Inferenz. Ronco sagte, die XM-Cluster würden für KI-Training wohl kaum genutzt.

Die Skalierung ist die offene Frage. Ronco wollte nicht sagen, wie weit das Design reichen kann, und The Register merkte an, dass Prozesstechnologie und Die-Fläche die Grenzen setzen. Die Produkt-Foliensätze des Unternehmens legen 512 XM-Cluster nahe. Bei 1GHz ohne thermische oder Leistungsprobleme wären das rund vier PetaFLOPS BF16-Matrix-Rechenleistung. Nvidias bestausgestattete Blackwell-GPUs sind mit 2,5 PetaFLOPS BF16 angegeben.

SiFive kündigte außerdem an, eine Open-Source-Referenzimplementierung seiner SiFive Kernel Library zu veröffentlichen, um die Hürden für die RISC-V-Einführung zu senken. CEO Patrick Little behauptete in einer vorbereiteten Erklärung, das Unternehmen liefere RISC-V-basierte Chipdesigns an fünf der „Magnificent 7"-Firmen, eine Gruppe mit Microsoft, Apple, Nvidia, Alphabet, Amazon, Meta und Tesla. The Register merkte an, es vermute, dass nicht all dieses Silizium mit KI zu tun habe.

Der Verpackungsengpass, den niemand beobachtet

Designs sind das eine. Materialien das andere. Ein japanisches Unternehmen namens Nittobo kontrolliert rund 90% des weltweiten Angebots an speziellem Glasfasergewebe namens T-Glass, das in jedem fortschrittlichen KI-Chip-Package steckt, so Tom's Hardware. T-Glass ist ein Glasgewebe mit niedrigem CTE für den organischen Kern von IC-Substraten, der Verbindungsschicht zwischen einem Chip und seiner Leiterplatte. Es hält große, heiße Chip-Packages dimensional stabil, während sie dichter werden.

Die Nachfrage hat das Angebot überholt. Nittobo verdreifacht die Kapazität im Werk Fukushima, doch die neue Produktion erreicht den Markt erst Mitte 2027. Die Preise sind bereits um 20% bis 30% gestiegen, und Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normalen 8 bis 10 Wochen auf über 20 gestreckt. „Da das T-Glass-Angebot jetzt noch knapper ist, geben die Lieferanten keine Lieferzeiten mehr an", sagte Bill Ho, Analyst bei Yuanta, zu Tom's Hardware.

T-Glass zu ersetzen ist nicht einfach. Bilal Hachemi, Analyst bei Yole Group, der die IC-Substrat-Lieferkette verfolgt, sagte, das Material „hat spezifische Dielektrikum- und CTE-Werte, die für die KI-Chips besser funktionieren, besonders für den organischen Kern". Die Substratindustrie arbeitet mit dünnen Margen, daher können selbst mäßige Nachfrageschübe Knappheiten auslösen. „Jeder Anstieg der Nachfrage nach Build-up-Materialien, ABF-Material oder T-Glass kann eine mögliche Knappheit verursachen, denn das widerspricht den Grundlagen dieser Industrie", sagte Hachemi.

Hyperscaler verschlimmern es, indem sie immer größere Packages bestellen. Laut von Tom's Hardware zitierten Nvidia-Daten wuchsen die Interposer-Größen von 814mm2 für Hopper auf 1.700mm2 für Blackwell, ein Plus von 109%, wobei die Rubin- und Feynman-Generationen weiter skalieren. Die Bank of America schätzt, dass Nittobos Segment für elektronische Materialien den Umsatz von 40,9 Milliarden Yen, etwa 266 Millionen US-Dollar, im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird, mit operativen Margen nahe 48%.

Nittobo verdoppelt die Rohgarnkapazität im Werk Taiwan, importiert Garn zurück nach Japan für die Gewebeherstellung und lagert einen Teil der Weberei an Nanya Plastics aus, einen seiner größten Konkurrenten. Bis 2027 sollen rund 20% von Nittobos Glasgewebe von Nanya gewebt werden, teilte das Unternehmen mit. Hachemi sagte, dass Nvidia sich direkt an einen vorgelagerten Materiallieferanten wie Nittobo wendet, sei beispiellos, und warnte, sobald Nvidia seinen Anteil gesichert habe, würden rivalisierende Chipkäufer um den Rest kämpfen.

3D-DRAM und die Speicherwand

Der Speicher ist die dritte Front. Auf den Hot Chips 2026 präsentierte d-Matrix seinen Beschleuniger Raptor, der die Recheneinheit direkt auf DRAM-Dies stapelt, so ServeTheHome. Modellgewichte wachsen weiter, und der KV-Cache skaliert mit Kontextlänge mal Batch-Größe. Das Beispiel von ServeTheHome: 64 Nutzer bei 1M Kontext können rund 935GB KV-Cache bedeuten. Das ist sowohl ein Kapazitäts- als auch ein Bandbreitenproblem.

SRAM erreicht die Bandbreite, aber nur in winzigem Maßstab. Ein Paar Corsair-SRAM-Beschleunigerkarten erreicht rund 300TB/s bei etwa 1 Nanosekunde Latenz, fasst aber nur rund 4GB. HBM löst die Kapazität, kämpft aber mit der Bandbreite, mit einer praktischen Obergrenze um 20TB/s für HBM4-Packages wie Nvidias Vera Rubin und AMDs Instinct MI455, so d-Matrix. Gestapeltes 3D-DRAM liegt dazwischen: vertikales 3D-IO kostet rund 0,3 bis 0,4 pJ, etwa 10-mal weniger als HBM, weil es ein PHY-loser Pfad im Millimeterskala ist statt einer Interposer-Route im Zentimeterskala.

Raptor setzt einen TSMC-N4-Logic-Die auf einen 3D-DRAM-Die mit 36 Mikrometer Face-to-Face-Stapelung, ein Verfahren, das d-Matrix als bewährt, kostengünstig, hochvolumig und mit hoher Ausbeute beschreibt. Jede Karte fasst 32GB, und d-Matrix sagt, ein Scale-up mit 72 Karten könne ein Frontier-Modell wie Kimi K3 bei 1M Kontext mit 4-Bit-Gewichten und einem 8-Bit-KV-Cache beherbergen.

Die Technik ist nicht fertig. d-Matrix sagt, ein 1-Hi-Logic-on-Top-Stapel mit höchstens 0,5 W/mm2 lässt sich flüssig kühlen und hält den DRAM unter 100C. Der Die hat 840 Bänke, 768 nach 72 Reserves, über 256 Kanäle, was 3 Bänke pro Kanal ergibt. Ein 128B-Flit teilt sich nicht gleichmäßig darauf auf, also liefert ein einzelner Zugriff 96B und zwei Zugriffe holen 192B, was rund 33% der Bandbreite nahe 33TB/s verschwendet. Sein Stream-Blocking-Schema teilt einen partiellen 32B-Zugriff über drei Flits und senkt den Overfetch auf null.

Dann ist da die I/O-Leistung. 100TB/s bei 0,37 pJ/Bit zu bewegen ergibt 296W allein für I/O, und konventionelles DBI könnte 20% sparen. HBM kommt mit DBI zurecht, weil seine Mehrzyklus-Bursts der PHY den vollen Burst sehen lassen. Der Eintakt-256-Bit-3D-DRAM-Link von d-Matrix hat keinen Burst und keinen Sideband-Pin, um die Inversionswahl zu signalisieren, also nutzt er Stream-Flipping, vergleicht jeden Flit mit dem vorherigen und invertiert bei Bedarf.

Nichts davon kommt von allein. RISC-V-Beschleuniger-Baupläne, ein Quasi-Monopol auf ein Verpackungsgewebe und gestapeltes DRAM müssen alle zusammenpassen, bevor die nächste Generation von Rechenzentrums-Silizium ausgeliefert wird.

Kommentare 0

Quellen

3
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  3. 03D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.