Was ist ein KI-Beschleuniger? Ein Blick in die Chips für die Inferenz im Rechenzentrum
KI-Beschleuniger sind spezialisierte Chips, die in Rechenzentrumsracks neben gewöhnlichen CPUs sitzen und die Matrixmathematik hinter Chatbots und Bildgeneratoren erledigen. Wie sie gebaut werden und wer sie bauen kann, ist interessanter als die Abkürzungen vermuten lassen.

Jedes große Sprachmodell, das Sie benutzt haben, lief mit hoher Wahrscheinlichkeit auf einem Chip, der keine CPU ist. Es ist ein Beschleuniger: Silizium, das auf eine einzige Art von Arithmetik ausgelegt ist, die Matrixmultiplikation, und das sehr schnell. Der Rest der Maschine ist nur dafür da, ihn zu füttern. Diese Arbeitsteilung erklärt den größten Teil des jüngsten Dramas auf dem Markt für Rechenzentren. Sie erklärt auch, warum Unternehmen, die früher CPU-Kerne, Speicher oder Packaging verkauft haben, heute über teraFLOPS, Speicherbandbreite und die Frage streiten, wie viele Bänke auf einen DRAM-Die passen.
Der Grundbaustein, und warum SiFive jetzt einen verkauft
SiFive hat jahrelang RISC-V-CPU-Kerne lizenziert, die andere Firmen an ihre eigenen KI-Engines anschlossen. Laut The Register nutzen zumindest einige von Googles Tensor Processing Units die X280-Kerne von SiFive, um die Machine-Learning-Beschleuniger zu verwalten und ihre Matrixmultiplikationseinheiten zu versorgen. Die Entwürfe von SiFive stecken auch in den CPU-Kernen des Blackhole-Beschleunigers von Tenstorrent, sagte John Ronco, SVP und GM von SiFive UK, der Publikation.
Im September 2024 änderte das Unternehmen seine Position. Es kündigte die Intelligence XM Serie an, ein lizenzierbares KI-Beschleuniger-Cluster statt nur den CPU-Teil. Das Basiscluster enthält vier Intelligence X RISC-V CPU-Kerne, die mit einer hauseigenen Matrix-Math-Engine verbunden sind. Jedes Cluster unterstützt bis zu 1TB/sec Speicherbandbreite und soll bis zu 16 TOPS INT8 oder 8 teraFLOPS BF16 pro Gigahertz liefern, so die Ausarbeitung von The Register.
"Für manche Kunden bleibt es richtig, ihre eigene Hardware zu bauen", sagte Ronco. "Aber manche Kunden wollten eher einen One-Stop-Shop von SiFive."
Diese Angabe pro Gigahertz wirkt zunächst seltsam. Sie ist ein Baustein, kein Chip. The Register merkt an, dass SiFive erwartet, dass die meisten Chips auf Basis des Designs mit etwa 1GHz laufen, und dass Ronco vier bis acht Cluster pro Chip erwartet. Bei acht Clustern und 1GHz sind das bis zu 64 teraFLOPS BF16. Das Produkt-Foliendeck legt nahe, dass 512 Cluster möglich sind. The Register rechnet vor, dass damit rund vier petaFLOPS BF16-Matrix-Compute erreichbar wären, oberhalb der 2,5 petaFLOPS, die Nvidia für seine bestausgestatteten Blackwell GPUs angibt. Diese Zahlen sind theoretisch. Die reale Leistung hängt vom Takt ab, vom Strom- und Kühlbudget, vom Prozessknoten und davon, was sich sonst noch den Die teilt. SiFive will außerdem eine Open-Source-Referenzimplementierung seiner SiFive Kernel Library veröffentlichen, um die Hürde für die RISC-V-Einführung zu senken.
Inferenz ist ein Speicherproblem, bevor sie ein Rechenproblem ist
Beschleuniger-Anbieter sprechen heute weniger über reine Rechenleistung und mehr über Speicher, denn dort wird die Inferenz tatsächlich langsam. d-Matrix nutzte seine Präsentation auf dem Hot Chips 2026, um die Arithmetik darzulegen: Die Modellgewichte wachsen weiter, und der KV-Cache skaliert mit der Kontextlänge multipliziert mit der Batch-Größe. ServeTheHome berichtet über d-Matrixs Beispiel von 64 Nutzern bei 1M Kontext, das etwa 935GB KV-Cache erzeugt. Kapazität und Bandbreite werden beide zum Problem, und beide wachsen weiter.
SRAM erreicht das Bandbreitenziel, hält aber fast nichts, etwa 4GB für ein Corsair-Kartenpaar bei rund 300 TB/s und 1ns Latenz, so ServeTheHome. Eine 6T-SRAM-Zelle ist etwa 10-mal größer als eine DRAM-Zelle. HBM löst die Kapazität, stößt aber an eine praktische Bandbreitengrenze von rund 20 TB/s für HBM4-Pakete wie Nvidias Vera Rubin und AMDs Instinct MI455. HBM-Bandbreite kostet zudem Strom: Bei 2,4 pJ/bit verbrauchen 100 TB/s über HBM etwa 1,92 kW, bevor Fabric-Verkehr hinzukommt.
Die Antwort von d-Matrix ist, Compute direkt auf DRAM-Dies zu stapeln. Das Unternehmen sagt, dass ein 1-Hi-Logic-on-Top-Stapel bei höchstens 0,5 W/mm2 flüssiggekühlt werden kann und den DRAM unter 100C hält. Vertikales 3D-IO landet bei etwa 0,3 bis 0,4 pJ, rund 10-mal niedriger als HBM. Die Raptor-Implementierung setzt einen TSMC N4 Logic-Die auf einen 3D-DRAM-Die mittels 36um Face-to-Face-Stapelung. Ein 72-Karten-Scale-up ist so dimensioniert, dass es ein Frontier-Modell wie Kimi K3 bei 1M Kontext beherbergt, mit 32GB pro Karte bei 4-Bit-Gewichten und einem 8-Bit-KV-Cache. Das Engineering-Detail ist wichtig, weil es zeigt, wie viel des Beschleuniger-Designs heute um Datenbewegung statt um Multiply-Accumulate-Einheiten kreist. Der Die von d-Matrix hat 840 Bänke, 768 nach Reservespeicher, über 256 Kanäle, was 3 Bänke pro Kanal ergibt. Einen 128B-Flit aus 32B-Bänken zu liefern, braucht daher zwei Zugriffe und holt 192B, was etwa 33 Prozent der Bandbreite nahe 33 TB/s verschwendet. Stream Blocking holt das zurück, indem ein partieller 32B-Zugriff über drei Flits geteilt wird.
Packaging, nicht nur Silizium
Es gibt eine zweite Einschränkung, die nichts mit Chipdesign zu tun hat. Tom's Hardware berichtete im März 2026, dass Nittobo, ein japanisches Unternehmen, rund 90 Prozent des globalen Angebots an T-Glas kontrolliert, einem Glasfasergewebe mit niedrigem CTE, das im organischen Kern von IC-Substraten verwendet wird. Jedes fortschrittliche KI-Chip-Paket enthält es. Die Nachfrage übersteigt das Angebot.
Die Zahlen sind deutlich. Nittobo verdreifacht die Kapazität in seinem Werk in Fukushima, aber das neue Angebot erreicht den Markt erst Mitte 2027. Die Preise sind um 20 bis 30 Prozent gestiegen, und die Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normalen 8 bis 10 Wochen auf über 20 verlängert. Laut Daten von Nvidia, die Tom's Hardware zitiert, sind die Interposer-Größen von 814mm2 für Hopper auf 1.700mm2 für Blackwell gewachsen, ein Anstieg um 109 Prozent, wobei Rubin und Feynman weiter skalieren.
"Da das T-Glas-Angebot jetzt noch knapper ist, geben die Lieferanten keine Lieferzeiten mehr an", sagte Bill Ho, Analyst bei Yuanta.
Nittobo verdoppelt die Rohgarnkapazität in seinem Werk in Taiwan und hat eine Kooperationsvereinbarung mit Nanya Plastics geschlossen, um einen Teil der Weberei auszulagern. Bis 2027 sollen rund 20 Prozent des Glasgewebes von Nittobo von Nanya gewebt werden, so Tom's Hardware. Die Bank of America schätzt, dass Nittobos Segment für elektronische Materialien seinen Umsatz von 40,9 Milliarden Yen im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird, mit operativen Margen von nahezu 48 Prozent.
Wer tatsächlich liefert
Während all das diskutiert wird, bringen einige Start-ups Silizium vor Publikum. Rebellions zeigte seinen REBEL-Quad-Beschleuniger auf dem Hot Chips 2025, so ServeTheHome: vier Compute-ASICs, vier HBM3E-Sites für 144GB Speicher, gebaut auf Samsung SF4X und CoWoS-S, mit UCIe-A als Chiplet-Interconnect und einer dualen PCIe Gen5 x16 Schnittstelle. Das Unternehmen führte eine Live-Demo von Llama 3.3 70B auf einem Entwicklungsboard mit durchschnittlich 35,5 msec pro Ausgabe-Token durch. ServeTheHome merkte an, dass viele Beschleuniger-Firmen nie so weit kommen wie zu einer öffentlichen laufenden Demo.
Auf der Client-Seite berichtete Draw Things, dass Metal FlashAttention v2.5 mit Neural Accelerators auf Apples M5 bis zu 4,6-mal bessere Leistung liefert als auf dem M4, mit Rohverbesserungen von 3,6 bis 5,5-mal und End-to-End-Gewinnen von 3,3 bis 4,6-mal auf einem M5 iPad. Die Software ist eine Vorschau: BF16-Unterstützung war zunächst wegen ungelöster Bugs deaktiviert, und Shader brauchen länger zum Spezialisieren. Die Messungen wurden mit einem Eis-Pad unter dem iPad für maximale Kühlung durchgeführt, was ebenso viel über den thermischen Spielraum aussagt wie über den Chip.
Nichts davon entscheidet, welche Architektur gewinnt. Es zeigt aber, dass der Rechenzentrums-Beschleuniger keine einzelne Produktkategorie mehr ist. Er ist ein Stapel aus CPU-Kernen, Matrix-Engines, Speichertechnologie, Packaging-Materialien und Softwarebibliotheken, jede mit ihrem eigenen Engpass und ihren eigenen Lieferzeiten.
Quellen
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.