Wie KI-Beschleuniger wirklich funktionieren: Kerne, Cluster-Bausteine und Speicher
SiFive lizenziert jetzt einen fertig einsetzbaren KI-Beschleuniger-Cluster, der auf vier RISC-V-CPU-Kernen und einer eigenen Matrix-Recheneinheit aufbaut. Das berichtete The Register am 19. September 2024.

SiFive hat jahrelang RISC-V-CPU-Kerne für die KI-Chips anderer Unternehmen entworfen. Jetzt verkauft die Firma ein komplettes Beschleuniger-Design. Jeder Cluster der Reihe Intelligence XM kombiniert vier RISC-V-CPU-Kerne der X-Serie mit einer hauseigenen Matrix-Recheneinheit, berichtet The Register.
Das ist eine Verschiebung. Googles Tensor Processing Units nutzen bereits SiFives X280-Kerne, um die Matrix-Multiplikationseinheiten zu versorgen. John Ronco von SiFive UK sagte gegenüber The Register, seine Entwürfe stünden auch hinter CPU-Kernen in Tenstorrents Blackhole-Beschleuniger. Der Unterschied ist nun, dass SiFive eine eigene Matrix-Engine mitbringt, statt Kerne an die eines Drittanbieters anzuhängen.
Was die Zahlen sagen und was nicht
Jeder Cluster unterstützt bis zu 1TB/sec Speicherbandbreite über eine kohärente Hub-Schnittstelle und soll bis zu 16 TOPS INT8 oder 8 TeraFLOPS BF16 pro Gigahertz liefern. Diese Angabe pro Gigahertz ist wichtig, weil ein Cluster kein Chip ist. Die Leistung hängt davon ab, wie viele Cluster ein Kunde auf dem Die platziert, wie sie verdrahtet sind, was sonst noch daneben liegt und mit welcher Frequenz der fertige Baustein getaktet wird.
Ronco erwartet, dass die meisten Designs vier bis acht Cluster nutzen. Bei 1GHz wären das 4 bis 8TB/sec Spitzen-Speicherbandbreite und 32 bis 64 TeraFLOPS BF16. SiFives Produktfolien legen 512 Cluster nahe. Bei 1GHz wären das rund vier PetaFLOPS BF16, mehr als die 2,5 PetaFLOPS, die Nvidia für seine besten Blackwell-GPUs angibt. Eine Nvidia H100 liefert im Vergleich dazu fast ein PetaFLOPS dichtes BF16.
Der Haken ist die Physik. 1GHz über 512 Cluster zu halten, ohne thermische oder Leistungsgrenzen zu reißen, ist die offene Frage. Ronco zögerte zu sagen, wie weit das Design skaliert. Er erwartet außerdem, dass die Cluster nicht breit für KI-Training genutzt werden. SiFive will eine Open-Source-Referenzimplementierung seiner SiFive Kernel Library veröffentlichen.
Speicherbandbreite ist der wiederkehrende Engpass
Der Grund, warum Beschleuniger so gebaut werden, ist, dass Inferenz, besonders die Decode-Phase, speichergebunden ist. d-Matrix bezifferte das Problem auf dem Hot Chips 2026 deutlich: 64 Nutzer bei 1M Kontext können rund 935GB KV-Cache bedeuten. Das Design Raptor stapelt einen TSMC-N4-Logikdie auf 3D-DRAM mit 36 Mikrometer Face-to-Face-Stapelung bei 32GB pro Karte, mit einem 72-Karten-Rack für Frontier-Modelle.
Rebellions zeigte auf dem Hot Chips 2025 einen anderen Ansatz. Das REBEL-Quad packt vier Compute-ASICs und vier HBM3E-Stellen für 144GB Speicher auf ein Samsung-SF4X- und CoWoS-S-Package und nutzt UCIe-A als Chiplet-Interconnect. ServeTheHome sah es auf einem Entwicklungsboard Llama 3.3 70B mit durchschnittlich 35,5 Millisekunden pro Ausgabe-Token laufen.
Zulieferer, Packaging und der Druck stromaufwärts
Nichts davon wird ohne Verpackungsmaterialien ausgeliefert. Tom's Hardware berichtete im März 2026, dass Nittobo rund 90% des weltweiten Angebots an T-Glass kontrolliert, dem Glasgewebe mit niedrigem CTE für IC-Substratkerne. Die Preise sind um 20 bis 30% gestiegen, während die Lieferzeiten für kupferkaschierte Laminate von normal 8 bis 10 auf über 20 Wochen stiegen. Nittobo verdreifacht die Kapazität in seinem Werk Fukushima, doch neues Angebot erreicht den Markt erst Mitte 2027. Die Bank of America schätzt, dass das Segment der elektronischen Materialien seinen Umsatz von 40,9 Milliarden Yen im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird.
Die politische Ebene ist ebenso verworren. TSMC soll den chinesischen Designer Sophgo im Oktober 2024 abgeschnitten haben, nachdem ein Kunde einen Chip bestellt hatte, der Huaweis Ascend 910B ähnelte. Sophgo bestritt jede Beziehung zu Huawei und erklärte, einen Untersuchungsbericht an TSMC übermittelt zu haben.
Quellen
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.