SiFive lizenziert eigenen KI-Beschleuniger nach Arm-Vorbild, während Chipmaterial knapp wird
SiFive lizenziert jetzt ein komplettes KI-Beschleuniger-Design, die Intelligence-XM-Cluster. Bisher verkaufte das Unternehmen nur RISC-V-CPU-Kerne, die in Silizium von Google und Tenstorrent stecken. Laut SiFive liefert jeder Cluster bis zu 16 TOPS bei INT8 oder 8 TeraFLOPS bei BF16 pro Gigahertz.

SiFive hat sein Geschäft mit RISC-V-CPU-Kernen für die KI-Chips anderer aufgebaut. Jetzt will das Fabless-Unternehmen den Beschleuniger selbst verkaufen. Die diese Woche vorgestellte Intelligence-XM-Serie ist ein lizenzierbarer Cluster. Kunden setzen ihn in einen Prozessor oder ein System-on-Chip ein und schicken ihn an eine Fab, wie The Register am 19. September berichtete.
Der Basiscluster besteht aus vier Intelligence-X-RISC-V-CPU-Kernen von SiFive, die mit einer hauseigenen Matrix-Recheneinheit verbunden sind. Jeder Cluster unterstützt bis zu 1TB/sec Speicherbandbreite über eine kohärente Hub-Schnittstelle und ist mit bis zu 16 TOPS bei INT8 oder 8 TeraFLOPS bei BF16 pro Gigahertz spezifiziert. SiFive erwartet, dass die meisten Chips auf Basis des Designs mit etwa 1GHz laufen.
Diese Angabe pro Gigahertz braucht Kontext. Es handelt sich nicht um einen kompletten Chip.
Die tatsächliche Leistung hängt davon ab, wie viele Cluster ein Kunde platziert, wie sie intern verdrahtet sind, was sonst noch auf dem Die sitzt und wie viel Strom und Kühlung verfügbar sind. John Ronco, SVP und GM von SiFive UK, sagte gegenüber The Register, dass die meisten Chips auf Basis des Designs zwischen vier und acht Cluster nutzen werden. Bei 1GHz ergibt das zwischen 4 und 8TB/sec Spitzen-Speicherbandbreite und bis zu 32 bis 64 TeraFLOPS bei BF16. Die Produktfolien von SiFive legen nahe, dass 512 Cluster im Bereich des Möglichen liegen. Ronco wollte jedoch nicht sagen, wie weit das Design skaliert. Bei 512 Clustern und 1GHz käme das Design auf rund vier PetaFLOPS BF16-Matrix-Rechenleistung, gegenüber 2,5 PetaFLOPS für Nvidias bestausgestattete Blackwell-GPUs.
Ronco erwartet, dass die Cluster kaum für KI-Training genutzt werden. FLOPS sind nicht alles, besonders bei bandbreitenbegrenzter Inferenzarbeit, und Preis, Leistungsaufnahme und Fertigungsprozess spielen ebenfalls eine Rolle.
Von Tom's Hardware zitierte Analysten verweisen auf eine andere Einschränkung der Versorgung mit KI-Beschleunigern: T-Glass, ein Glasfasergewebe mit niedrigem CTE, das im organischen Kern von IC-Substraten verwendet wird. Nittobo, das japanische Unternehmen, das rund 90% des Weltangebots kontrolliert, verdreifacht die Kapazität in seinem Werk Fukushima. Tom's Hardware berichtete am 9. März 2026, dass das neue Angebot erst Mitte 2027 auf den Markt kommt.
Die Preise für T-Glass sind um 20 bis 30% gestiegen, und die Lieferzeiten für nachgelagerte Materialien wie kupferkaschierte Laminate haben sich von normalerweise 8 bis 10 Wochen auf über 20 verlängert. "Da das T-Glass-Angebot jetzt noch knapper ist, geben die Lieferanten keine Lieferzeiten mehr an", sagte Bill Ho, Analyst bei Yuanta.
Bilal Hachemi, Analyst bei der Yole Group, der die Lieferkette für IC-Substrate verfolgt, sagte gegenüber Tom's Hardware Premium, dass der Austausch des Materials nicht einfach sei, weil T-Glass "spezifische dielektrische und CTE-Werte hat, die für die KI-Chips besser funktionieren, besonders für den organischen Kern". Er fügte hinzu, dass die IC-Substratindustrie historisch mit dünnen Margen gearbeitet habe, sodass "jede Nachfragesteigerung bei Build-up-Materialien, ABF-Material oder T-Glass zu einem möglichen Engpass führen kann, weil es den Grundlagen dieser Branche widerspricht".
Von Tom's Hardware zitierte Nvidia-Daten zeigen, dass die Interposer-Größen von 814mm² bei Hopper auf 1.700mm² bei Blackwell wachsen, ein Plus von 109%, wobei Rubin und Feynman weiter skalieren. Die Bank of America schätzt, dass Nittobos Segment für elektronische Materialien seinen Umsatz von 40,9 Milliarden Yen (266 Millionen Dollar) im Jahr 2025 auf 87,7 Milliarden Yen bis März 2028 fast verdoppeln wird, mit operativen Margen von annähernd 48%. Hachemi sagte, es sei beispiellos, dass Nvidia sich direkt an einen vorgelagerten Materiallieferanten wende.
Andernorts hat TSMC Berichten zufolge die Lieferungen an den chinesischen Chipdesigner Sophgo eingestellt, wegen des Vorwurfs, er habe versucht, Komponenten unter Verstoß gegen US-Sanktionen an Huawei zu liefern, wie The Register am 28. Oktober berichtete. Der Schritt folgte darauf, dass TSMC US-Beamte über eine Kundenbestellung informierte, die Huaweis Ascend-910B-Beschleuniger ähnelte. Reuters nannte unter Berufung auf zwei mit der Sache vertraute Personen Sophgo. Das Unternehmen wies die Berichte in einer am Sonntag veröffentlichten Erklärung zurück und erklärte, es habe "nie eine direkte oder indirekte Geschäftsbeziehung zu Huawei unterhalten" und einen detaillierten Untersuchungsbericht an TSMC übermittelt. Bitmain, ein mit Sophgo verbundenes chinesisches Krypto-Ausrüstungsunternehmen, wies eine Beteiligung ebenfalls zurück und nannte die Vorwürfe "falsch und haltlos".
Huaweis Ascend 910B ist mit 320 TeraFLOPS bei FP16 oder 640 TeraFLOPS bei Int8 spezifiziert, etwa auf Augenhöhe mit Nvidias A100. TSMC stellte das Geschäft mit Huawei 2020 im Rahmen der US-Entity-List-Regeln ein.
Auf der Architekturseite zeigte Rebellions seinen REBEL-Quad-Beschleuniger auf den Hot Chips 2025, laut ServeTheHome. Das Package kombiniert vier Compute-ASICs, vier HBM3E-Sites für 144GB Speicher und vier integrierte Siliziumkondensatoren, gebaut auf Samsung SF4X und CoWoS-S, und nutzt UCIe-A als Chiplet-Interconnect. ServeTheHome berichtete von einer Live-Demo mit Llama 3.3 70B, die auf einem Entwicklungsboard durchschnittlich 35,5 msec pro ausgegebenem Token erreichte.
d-Matrix nutzte die Hot Chips 2026, um Raptor vorzustellen, einen Beschleuniger, der einen TSMC-N4-Logic-Die mithilfe von 36-Mikrometer-Face-to-Face-Stacking auf einen 3D-DRAM-Die stapelt. ServeTheHome berichtete von der Behauptung des Unternehmens, dass ein 1-Hi-Logic-on-Top-Stack mit nicht mehr als 0,5 W/mm² flüssig gekühlt werden kann, während der DRAM unter 100 C bleibt. Bei 32GB pro Karte, mit 4-Bit-Gewichten und einem 8-Bit-KV-Cache, kann laut d-Matrix ein Scale-up mit 72 Karten ein Frontier-Modell wie Kimi K3 bei 1M Kontext beherbergen.
Auf der Client-Seite erklärte Draw Things, dass sein Metal FlashAttention v2.5 mit Neural Accelerators auf Apples M5 bis zu 4,6-mal bessere Leistung liefert als auf dem M4, und dass ein M5-iPad mit 16GiB RAM 480p-Video in fünf Sekunden mit Wan-2.2-A14B-Modellen erzeugen kann. Die Veröffentlichung ist eine Vorschau: Das Unternehmen erklärte, die BF16-Unterstützung sei zunächst wegen ungelöster Fehler abgeschaltet gewesen, und die Neural-Accelerator-Shader bräuchten bei der ersten Generierung 10 Sekunden oder mehr zur Spezialisierung. Eine spätere Bearbeitung vermerkte, dass Build 1.20251117.1 BF16 und einen Cache für binäre Artefakte hinzugefügt hat.
Quellen
6- 01SiFive offers drop-in AI accelerator driven by RISC-V CPUsEN
- 02TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
- 03Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 04d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 05Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 06Metal FlashAttention v2.5 w/ Neural Accelerators: delivering breakthrough performance on the Apple M5 chipEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.