SiFive licencjonuje własny akcelerator AI, wzorem Arma, gdy brakuje materiałów na chipy
SiFive zaczęło licencjonować gotowy projekt akceleratora AI, swoje klastry Intelligence XM. Firma wychodzi w ten sposób poza rdzenie RISC-V, które sprzedaje już do układów Google i Tenstorrent. Każdy klaster daje do 16 TOPS w INT8 albo 8 teraFLOPS w BF16 na gigaherc.

SiFive zbudowało biznes na rdzeniach RISC-V dla cudzych układów AI. Firma nie ma własnej fabryki. Teraz chce sprzedawać sam akcelerator. Seria Intelligence XM, ogłoszona w tym tygodniu, to licencjonowany klaster. Klient wstawia go do procesora albo systemu na chipie i wysyła do fabryki. The Register pisał o tym 19 września.
Podstawowy klaster opiera się na czterech rdzeniach RISC-V Intelligence X firmy SiFive. Rdzenie łączy własny silnik do matematyki macierzowej. Każdy klaster obsługuje do 1TB/s przepustowości pamięci przez spójny interfejs hub. Ma do 16 TOPS w INT8 albo 8 teraFLOPS w BF16 na gigaherc. SiFive spodziewa się, że większość układów zbudowanych na tym projekcie będzie pracować na około 1GHz.
Ta wartość na gigaherc wymaga kontekstu. To nie jest kompletny chip.
Rzeczywista wydajność zależy od tego, ile klastrów umieści klient i jak je wewnętrznie połączy. Liczy się też to, co jeszcze znajdzie się na płytce oraz ile jest mocy i chłodzenia. John Ronco, SVP i GM SiFive UK, powiedział The Register, że większość układów opartych na tym projekcie użyje od czterech do ośmiu klastrów. Przy 1GHz daje to od 4 do 8TB/s szczytowej przepustowości pamięci i od 32 do 64 teraFLOPS w BF16. Slajdy produktowe SiFive sugerują, że 512 klastrów mieści się w granicach możliwości. Ronco wahał się jednak powiedzieć, jak daleko skaluje się projekt. Przy 512 klastrach i 1GHz projekt miałby około czterech petaFLOPS obliczeń macierzowych w BF16. Najlepiej wyposażone GPU Blackwell Nvidii dają 2,5 petaFLOPS.
Ronco oczekuje, że klastry nie będą zbyt często używane do trenowania AI. FLOPS to nie wszystko, zwłaszcza przy wnioskowaniu ograniczonym przepustowością pamięci. Cena, moc i proces technologiczny też mają znaczenie.
Analitycy cytowani przez Tom's Hardware wskazują na inne ograniczenie podaży akceleratorów AI. Chodzi o T-glass, tkaninę z włókna szklanego o niskim CTE, używaną w organicznym rdzeniu podłoży IC. Nittobo, japońska firma kontrolująca około 90% światowej podaży, potraja moce w zakładzie w Fukushimie. Tom's Hardware podał 9 marca 2026, że nowa podaż trafi na rynek dopiero w połowie 2027.
Ceny T-glass wzrosły o 20 do 30%. Terminy dostaw materiałów niższego szczebla, takich jak laminaty pokryte miedzią, wydłużyły się z normalnych 8 do 10 tygodni do ponad 20. "Przy jeszcze bardziej ograniczonej podaży T-glass dostawcy nie podają już terminów", powiedział Bill Ho, analityk w Yuanta.
Bilal Hachemi, analityk w Yole Group, śledzi łańcuch dostaw podłoży IC. Powiedział Tom's Hardware Premium, że zastąpienie tego materiału nie jest łatwe. T-glass "ma konkretne wartości przenikalności i CTE, które lepiej działają w układach AI, zwłaszcza w organicznym rdzeniu". Dodał, że branża podłoży IC od zawsze działała na cienkich marżach. Dlatego "każdy wzrost popytu na materiały build-up, materiał ABF albo T-glass może wywołać niedobór, bo to kłóci się z podstawami tej branży".
Dane Nvidii cytowane przez Tom's Hardware pokazują, że rozmiary interposerów rosną z 814mm² dla Hoppera do 1 700mm² dla Blackwella, czyli o 109%. Rubin i Feynman mają skalować dalej. Bank of America szacuje, że segment materiałów elektronicznych Nittobo niemal podwoi sprzedaż z 40,9 mld jenów (266 mln dolarów) w 2025 do 87,7 mld jenów do marca 2028. Marże operacyjne zbliżają się do 48%. Hachemi powiedział, że bezpośredni kontakt Nvidii z dostawcą materiałów wyżej w łańcuchu był bez precedensu.
Poza tym TSMC miało odciąć dostawy do chińskiego projektanta układów Sophgo. Powód to zarzuty, że próbował dostarczać komponenty Huaweiowi z naruszeniem amerykańskich sankcji. The Register pisał o tym 28 października. Krok nastąpił po tym, jak TSMC ostrzegło amerykańskich urzędników o zamówieniu klienta przypominającym akcelerator Ascend 910B Huawei. Reuters, powołując się na dwie osoby znające sprawę, wskazał Sophgo. Firma zaprzeczyła tym doniesieniom w niedzielnym oświadczeniu. Napisała, że "nigdy nie wchodziła w żadne bezpośrednie ani pośrednie relacje biznesowe z Huawei", i złożyła TSMC szczegółowy raport z dochodzenia. Bitmain, chińska firma sprzętu kryptowalutowego powiązana z Sophgo, też zaprzeczyła udziałowi. Zarzuty nazwała "fałszywymi i bezpodstawnymi".
Huawei Ascend 910B ma 320 teraFLOPS w FP16 albo 640 teraFLOPS w Int8, mniej więcej tyle co Nvidia A100. TSMC przestało robić interesy z Huawei w 2020 na mocy przepisów amerykańskiej listy Entity.
Po stronie architektury Rebellions pokazało swój akcelerator REBEL-Quad na Hot Chips 2025, według ServeTheHome. Pakiet łączy cztery ASIC obliczeniowe, cztery miejsca HBM3E na 144GB pamięci i cztery zintegrowane kondensatory krzemowe. Zbudowano go na Samsung SF4X i CoWoS-S, a jako łącznika chipletów używa UCIe-A. ServeTheHome podało, że demo Llama 3.3 70B działało na płytce deweloperskiej ze średnim czasem 35,5 msec na token wyjściowy.
d-Matrix wykorzystało Hot Chips 2026, żeby przedstawić Raptora. To akcelerator, który nakłada układ logiczny TSMC N4 na układ 3D DRAM, łącząc je twarzą do twarzy w 36 mikronach. ServeTheHome podało, że firma twierdzi, iż stos 1-Hi z logiką na wierzchu przy nie więcej niż 0,5 W/mm² można chłodzić cieczą, utrzymując DRAM poniżej 100 C. Przy 32GB na kartę, wagach 4-bitowych i 8-bitowym cache KV d-Matrix twierdzi, że skala 72 kart pomieści model frontier, taki jak Kimi K3, przy kontekście 1M.
Po stronie klienta Draw Things podało, że jego Metal FlashAttention v2.5 z Neural Accelerators daje do 4,6 razy lepszą wydajność na M5 Apple niż na M4. iPad M5 z 16GiB RAM potrafi wygenerować wideo 480p w pięć sekund z modelami Wan 2.2 A14B. To wydanie jest podglądowe. Firma podała, że obsługę BF16 początkowo wyłączono z powodu nierozwiązanych błędów. Shadery akceleratora neuronowego potrzebują 10 sekund lub więcej na specjalizację przy pierwszym uruchomieniu. Późniejsza poprawka dodała, że build 1.20251117.1 wprowadził BF16 i cache artefaktów binarnych.
Źródła
6- 01SiFive offers drop-in AI accelerator driven by RISC-V CPUsEN
- 02TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
- 03Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 04d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 05Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 06Metal FlashAttention v2.5 w/ Neural Accelerators: delivering breakthrough performance on the Apple M5 chipEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.