Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Jak naprawdę działają akceleratory AI: rdzenie, klastry i pamięć

SiFive zaczyna licencjonować gotowy klaster akceleratora AI zbudowany wokół czterech rdzeni RISC-V i własnego silnika matematyki macierzowej, podał The Register 19 września 2024 roku.

TechnologiaWyjaśnienieAnna KaczmarekOpublikowano: 27 września 20263 min czytaniaŹródła 5
Jak naprawdę działają akceleratory AI: rdzenie, klastry i pamięć

SiFive od lat projektuje rdzenie RISC-V dla cudzych układów AI. Teraz sprzedaje kompletny projekt akceleratora. Każdy klaster Intelligence XM łączy cztery rdzenie RISC-V z serii X z własnym silnikiem matematyki macierzowej, pisze The Register.

To zmiana. Jednostki TPU Google'a już korzystają z rdzeni X280 firmy SiFive, żeby dostarczać dane jednostkom mnożenia macierzy. John Ronco z SiFive UK powiedział The Register, że projekty firmy stoją też za rdzeniami CPU w akceleratorze Blackhole od Tenstorrent. Różnica polega na tym, że SiFive dokłada teraz własny silnik macierzowy, zamiast podpinać rdzenie do silnika strony trzeciej.

Co mówią liczby, a czego nie mówią

Każdy klaster obsługuje do 1TB/s przepustowości pamięci przez spójny interfejs hub i ma dostarczać do 16 TOPS w INT8 albo 8 teraFLOPS w BF16 na gigaherc. To przeliczenie na gigaherc ma znaczenie, bo klaster to nie układ. Wydajność zależy od tego, ile klastrów klient umieści na matrycy, jak je połączy, co jeszcze obok nich postawi i z jakim taktowaniem wyjdzie finalny element.

Ronco spodziewa się, że większość projektów użyje od czterech do ośmiu klastrów. Przy 1GHz dałoby to od 4 do 8TB/s szczytowej przepustowości pamięci i od 32 do 64 teraFLOPS w BF16. Slajdy produktowe SiFive sugerują, że możliwe jest 512 klastrów. Przy 1GHz byłoby to około czterech petaFLOPS w BF16, powyżej 2,5 petaFLOPS, które Nvidia podaje dla swoich najwyższych GPU Blackwell. Dla porównania Nvidia H100 dostarcza blisko petaFLOPS gęstego BF16.

Problemem jest fizyka. Utrzymanie 1GHz na 512 klastrach bez uderzenia w limity termiczne albo mocowe to otwarte pytanie. Ronco nie chciał powiedzieć, jak daleko skaluje się ten projekt. Spodziewa się też, że klastry nie będą szeroko używane do trenowania AI. SiFive zapowiada publikację otwartoźródłowej implementacji referencyjnej swojej SiFive Kernel Library.

Przepustowość pamięci to powracające wąskie gardło

Akceleratory buduje się w ten sposób, bo wnioskowanie, zwłaszcza faza dekodowania, jest ograniczone przepustowością pamięci. d-Matrix, prezentując się na Hot Chips 2026, postawił sprawę wprost: 64 użytkowników przy kontekście 1M to około 935GB pamięci KV cache. Projekt Raptor tej firmy nakłada układ logiczny TSMC N4 na 3D DRAM, łącząc je twarzą do twarzy przez 36 mikrometrów, przy 32GB na kartę i szafie na 72 karty, wymiarowanej pod modele frontier.

Rebellions pokazał inne podejście na Hot Chips 2025. REBEL-Quad mieści cztery układy ASIC obliczeniowe i cztery miejsca HBM3E, co daje 144GB pamięci w pakiecie Samsung SF4X i CoWoS-S. Jako łącze chipletowe wykorzystuje UCIe-A. ServeTheHome widział go w działaniu na płytce deweloperskiej z Llama 3.3 70B, ze średnim czasem 35,5 milisekundy na token wyjściowy.

Dostawcy, packaging i ucisk w górze łańcucha

Nic z tego nie trafi na rynek bez materiałów do pakowania. Tom's Hardware podał w marcu 2026 roku, że Nittobo kontroluje około 90% globalnych dostaw T-glass, tkaniny szklanej o niskim CTE używanej w rdzeniach podłoży IC. Ceny wzrosły o 20 do 30%, a terminy dostaw laminatów pokrytych miedzią wydłużyły się z normalnych 8 do 10 tygodni do ponad 20. Nittobo potraja moce w zakładzie w Fukushimie, ale nowe dostawy trafią na rynek dopiero w połowie 2027 roku. Bank of America szacuje, że segment materiałów elektronicznych prawie podwoi sprzedaż z 40,9 mld jenów w 2025 roku do 87,7 mld jenów do marca 2028 roku.

Warstwa polityczna jest równie pogmatwana. TSMC miało odciąć chińskiego projektanta Sophgo w październiku 2024 roku po tym, jak klient zamówił układ przypominający Ascend 910B Huawei. Sophgo zaprzeczyło jakimkolwiek związkom z Huawei i oświadczyło, że złożyło TSMC raport z dochodzenia.

Komentarze 0

Źródła

5
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
  3. 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  4. 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  5. 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.