Czym jest akcelerator AI? Wnętrze układów, które liczą wnioskowanie w centrach danych
Akceleratory AI to wyspecjalizowane układy, które stoją obok zwykłych procesorów w szafach centrów danych i wykonują mnożenie macierzy stojące za chatbotami i generatorami obrazów. Sposób, w jaki się je buduje, i to, kto może je budować, jest ciekawszy niż same skróty.

Każdy duży model językowy, z którego korzystałeś, obsługiwał niemal na pewno układ, który nie jest procesorem. To akcelerator: krzem zaprojektowany tak, żeby bardzo szybko wykonywać jeden rodzaj arytmetyki, mnożenie macierzy. Reszta maszyny istnieje po to, żeby go karmić. Ten podział pracy wyjaśnia większość ostatnich emocji na rynku centrów danych. Wyjaśnia też, dlaczego firmy, które kiedyś sprzedawały rdzenie procesorów, pamięci albo obudowy, spierają się teraz o teraFLOPS, przepustowość pamięci i o to, ile banków zmieści się na jednej kości DRAM.
Podstawowy blok i dlaczego SiFive zaczął go sprzedawać
SiFive przez lata licencjonował rdzenie procesorów RISC-V, które inne firmy dokładały do własnych silników AI. Według The Register co najmniej część tensorowych jednostek przetwarzania Google'a używa rdzeni X280 od SiFive do zarządzania akceleratorami uczenia maszynowego i karmienia ich jednostek mnożenia macierzy. John Ronco, SVP i GM SiFive UK, powiedział tej publikacji, że projekty SiFive stoją też za rdzeniami procesorów w akceleratorze Blackhole firmy Tenstorrent.
We wrześniu 2024 roku firma zmieniła pozycję. Ogłosiła serię Intelligence XM, licencjonowalny klaster akceleratorów AI, a nie tylko część procesorową. Bazowy klaster zawiera cztery rdzenie procesorów RISC-V Intelligence X połączone z własnym silnikiem matematyki macierzowej. Każdy klaster obsługuje do 1TB/s przepustowości pamięci i ma dostarczać do 16 TOPS w INT8 albo 8 teraFLOPS w BF16 na gigaherc, według relacji The Register.
"Dla niektórych klientów nadal właściwe będzie zrobienie własnego sprzętu" powiedział Ronco. "Ale niektórzy klienci chcieli bardziej kompleksowej oferty od SiFive."
Ta wartość na gigaherc wygląda na pierwszy rzut oka dziwnie. To klocek, nie układ. The Register zauważa, że SiFive spodziewa się, iż większość układów opartych na tym projekcie będzie pracować na około 1GHz, a Ronco oczekuje od czterech do ośmiu klastrów na układ. Przy ośmiu klastrach i 1GHz daje to do 64 teraFLOPS w BF16. Slajdy produktu sugerują, że możliwe jest 512 klastrów. Według obliczeń The Register dałoby to około czterech petaFLOPS mocy macierzowej BF16, powyżej 2,5 petaFLOPS, które Nvidia podaje dla swoich najlepiej skonfigurowanych procesorów graficznych Blackwell. Te liczby są teoretyczne. Rzeczywista wydajność zależy od taktowania, budżetu mocy i chłodzenia, procesu technologicznego i tego, co jeszcze dzieli układ. SiFive zapowiada też, że opublikuje otwartoźródłową implementację referencyjną swojej biblioteki SiFive Kernel Library, żeby obniżyć barierę wejścia dla RISC-V.
Wnioskowanie to najpierw problem pamięci, a dopiero potem matematyki
Dostawcy akceleratorów mniej teraz mówią o surowej mocy obliczeniowej, a więcej o pamięci, bo tam wnioskowanie faktycznie zwalnia. d-Matrix na swojej prezentacji Hot Chips 2026 rozłożył to na arytmetykę: wagi modeli rosną, a pamięć KV skaluje się przez długość kontekstu pomnożoną przez rozmiar partii. ServeTheHome podaje przykład d-Matrix: 64 użytkowników przy kontekście 1M daje około 935GB pamięci KV. Pojemność i przepustowość stają się problemem, i obie rosną.
SRAM spełnia wymóg przepustowości, ale prawie nic nie mieści. Około 4GB dla pary kart Corsair przy około 300 TB/s i opóźnieniu 1ns, według ServeTheHome. Komórka SRAM 6T jest około 10 razy większa niż komórka DRAM. HBM rozwiązuje pojemność, ale trafia na praktyczny sufit przepustowości około 20 TB/s dla pakietów HBM4, takich jak Vera Rubin Nvidii i Instinct MI455 AMD. Przepustowość HBM ma też koszt energetyczny: przy 2,4 pJ/bit przelanie 100 TB/s przez HBM zużywa około 1,92 kW, jeszcze przed ruchem w sieci połączeń.
Odpowiedzią d-Matrix jest nałożenie obliczeń bezpośrednio na kości DRAM. Firma twierdzi, że stos 1-Hi z logiką na wierzchu przy nie więcej niż 0,5 W/mm2 da się chłodzić cieczą i utrzymać DRAM poniżej 100C. Pionowe wejście-wyjście 3D kosztuje około 0,3 do 0,4 pJ, mniej więcej 10 razy mniej niż HBM. Implementacja Raptor kładzie układ logiki TSMC N4 na kości 3D DRAM, używając 36um łączenia twarzą do twarzy. Skala 72 kart jest przewidziana tak, żeby pomieścić model frontier, taki jak Kimi K3 przy kontekście 1M, z 32GB na kartę przy wagach 4-bitowych i 8-bitowej pamięci KV. Szczegóły inżynieryjne mają znaczenie, bo pokazują, jak duża część projektowania akceleratora dotyczy teraz przemieszczania danych, a nie jednostek mnożąco-akumulujących. Układ d-Matrix ma 840 banków, 768 po odjęciu zapasowych, w 256 kanałach, co daje 3 banki na kanał. Dostarczenie flitu 128B z banków 32B wymaga więc dwóch dostępów i pobiera 192B, marnując około 33 procent przepustowości w pobliżu 33 TB/s. Blokowanie strumieni odzyskuje to, dzieląc jeden częściowy dostęp 32B między trzy flity.
Obudowa, nie tylko krzem
Jest drugie ograniczenie, które nie ma nic wspólnego z projektowaniem układów. Tom's Hardware podał w marcu 2026 roku, że Nittobo, japońska firma, kontroluje około 90 procent globalnych dostaw T-glass, tkaniny z włókna szklanego o niskim CTE, używanej w organicznym rdzeniu podłoży układów scalonych. Zawiera ją każda zaawansowana obudowa układu AI. Popyt przewyższa podaż.
Liczby są bezlitosne. Nittobo potraja moce w zakładzie w Fukushimie, ale nowe dostawy trafią na rynek dopiero w połowie 2027 roku. Ceny wzrosły o 20 do 30 procent, a terminy realizacji materiałów na dalszym etapie, takich jak laminaty pokryte miedzią, wydłużyły się z normalnych 8 do 10 tygodni do ponad 20. Według danych Nvidii, które cytuje Tom's Hardware, rozmiary interpozerów wzrosły z 814mm2 dla Hoppera do 1 700mm2 dla Blackwella, o 109 procent, a Rubin i Feynman mają rosnąć dalej.
"Przy jeszcze bardziej ograniczonych dostawach T-glass dostawcy nie podają już terminów realizacji" powiedział Bill Ho, analityk w Yuanta.
Nittobo podwaja moce surowca przędzy w zakładzie na Tajwanie i zawarła umowę o współpracy z Nanya Plastics, żeby zlecić część tkania na zewnątrz. Do 2027 roku około 20 procent tkaniny szklanej Nittobo ma tkać Nanya, według Tom's Hardware. Bank of America szacuje, że segment materiałów elektronicznych Nittobo niemal podwoi sprzedaż z 40,9 mld jenów w 2025 roku do 87,7 mld jenów do marca 2028 roku, przy marży operacyjnej zbliżającej się do 48 procent.
Kto faktycznie dostarcza sprzęt
Kiedy trwają te spory, część start-upów pokazuje krzem publiczności. Rebellions zaprezentował swój akcelerator REBEL-Quad na Hot Chips 2025, według ServeTheHome: cztery ASIC obliczeniowe, cztery miejsca HBM3E na 144GB pamięci, zbudowany w Samsung SF4X i CoWoS-S, z UCIe-A jako połączeniem chipletów i podwójnym interfejsem PCIe Gen5 x16. Firma uruchomiła na żywo demo Llama 3.3 70B na płytce deweloperskiej ze średnim czasem 35,5 msec na token wyjściowy. ServeTheHome zauważył, że wiele firm akceleratorowych nigdy nie dochodzi do publicznego działającego dema.
Po stronie klienta Draw Things podał, że Metal FlashAttention v2.5 z Neural Accelerators daje do 4,6 razy lepszą wydajność na M5 Apple'a niż na M4, z surowymi poprawami od 3,6 do 5,5 razy i zyskiem end-to-end od 3,3 do 4,6 razy na iPadzie z M5. To oprogramowanie w wersji zapowiedzi: obsługę BF16 początkowo wyłączono z powodu nierozwiązanych błędów, a shadery specjalizują się dłużej. Pomiary wykonano z podkładką lodową pod iPadem dla maksymalnego chłodzenia, co mówi tyle samo o zapasie termicznym, ile o samym układzie.
Nic z tego nie rozstrzyga, która architektura wygrywa. Pokazuje natomiast, że akcelerator w centrum danych to już nie jedna kategoria produktu. To stos rdzeni procesorów, silników macierzowych, technologii pamięci, materiałów obudowy i bibliotek oprogramowania, z których każde ma własne wąskie gardło i własne terminy realizacji.
Źródła
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.