Akceleratory AI: walka w centrach danych przenosi się do łańcucha dostaw podłoży
Producenci akceleratorów AI przeprojektowują to, jak układ obliczeniowy rozmawia z pamięcią. Prawdziwe wąskie gardło leży jednak wyżej: japoński wytwórca tkaniny szklanej kontroluje około 90% materiału, bez którego nie obejdzie się żaden zaawansowany pakiet, a nowe moce pojawią się dopiero w połowie 2027 roku.

Każda dyskusja o akceleratorach AI w 2026 roku prędzej czy później trafia na tę samą ścianę: przepustowość pamięci. Moc obliczeniowa jest droga, ale dostępna. O budżecie energetycznym, rozmiarze pakietu i dacie wysyłki decyduje przenoszenie wag i KV cache do pamięci i z powrotem. Dlatego SiFive, d-Matrix i Rebellions pokazali w tym cyklu konstrukcje, które atakują interfejs pamięci, a nie macierz mnożąco-akumulującą.
The Register pisał 19 września 2024 roku, że SiFive, od dawna dostawca rdzeni RISC-V do układów AI innych firm, zaczęło licencjonować własny akcelerator. Klaster Intelligence XM łączy cztery rdzenie Intelligence X RISC-V z własnym silnikiem matematyki macierzowej. Każdy klaster obsługuje do 1 TB/s przepustowości pamięci i jest oceniany na do 16 TOPS w INT8 lub 8 teraFLOPS w BF16 na gigaherc. John Ronco z SiFive powiedział redakcji, że większość układów zbudowanych na tej konstrukcji użyje od czterech do ośmiu klastrów. Daje to od 4 do 8 TB/s szczytowej przepustowości pamięci i od 32 do 64 teraFLOPS w BF16 przy 1 GHz.
Te liczby są skromne przy Nvidii H100.
Najciekawsze jest to, komu SiFive to sprzedaje. Ronco mówił, że część klientów nadal chce budować własny sprzęt, ale inni woleli dostać wszystko z jednej ręki. SiFive nie celuje w Google ani Tenstorrent, które same tworzą swoje akceleratory. Celuje w organizacje, które chcą gotowy blok do dostosowania i wysłania do fabryki.
Nie wiadomo, jak daleko sięga ta konstrukcja. Ronco wahał się z odpowiedzią, choć slajdy produktu sugerują, że 512 klastrów XM jest w zasięgu możliwości. Przy taktowaniu 1 GHz dałoby to około czterech petaFLOPS obliczeń macierzowych BF16, wobec 2,5 petaFLOPS dla najlepiej wyspecyfikowanych GPU Blackwell Nvidii. SiFive zapowiedziało też, że udostępni otwartoźródłową implementację referencyjną swojej biblioteki SiFive Kernel Library.
DRAM układany na warstwie logicznej
Relacja ServeTheHome z Hot Chips 2026 opisuje inną drogę, którą obrało d-Matrix: logika trafia bezpośrednio na DRAM. Konstrukcja Raptor tej firmy układa warstwę logiczną TSMC N4 na warstwie DRAM 3D i łączy je twarzą do twarzy przez 36 mikronów. d-Matrix przekonuje, że SRAM osiąga docelową przepustowość, około 300 TB/s przy opóźnieniu bliskim 1 ns dla pary kart akceleratora Corsair SRAM, ale mieści tylko około 4 GB. Do tego komórka SRAM 6T jest około dziesięć razy większa od komórki DRAM. HBM rozwiązuje problem pojemności, ale d-Matrix wskazuje praktyczny sufit przepustowości w okolicach 20 TB/s dla pakietów HBM4, takich jak Nvidia Vera Rubin i AMD Instinct MI455.
Powodem jest energia. Przy 2,4 pJ/bit przetłoczenie 100 TB/s przez HBM zużywa około 1,92 kW, zanim doliczy się jakikolwiek ruch w sieci połączeń. Pionowe wejście-wyjście 3D to z kolei około 0,3 do 0,4 pJ, mniej więcej dziesięć razy mniej niż HBM, bo jest to tor o milimetrowej skali bez warstwy PHY, a nie trasa przez interposer o skali centymetrowej. Kompromis jest termiczny: d-Matrix mówi, że stos 1-Hi z logiką na wierzchu o gęstości nie większej niż 0,5 W/mm2 można chłodzić cieczą i utrzymać DRAM poniżej 100C.
Szczegóły inżynieryjne pozwalają sprawdzić te twierdzenia. Każdy silnik tensorowy potrzebuje flitu 128B na dostęp, a przy 32B dostarczanych na dostęp do kolumny z banków 32B oznacza to cztery banki na kanał. Układ d-Matrix ma 840 banków, 768 po odjęciu 72 zapasowych, w 256 kanałach: trzy banki na kanał. Pojedynczy dostęp zwraca 96B, więc dostarczenie flitu 128B wymaga dwóch dostępów i pobiera 192B. Marnuje się wtedy około 33% przepustowości w okolicach 33 TB/s. Poprawka d-Matrix, blokowanie strumienia, dzieli jeden częściowy dostęp 32B między trzy flity, tak że cztery dostępy po 96B zasilają trzy flity po 128B. Nadmiarowe pobieranie spada do zera. Drugi trik, odwracanie strumienia, odwraca każdy flit względem poprzedniego, żeby ograniczyć przełączanie i odzyskać około 20% energii wejścia-wyjścia bez pinu pomocniczego, którego wymaga konwencjonalne odwracanie szyny danych.
Przy 32 GB na kartę, z wagami 4-bitowymi i 8-bitowym KV cache, d-Matrix przewiduje skalowanie do 72 kart, żeby pomieścić model frontier, taki jak Kimi K3 przy kontekście 1M. ServeTheHome zauważa, że firma przedstawiła tę pracę na Hot Chips 2026.
UCIe dociera na działającą płytę
Rebellions pokazało coś rzadszego niż slajd: działający krzem. ServeTheHome relacjonował 25 sierpnia 2025 roku, że Rebellions REBEL-Quad zaprezentowano na Hot Chips 2025 na płycie rozwojowej, na której działała Llama 3.3 70B ze średnim czasem 35,5 ms na token wyjściowy. Pakiet zbudowano na Samsung SF4X i CoWoS-S, z czterema układami ASIC obliczeniowymi, czterema miejscami HBM3E na 144 GB pamięci i czterema zintegrowanymi kondensatorami krzemowymi. Jako połączenie chipletów wykorzystuje UCIe-A oraz kartę z podwójnym interfejsem PCIe Gen5 x16.
ServeTheHome wskazał wybór PCIe jako możliwe przeoczenie, skoro Nvidia GB300 wprowadza PCIe Gen6. To słuszna krytyka części nastawionej na wnioskowanie w skali rozproszonej. Ale demonstracja znaczy więcej niż karta katalogowa. O UCIe mówi się od lat, a dostawcy niechętnie przyznawali, że go używają, bo połączenie znajduje się wewnątrz pakietu. Rebellions zintegrowało tyle elementów krzemowych w jednym dużym pakiecie i pokazało, że to działa. Ekosystem chipletów dostał daną, której potrzebował.
Nie każdy akcelerator potrzebuje szafy w centrum danych. Draw Things opublikowało 11 listopada 2025 roku wyniki dla Metal FlashAttention v2.5 z Neural Accelerators na Apple M5. Firma twierdzi, że w jej własnej aplikacji do generowania obrazów i wideo udało się uzyskać do 4,6x poprawy względem M4. Podaje surowe zyski wydajności od 3,6x do 5,5x względem iPada z M4 i od 3,3x do 4,6x end-to-end. iPad z M5 wypada w okolicach M2 Max i często około 80% wolniej niż M3 Ultra (60c). Zdaniem firmy iPad z M5 i 16GiB pamięci potrafi wygenerować pięciosekundowe wideo 480p za pomocą modeli Wan 2.2 A14B. Wydanie jest podglądowe: Draw Things mówi, że obsługa BF16 była początkowo wyłączona z powodu nierozwiązanych błędów, a później przywrócona w kompilacji z 17 listopada, i że nieparzyste długości sekwencji uwagi oraz duże wymiary głów nadal powodują spadki wydajności.
Materiał, o którym nikt poza branżą podłoży nie słyszał
Cała ta praca projektowa trafia na problem w łańcuchu dostaw, który nie ma nic wspólnego z architekturą. Tom's Hardware pisał 9 marca 2026 roku, że Nittobo kontroluje około 90% globalnych dostaw T-glass, tkaniny szklanej o niskim CTE używanej w organicznym rdzeniu podłoży układów scalonych, warstwie łączącej chip z płytką drukowaną. T-glass utrzymuje duże, gorące pakiety w stabilnych wymiarach. E-glass jest tańszy, ale stosuje się go głównie w tańszych układach, takich jak mikrokontrolery i starsze procesory mobilne. Do masywnych opakowań 2.5D i 3D preferowany jest T-glass.
Nittobo potraja moce w zakładzie w Fukushimie, ale nowa podaż trafi na rynek dopiero w połowie 2027 roku. Ceny wzrosły o 20% do 30%, a terminy dostaw materiałów na dalszych etapach, takich jak laminaty miedziane, wydłużyły się z normalnych 8 do 10 tygodni do ponad 20. Analityk Yuanta Bill Ho powiedział Tom's Hardware, że dostawcy nie podają już terminów dostaw. Bilal Hachemi z Yole Group stwierdził, że T-glass nie jest łatwy do zastąpienia, bo ma określone wartości przenikalności i CTE, które lepiej pasują do układów AI, zwłaszcza w organicznym rdzeniu. Dodał, że historycznie niskie marże w branży podłoży scalonych sprawiają, iż nawet umiarkowany wzrost popytu wywołuje niedobory.
Popyt napędza rozmiar pakietu. Według danych Nvidii cytowanych przez Tom's Hardware rozmiary interposerów wzrosły z 814mm2 dla Hoppera do 1 700mm2 dla Blackwella, czyli o 109%, a Rubin i Feynman mają skalować się dalej. Bank of America szacuje, że segment materiałów elektronicznych Nittobo niemal podwoi sprzedaż z 40,9 mld jenów w 2025 roku do 87,7 mld jenów do marca 2028 roku, przy marży operacyjnej zbliżającej się do 48%. Nittobo podwaja moce przędzenia surowca w zakładzie na Tajwanie i zawarła umowę o współpracy z Nanya Plastics, żeby część tkania zlecić na zewnątrz. Do 2027 roku około 20% tkaniny szklanej Nittobo ma być tkane przez Nanyę.
Nittobo współpracuje z jednym ze swoich największych konkurentów, żeby złagodzić wąskie gardło. To najwyraźniejszy jak dotąd sygnał, gdzie leży ograniczenie. Architekci akceleratorów mogą dalej ścinać pikożule na bit, ale jeśli tkanina wewnątrz podłoża jest przydzielana na lata wcześniej, data wysyłki zapada gdzie indziej.
Źródła
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
- 05Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.