Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Wnętrze akceleratorów do centrów danych: rdzenie RISC-V, braki T-glass i 3D DRAM

Projekty akceleratorów AI zmieniają się naraz na trzech frontach: kto licencjonuje klocki, z których się je składa, kto dostanie materiały do pakowania i jak pamięć jest układana pod układem obliczeniowym. The Register podał 19 września 2024 roku, że SiFive oferuje teraz własne projekty akceleratorów, a nie tylko rdzenie CPU RISC-V.

TechnologiaWyjaśnienieAnna KaczmarekOpublikowano: 27 września 20266 min czytaniaŹródła 3
Wnętrze akceleratorów do centrów danych: rdzenie RISC-V, braki T-glass i 3D DRAM

SiFive od lat projektuje rdzenie CPU RISC-V, które inne firmy dokładają do swoich układów AI. W tym tygodniu firma oświadczyła, że będzie licencjonować własny, kompletny akcelerator uczenia maszynowego. Seria Intelligence XM to klaster czterech rdzeni CPU SiFive Intelligence X RISC-V połączonych z wewnętrznym silnikiem obliczeń macierzowych, podaje The Register.

John Ronco, starszy wiceprezes i dyrektor generalny SiFive na Wielką Brytanię, powiedział The Register, że część klientów nadal chce budować własny sprzęt, ale inni chcieli "bardziej kompleksowej oferty od SiFive". Wcześniejsze prace firmy stawiały jej rdzenie CPU obok silników macierzowych innych producentów, jak w procesorach tensorowych Google. Klastry XM odwracają ten układ: SiFive dostarcza teraz cały projekt akceleratora, który klient dostosowuje i wysyła do fabryki.

Co daje jeden klaster

Każdy podstawowy klaster XM obsługuje do 1 TB/s przepustowości pamięci przez spójny interfejs hub. SiFive oczekuje, że dostarczy do 16 TOPS w INT8 albo 8 teraFLOPS w BF16 na gigaherc.

Liczby na gigaherc mogą mylić, bo to nie jest gotowy układ. Ostateczna wydajność zależy od tego, ile klastrów klient umieści, jak je połączy, co jeszcze znajdzie się na płytce oraz jaki ma budżet mocy i chłodzenia. Ronco spodziewa się, że większość projektów użyje od czterech do ośmiu klastrów. Przy taktowaniu 1 GHz daje to od 4 do 8 TB/s szczytowej przepustowości pamięci i od 32 do 64 teraFLOPS w BF16. Nvidia H100 wyciąga blisko petaFLOPS gęstego BF16, więc porównanie wypada na korzyść Nvidii. Ale FLOPS to nie wszystko w zadaniach ograniczonych przepustowością, jak wnioskowanie. Ronco powiedział, że klastry XM prawdopodobnie nie będą zbyt często używane do trenowania AI.

Skala pozostaje otwartym pytaniem. Ronco wahał się, jak daleko można rozciągnąć ten projekt, a The Register zauważył, że granice wyznaczą technologia procesu i powierzchnia płytki. Slajdy produktowe firmy sugerują, że możliwe jest 512 klastrów XM. Przy 1 GHz, bez problemów termicznych i mocowych, dałoby to około czterech petaFLOPS obliczeń macierzowych BF16. Najwyżej taktowane GPU Blackwell Nvidii są podawane jako 2,5 petaFLOPS w BF16.

SiFive zapowiedziało też, że opublikuje otwartą implementację referencyjną swojej biblioteki SiFive Kernel Library, żeby obniżyć barierę wejścia dla RISC-V. Prezes Patrick Little twierdził w gotowym oświadczeniu, że firma dostarcza projekty układów opartych na RISC-V pięciu z "Wspaniałej Siódemki", czyli grupy obejmującej Microsoft, Apple, Nvidia, Alphabet, Amazon, Meta i Tesla. The Register zauważył, że podejrzewa, iż nie cały ten krzem dotyczy AI.

Wąskie gardło w pakowaniu, którego nikt nie pilnuje

Projekty to jedno. Materiały to drugie. Japońska firma Nittobo kontroluje około 90% światowych dostaw specjalistycznej tkaniny z włókna szklanego zwanej T-glass, która znajduje się w każdym zaawansowanym pakiecie układu AI, podaje Tom's Hardware. T-glass to tkanina szklana o niskim CTE, używana w organicznym rdzeniu podłoży IC, warstwie łączącej układ z płytką drukowaną. Utrzymuje duże, gorące pakiety układów w stabilnych wymiarach, gdy gęstnieją.

Popyt przerósł podaż. Nittobo potraja moce w fabryce w Fukushimie, ale nowa produkcja trafi na rynek dopiero w połowie 2027 roku. Ceny wzrosły już o 20% do 30%, a terminy dostaw materiałów w dół łańcucha, jak laminaty pokryte miedzią, wydłużyły się z normalnych 8 do 10 tygodni do ponad 20. "Przy jeszcze bardziej ograniczonej podaży T-glass dostawcy nie podają już terminów dostaw", powiedział Tom's Hardware Bill Ho, analityk w Yuanta.

Zastąpienie T-glass nie jest proste. Bilal Hachemi, analityk w Yole Group, który śledzi łańcuch dostaw podłoży IC, powiedział, że materiał "ma określone wartości dielektryczne i CTE, które lepiej pasują do układów AI, zwłaszcza w organicznym rdzeniu". Przemysł podłoży działa na cienkich marżach, więc nawet umiarkowany skok popytu może wywołać braki. "Każdy wzrost popytu na materiały build-up, materiał ABF czy T-glass może spowodować potencjalny niedobór, bo to kłóci się z podstawami tej branży", powiedział Hachemi.

Hiperskalerzy pogarszają sytuację, zamawiając coraz większe pakiety. Według danych Nvidii cytowanych przez Tom's Hardware rozmiary interposerów wzrosły z 814 mm2 dla Hoppera do 1 700 mm2 dla Blackwella, o 109%, a generacje Rubin i Feynman mają skalować dalej. Bank of America szacuje, że segment materiałów elektronicznych Nittobo niemal podwoi sprzedaż z 40,9 mld jenów, około 266 mln dolarów, w 2025 roku do 87,7 mld jenów do marca 2028 roku, przy marżach operacyjnych zbliżających się do 48%.

Nittobo podwaja moce surowej przędzy w zakładzie na Tajwanie, importuje przędzę z powrotem do Japonii na produkcję tkaniny i zleca część tkania Nanya Plastics, jednemu ze swoich największych konkurentów. Do 2027 roku około 20% tkaniny szklanej Nittobo ma być tkane przez Nanyę, ujawniła firma. Hachemi powiedział, że bezpośredni kontakt Nvidii z dostawcą materiałów na wcześniejszym etapie, takim jak Nittobo, jest bez precedensu, i ostrzegł, że gdy Nvidia zabezpieczy swoją część, konkurencyjni nabywcy układów będą walczyć o to, co zostanie.

3D DRAM i ściana pamięci

Pamięć to trzeci front. Na Hot Chips 2026 d-Matrix przedstawiła swój akcelerator Raptor, który układa układ obliczeniowy bezpośrednio na płytkach DRAM, podaje ServeTheHome. Wagi modeli stale rosną, a pamięć KV skaluje się z długością kontekstu pomnożoną przez wielkość partii. Przykład ServeTheHome: 64 użytkowników przy kontekście 1M może oznaczać około 935 GB pamięci KV. To problem zarówno pojemności, jak i przepustowości.

SRAM trafia w cel przepustowości, ale tylko w maleńkiej skali. Para kart akceleratora SRAM Corsair osiąga około 300 TB/s przy opóźnieniu około 1 nanosekundy, a mieści tylko około 4 GB. HBM rozwiązuje kwestię pojemności, ale ma trudności z przepustowością, z praktycznym pułapem około 20 TB/s dla pakietów HBM4, takich jak Vera Rubin Nvidii i Instinct MI455 AMD, według d-Matrix. Ułożony pionowo 3D DRAM lokuje się pomiędzy: pionowe 3D IO kosztuje około 0,3 do 0,4 pJ, około 10 razy mniej niż HBM, bo to ścieżka bez PHY o skali milimetrowej, a nie trasa przez interposer o skali centymetrowej.

Raptor kładzie układ logiczny TSMC N4 na płytce 3D DRAM, łącząc je twarzą do twarzy w technologii 36 mikronów, którą d-Matrix opisuje jako sprawdzoną, tanią, o dużej skali i wysokiej wydajności produkcyjnej. Każda karta mieści 32 GB, a d-Matrix twierdzi, że skala 72 kart pomieści model frontier, taki jak Kimi K3, przy kontekście 1M z wagami 4-bitowymi i pamięcią KV 8-bitową.

Prace inżynieryjne nie są zakończone. d-Matrix mówi, że stos 1-Hi z logiką na wierzchu przy nie więcej niż 0,5 W/mm2 można chłodzić cieczą i utrzymać DRAM poniżej 100C. Jej układ ma 840 banków, 768 po odjęciu 72 zapasowych, w 256 kanałach, co daje 3 banki na kanał. Flit 128B nie dzieli się równo, więc pojedynczy dostęp zwraca 96B, a dwa dostępy pobierają 192B, marnując około 33% przepustowości przy blisko 33 TB/s. Schemat blokowania strumienia dzieli jeden częściowy dostęp 32B między trzy flity, sprowadzając nadmiarowe pobieranie do zera.

Do tego dochodzi moc I/O. Przesyłanie 100 TB/s przy 0,37 pJ/bit daje 296 W tylko na I/O, a konwencjonalne DBI mogłoby zaoszczędzić 20%. HBM radzi sobie z DBI, bo jego wielocyklowe transmisje pozwalają PHY zobaczyć pełny burst. Jednocyklowe łącze 3D-DRAM 256-bit d-Matrix nie ma bursta ani pinu sideband do sygnalizowania wyboru inwersji, więc stosuje odwracanie strumienia: porównuje każdy flit z poprzednim i odwraca, gdy trzeba.

Nic z tego nie przyjdzie samo. Projekty akceleratorów RISC-V, niemal monopol na jedną tkaninę do pakowania i ułożona pamięć DRAM muszą się zgrać, zanim następna generacja krzemu do centrów danych trafi na rynek.

Komentarze 0

Źródła

3
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  3. 03D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.