Jak powstają akceleratory AI: wąskie gardła w opakowaniu, pamięci i projektowaniu
Wyścig akceleratorów AI nie rozstrzyga się już tylko na tym, kto wytrawi najszybszy układ logiczny. Trzy historie z łańcucha dostaw z 2026 roku pokazują, że ograniczenia siedzą w materiale, w stosie pamięci i w procesie projektowym wokół chipu.

Akceleratory AI opisuje się zwykle przez moc obliczeniową. GPU Nvidii, Maia Microsoftu, Raptor d-Matrix: cytowane liczby to teraflopy, liczba tranzystorów i przepustowość pamięci. Trudniejsza historia dotyczy tego, co otacza krzem. W 2026 roku zrobiło się tam tłoczno.
Trzy osobne materiały, z Tom's Hardware, ServeTheHome i The Next Platform, opisują trzy różne wąskie gardła. Specjalistyczna tkanina szklana wchodzi w skład każdego zaawansowanego opakowania. Architektura pamięci wymienia pojemność na przepustowość. Sam proces projektowy jest przebudowywany wokół agentów AI.
90% udziału w materiale, o którym mało kto słyszał
Pierwszym wąskim gardłem jest materiał zwany T-glass. Według Tom's Hardware japońska firma Nittobo kontroluje około 90% jego globalnych dostaw. T-glass to tkanina z włókna szklanego o niskim CTE. Leży w organicznym rdzeniu podłoży IC, czyli w warstwie łączącej chip z płytką drukowaną. Utrzymuje wymiarową stabilność dużych, mocno grzejących się opakowań, gdy te gęstnieją.
To ma większe znaczenie w miarę wzrostu procesorów AI. Tom's Hardware cytuje dane Nvidii: rozmiary interposerów rosną z 814mm² dla Hoppera do 1,700mm² dla Blackwella, czyli o 109%, a nadchodzące generacje Rubin i Feynman będą skalować się dalej. Każda generacja zużywa więcej T-glassu na sztukę. Nowej linii T-glassu nie da się uruchomić szybko. Potrzebne są specjalistyczne elektryczne piece topielne pracujące w temperaturze od 1,600 do 1,700°C, a do tego lata inwestycji i wiedzy, żeby stopić szkło bogate w krzemionkę, prząść je w przędzę i utkać z niej ultracieńką tkaninę.
Liczby pokazują już ten ucisk. Tom's Hardware podaje, że ceny wzrosły o 20 do 30%, a terminy dostaw materiałów w dalszej części łańcucha, takich jak laminaty pokryte miedzią, wydłużyły się z normalnych 8 do 10 tygodni do ponad 20. "Przy jeszcze bardziej ograniczonej podaży T-glassu dostawcy przestali podawać terminy dostaw" - powiedział w artykule Bill Ho, analityk Yuanta.
Nittobo potraja moce w zakładzie w Fukushimie, ale nowa podaż trafi na rynek dopiero w połowie 2027 roku. Firma podwaja też moce produkcyjne surowej przędzy w zakładzie na Tajwanie i importuje przędzę z powrotem do Japonii, gdzie powstaje tkanina. Zawarła umowę o współpracy z Nanya Plastics, żeby część tkania zlecić na zewnątrz: według ujawnionych informacji firmy do 2027 roku około 20% tkaniny szklanej Nittobo ma tkać Nanya. Współpraca z konkurentem sama w sobie pokazuje, jak napięty jest rynek.
Bilal Hachemi, analityk Yole Group zajmujący się łańcuchem dostaw podłoży IC, powiedział Tom's Hardware Premium, że zastąpienie T-glassu nie jest łatwe, bo materiał ten "ma konkretne wartości przenikalności i CTE, które lepiej działają w chipach AI, zwłaszcza w organicznym rdzeniu". Zwrócił też uwagę na cienkie marże w branży: "Każdy wzrost popytu na materiały build-up, materiał ABF czy T-glass może wywołać niedobór, bo to kłóci się z podstawami tej branży" - powiedział.
Bank of America szacuje, że segment materiałów elektronicznych Nittobo niemal podwoi sprzedaż z 40 900 000 000 jenów (266 000 000 dolarów) w 2025 roku do 87 700 000 000 jenów do marca 2028 roku, przy marży operacyjnej zbliżającej się do 48%. "Popyt na tkaninę T-glass prawdopodobnie wzrośnie bardziej, niż pierwotnie oczekiwano" - powiedział w tym samym tekście Takashi Enomoto, analityk badawczy Bank of America.
Najbardziej uderzającym szczegółem może być to, kto puka teraz do drzwi. Hachemi stwierdził, że bezpośredni kontakt Nvidii z takim dostawcą materiałów na wczesnym etapie łańcucha jak Nittobo nie ma precedensu. "Po raz pierwszy widzimy, jak Nvidia, klient końcowy, zwraca się do dostawców materiałów wyżej w łańcuchu, żeby zabezpieczyć moce i mieć pewność, że je dostanie" - powiedział. Zmartwienie nasuwa się samo: gdy największy nabywca zablokuje swoją część, konkurencyjni odbiorcy chipów walczą o resztę.
Pamięć to druga ściana
Drugie wąskie gardło jest wewnątrz opakowania akceleratora. Na Hot Chips 2026 d-Matrix przedstawiła swój akcelerator Raptor z pamięcią DRAM 3D do wnioskowania generatywnego, a tekst ServeTheHome jasno rozkłada kompromisy. Wagi modeli rosną, a pamięć KV skaluje się wraz z długością kontekstu pomnożoną przez rozmiar partii. ServeTheHome podaje przykład 64 użytkowników przy kontekście 1M, co może oznaczać około 935 GB pamięci KV. To problem i pojemności, i przepustowości.
SRAM osiąga docelową przepustowość, ale prawie nic nie mieści: para kart akceleratora Corsair SRAM dochodzi do około 300 TB/s przy opóźnieniu około 1 ns, a mieści tylko około 4 GB. HBM rozwiązuje pojemność, ale słabo radzi sobie z przepustowością. d-Matrix wskazuje praktyczny sufit około 20 TB/s dla pakietów HBM4, takich jak Vera Rubin Nvidii i Instinct MI455 AMD. Przepchnięcie 100 TB/s przez HBM przy 2,4 pJ/bit zużyłoby około 1,92 kW jeszcze przed jakimkolwiek ruchem w sieci, według ServeTheHome.
Odpowiedzią d-Matrix jest ułożenie obliczeń bezpośrednio na matrycach DRAM. Pionowe IO 3D kosztuje około 0,3 do 0,4 pJ, czyli około 10 razy mniej niż HBM, bo to ścieżka w skali milimetra, a nie trasa przez interposer w skali centymetra. Firma używa układu logicznego TSMC N4 ułożonego na matrycy DRAM 3D w technologii składania twarzą do twarzy o rozmiarze 36 um. Przy 32GB na kartę, wagach 4-bitowych i 8-bitowej pamięci KV, skalowanie do 72 kart mieści model frontier, taki jak Kimi K3 przy kontekście 1M, według ServeTheHome.
Nic z tego nie jest darmowe. d-Matrix twierdzi, że stos 1-Hi z logiką na górze przy nie więcej niż 0,5 W/mm² da się chłodzić cieczą i utrzymać DRAM poniżej 100 C. Firma musiała też rozwiązać niewygodny problem arytmetyczny. Każdy silnik tensorowy potrzebuje flitu 128B na dostęp, ale jej matryca ma 840 banków, 768 po odjęciu 72 zapasowych, rozłożonych na 256 kanałów, co daje 3 banki na kanał. Pojedynczy dostęp zwraca 96B, więc flit 128B wymaga dwóch dostępów i pobiera 192B, marnując około 33% przepustowości przy blisko 33 TB/s. Rozwiązaniem jest blokowanie strumieni. Dzieli ono jeden częściowy dostęp 32B między trzy flity, tak że 4 dostępy po 96B zasilają 3 flity po 128B.
Sam cykl projektowy jest automatyzowany
Trzecim wąskim gardłem nie jest materiał ani typ pamięci, ale proces inżynieryjny. The Next Platform poinformował 27 lipca, że Nvidia wciska agentów AI do inżynierii chipów. Cytuje Tima Costę, wiceprezesa i dyrektora generalnego ds. inżynierii obliczeniowej w Nvidii. Costa powiedział dziennikarzom, że do 2030 roku branża ma produkować 2 000 000 000 000 chipów i przetwarzać około 41 000 000 płytek krzemowych miesięcznie, a pojedyncze opakowania zbliżać się będą do biliona tranzystorów.
"Kluczowy nie jest żaden pojedynczy numer; liczy się wzajemne oddziaływanie skali, architektury, opakowania i złożoności systemu" - powiedział Costa. "Tradycyjny proces projektowania po prostu nie nadąża za wyzwaniem tej skali".
Nvidia wdraża swój oparty na Arm procesor Vera CV100 w procesach EDA używanych do tworzenia przyszłych CPU i GPU, w tym w symulacji, weryfikacji formalnej i implementacji fizycznej. Według Costy wczesne testy inżynieryjne pokazują, że Vera na platformach VCS firmy Synopsys i Jasper firmy Cadence daje 1,5 raza większą wydajność niż systemy AMD Epyc Torrent. Vera ma 88 niestandardowych rdzeni Olympus CPU i podsystem pamięci LPDDR5X o przepustowości 1,2 TB/s. Następny procesor Nvidii, Rosa, ma pojawić się w 2028 roku jako część platformy centrów danych Feynman.
Dostawcy narzędzi mają własne twierdzenia. Cadence podaje, że jej AI Super Agents potrafią przeprowadzić setki symulacji w mniej niż dzień, pracę, która obecnie zajmuje pięć tygodni, dając 40 razy szybsze cykle walidacji na poziomie RTL. Synopsys zaprezentował na Design Automation Conference w pełni autonomiczny proces weryfikacji projektu i twierdzi, że dostarcza zwalidowany RTL 50 razy szybciej niż inne platformy.
Te wielokrotności trzeba traktować ostrożnie: pochodzą od dostawców sprzedających te narzędzia. The Next Platform zwraca uwagę na szersze wyzwanie branży, jakim jest orkiestracja, integracja i zabezpieczenia, bo wyniki generowane przez AI wciąż wymagają weryfikacji przed zatwierdzeniem.
Maia 200 Microsoftu, przedstawiona na Hot Chips 2026 i opisana przez ServeTheHome, pokazuje, jak wyglądają powstałe w ten sposób projekty. To chip w technologii 3nm ze 140 000 000 000 tranzystorów, 6 stosami HBM3e, przepustowością HBM 7TB/s, TDP 750 watów, wydajnością 10 000 TFLOPS w FP4 i matrycą SoC o powierzchni 820mm². Microsoft stosuje w pełni połączoną topologię poczwórną bez sieci scale-out, tylko scale-up: jego slajd pokazuje 128 szaf z 6 000 chipów. Firma współprojektowała też stos oprogramowania, z Microsoft Collective Communication Library w rdzeniu, bo definiowany programowo przepływ danych w sprzęcie wymaga dostrojonych do niego jąder obliczeniowych.
Złożenie tych trzech historii daje spójny obraz. Akcelerator nie jest już chipem. To opakowanie, które zależy od dostawcy materiału bliskiego monopolu, od architektury pamięci współprojektowanej z obciążeniem oraz od procesu projektowego przebudowywanego z pomocą AI, żeby nadążyć za własną złożonością. Każda warstwa ma własne terminy dostaw, a najwolniejsza wyznacza tempo.
Źródła
4- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
- 04Nvidia Accelerates Chip Engineering With AI AgentsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.