Co naprawdę siedzi w akceleratorze AI: T-glass, HBM i wąskie gardło dekodowania
Jedna japońska firma kontroluje około 90% światowych dostaw tkaniny szklanej, która trafia do każdej zaawansowanej obudowy układu AI. Niedobór wpływa dziś na plany akceleratorów tak samo jak architektura GPU.

Nittobo ma około 90% światowego rynku T-glassu, tkaniny szklanej o niskim współczynniku rozszerzalności cieplnej, używanej w organicznym rdzeniu podłoży układów scalonych. Tak podaje Tom's Hardware. Firma potraja moce w zakładzie w Fukushimie, ale nowe dostawy trafią na rynek dopiero w połowie 2027 roku.
Ta luka jest już widoczna w cenach i terminach. Ceny T-glassu wzrosły o 20% do 30%, a czas realizacji materiałów na dalszym etapie, na przykład laminatów pokrytych miedzią, wydłużył się z normalnych 8 do 10 tygodni do ponad 20. "Przy jeszcze bardziej ograniczonych dostawach T-glassu dostawcy przestali podawać terminy realizacji" - powiedział Tom's Hardware Bill Ho, analityk w Yuanta. Skurcz widać najpierw w ofertach, których działy sprzedaży nie utrzymają dłużej niż kilka dni, a potem w harmonogramach, wokół których projektanci fabless budują okna premier. Nikt w łańcuchu nie chce publicznie powiedzieć, jak długo potrwa napięcie. Nikt nie chce być tym, kto źle przewidział.
Dlaczego podłoże liczy się bardziej niż liczba tranzystorów
Akcelerator AI to nie jeden układ. To obudowa: matryce logiczne, stosy pamięci, interposer i podłoże, które łączy to wszystko z płytką drukowaną. Organiczny rdzeń podłoża musi pozostać płaski, gdy obudowa się nagrzewa i stygnie, bo wypaczona obudowa zrywa mikroskopijne połączenia między matrycami. T-glass utrzymuje stabilność wymiarową, a jego wartości przenikalności elektrycznej i rozszerzalności cieplnej są dobrane właśnie pod to zadanie.
Bilal Hachemi, analityk w Yole Group, który śledzi łańcuch dostaw podłoży układów scalonych, powiedział Tom's Hardware Premium, że zastąpienie go nie jest proste. T-glass "ma konkretne wartości przenikalności i CTE, które lepiej pasują do układów AI, zwłaszcza w organicznym rdzeniu" - stwierdził. Wskazał też na strukturę branży, która zamienia małe wstrząsy popytu w niedobory. Biznes podłoży układów scalonych historycznie działał na cienkich marżach, więc "każdy wzrost popytu na materiały build-up, materiał ABF czy T-glass może wywołać niedobór, bo to stoi w sprzeczności z podstawami tej branży". Ta struktura powstała przed boomem AI. Zbudowano ją dla rynku, na którym popyt na podłoża rósł wolno i przewidywalnie. Nie przebudowano jej dla rynku, na którym jeden cykl produktowy potrafi podwoić zamówienia w ciągu roku.
Strona popytowa nie jest subtelna. Każda generacja akceleratora AI używa większego interposera i bardziej złożonego podłoża, czyli więcej materiału na sztukę. Według danych Nvidii, na które powołuje się Tom's Hardware, rozmiary interposera wzrosły z 814mm² dla Hoppera do 1,700mm² dla Blackwella, o 109%, a nadchodzące generacje Rubin i Feynman mają skalować dalej.
Bank of America szacuje, że segment materiałów elektronicznych Nittobo niemal podwoi sprzedaż z 40,9 mld jenów (266 mln dolarów) w 2025 roku do 87,7 mld jenów do marca 2028 roku, przy marży operacyjnej zbliżającej się do 48%. "Popyt na tkaninę T-glass prawdopodobnie wzrośnie bardziej, niż pierwotnie zakładano" - powiedział Takashi Enomoto, analityk badawczy w Bank of America. Dodał, że uwaga skupiała się na grubym T-glassie do obudów GPU i CPU, ale popyt na ultracienki T-glass prawdopodobnie wzrośnie, gdy wiodące urządzenia zaczną odchodzić od E-glassu.
Nittobo nie czeka. Poza Fukushimą podwaja moce produkcji surowej przędzy w zakładzie na Tajwanie i odsyła przędzę do Japonii na tkanie. Ma też umowę o współpracy z Nanya Plastics na zlecanie części tkania. Tom's Hardware zwraca uwagę na symbolikę: Nittobo łączy siły z jednym ze swoich największych konkurentów. Do 2027 roku około 20% tkaniny szklanej Nittobo ma być tkane przez Nanyę.
Pamięć to druga połowa wąskiego gardła
Jeśli podłoże decyduje o tym, czy obudowę da się zbudować, pamięć decyduje o tym, jak szybko odpowie. d-Matrix wykorzystała swoją prezentację na Hot Chips 2026 o akceleratorze Raptor, omawianą przez ServeTheHome, żeby przedstawić arytmetykę. Wagi modeli stale rosną, a KV cache skaluje się wraz z długością kontekstu pomnożoną przez rozmiar partii, więc 64 użytkowników przy kontekście 1M może oznaczać około 935 GB KV cache.
Podział między obliczeniami a pamięcią widać w dwóch fazach wnioskowania. Prefill przetwarza wiele tokenów promptu równolegle i jest ograniczony przepustowością obliczeń. Dekodowanie generuje jeden token naraz i jest zwykle ograniczone przepustowością pamięci. Ponieważ dekodowanie dominuje w czasie rzeczywistym, wygrane są tam, gdzie jest przepustowość. SRAM osiąga cel przepustowości, ale tylko w bardzo małej skali: para kart akceleratora SRAM Corsair dochodzi do około 300 TB/s przy opóźnieniu około 1 ns i mieści tylko około 4 GB. Komórka SRAM 6T jest około 10 razy większa od komórki DRAM.
HBM rozwiązuje problem pojemności, ale nie przepustowości. d-Matrix podaje praktyczny sufit około 20 TB/s dla pakietów HBM4, takich jak Nvidia Vera Rubin i AMD Instinct MI455, ograniczony szybkością pinów, szerokością I/O i powierzchnią obudowy na około 8 do 16 stosów. Przepustowość ma też cenę w mocy: przy 2.4 pJ/bit przetłoczenie 100 TB/s przez HBM kosztuje około 1.92 kW, zanim doliczy się jakikolwiek ruch w tkaninie.
"Po raz pierwszy widzimy, jak Nvidia, klient końcowy, zwraca się do dostawców materiałów wyżej w łańcuchu, żeby zabezpieczyć moce i upewnić się, że je dostanie". Bilal Hachemi, Yole Group, dla Tom's Hardware
Odpowiedzią d-Matrix jest ułożenie obliczeń bezpośrednio na matrycach DRAM. Matryca logiczna TSMC N4 leży na matrycy 3D DRAM, wykorzystując 36 um stackowania face-to-face. Pionowe 3D IO kosztuje około 0.3 do 0.4 pJ, mniej więcej 10 razy mniej niż HBM, bo to ścieżka milimetrowej skali, a nie centymetrowa trasa przez interposer. Firma twierdzi, że stos 1-Hi z logiką na wierzchu przy nie więcej niż 0.5 W/mm² da się chłodzić cieczą i utrzymać DRAM poniżej 100 C.
Integracja to moment, w którym elegancja się kończy. Każdy silnik tensorowy potrzebuje 128B flitu na dostęp, a przy 32B dostarczanych na dostęp do kolumny z banków 32B daje to 4 banki na kanał. Matryca ma 840 banków, 768 po odjęciu 72 zapasowych, rozłożonych na 256 kanałów, czyli tylko 3 banki na kanał. Blokowanie strumieni naprawia niedopasowanie, dzieląc jeden częściowy dostęp 32B między trzy flity, więc 4 dostępy po 96B zasilają 3 flity po 128B. Przy 32GB na kartę z wagami 4-bitowymi i 8-bitowym KV cache d-Matrix upycha model frontier, taki jak Kimi K3 przy kontekście 1M, w jednym racku na 72 karty.
Pętla projektowa jest automatyzowana nierówno
Opakowanie i pamięć to ograniczenia fizyczne. Czas projektowania to ograniczenie ekonomiczne. Tim Costa, wiceprezes i dyrektor generalny ds. inżynierii obliczeniowej w Nvidii, powiedział dziennikarzom, że do 2030 roku branża ma produkować 2 biliony układów i przetwarzać około 41 milionów płytek miesięcznie, a pojedyncze obudowy zbliżą się do biliona tranzystorów. "Tradycyjny proces projektowania po prostu nie nadąża za taką skalą wyzwania" - powiedział, według The Next Platform.
Nvidia wdraża swój procesor Vera CV100 oparty na Arm w swoich własnych przepływach EDA, w tym w symulacji, weryfikacji formalnej i implementacji fizycznej. Costa powiedział, że wczesne testy pokazują, iż Vera uruchamia Synopsys VCS i Cadence Jasper z wydajnością 1.5 razy większą niż systemy AMD Epyc Torrent. Cadence twierdzi, że jej AI Super Agents mogą prowadzić setki symulacji jednocześnie i dostarczać cykle walidacji na poziomie RTL 40 razy szybciej; Synopsys mówi, że jego autonomiczny przepływ weryfikacji może dostarczyć zwalidowany RTL 50 razy szybciej. To liczby dostawców, a SemiEngineering zauważa, że zwrot ku wyspecjalizowanym agentom tworzy nowe problemy wokół orkiestracji, integracji i zabezpieczeń, a wyniki generowane przez AI wciąż wymagają weryfikacji przed zatwierdzeniem.
Jeden punkt danych z ChipStack AI Super Agent firmy Cadence, opisany przez SemiEngineering, sugeruje, że korzyści nie dotyczą tylko szybkości. Firma podaje około 24% mniejszą powierzchnię i 18% niższy pobór mocy w porównaniu z czystym generowaniem kodu przez model bazowy.
Nic z tego nie usuwa ograniczenia po stronie dostaw. Większy interposer potrzebuje więcej T-glassu. Większy model potrzebuje większej przepustowości pamięci. Nvidia idąca bezpośrednio do Nittobo, co Hachemi nazwał bezprecedensowym w tej części łańcucha dostaw, to sygnał, gdzie naprawdę leży niedobór. Wymieniona przez niego obawa jest prosta: gdy Nvidia zabezpieczy swoją część, pozostali kupujący układy zostają walczyć o to, co zostało. Nowe fabryki powstają latami, podobnie jak nowy piec do tkaniny szklanej pracujący w temperaturze od 1,600 do 1,700°C.
Źródła
4- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Nvidia Accelerates Chip Engineering With AI AgentsEN
- 04Chip Industry Week In ReviewEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.