Dlaczego akceleratory AI coraz trudniej zbudować: T-glass, HBM i sklejanie 3D
Japońska firma Nittobo kontroluje około 90% światowych dostaw specjalistycznej tkaniny szklanej T-glass. Według Tom's Hardware niedobór uderza teraz w łańcuchy dostaw akceleratorów AI: ceny wzrosły o 20 do 30%, a terminy realizacji przekroczyły 20 tygodni.

Większość tekstów o sprzęcie do AI zaczyna się i kończy na Nvidii oraz TSMC. Tom's Hardware poinformował 9 marca, że wąskie gardło przesunęło się o warstwę niżej, do materiału, o którym mało kto słyszał. To T-glass, tkanina szklana o niskim współczynniku rozszerzalności cieplnej. Trafia do organicznego rdzenia podłoży układów scalonych, czyli warstwy łączącej chip z płytką drukowaną.
Co właściwie robi T-glass
T-glass utrzymuje wymiary dużych obudów chipów, które mocno się grzeją. Gdy procesory AI rosną i pracują w wyższych temperaturach, utrzymanie ich płaskości staje się problemem produkcyjnym, nie teoretycznym. Inne włókno szklane, E-glass, jest tańsze, ale trafia głównie do układów niższej klasy: mikrokontrolerów i starszych procesorów mobilnych. W masowym pakowaniu 2.5D i 3D wybiera się T-glass.
Nittobo dominuje na tym rynku. Ani ona, ani żadna inna firma nie uruchomi nowej linii produkcyjnej z dnia na dzień. Materiał wymaga specjalistycznych elektrycznych pieców topialniczych pracujących w temperaturze od 1 600 do 1 700°C. Proces obejmuje topienie szkła bogatego w krzemionkę, przędzenie go w przędzę i tkanie w ultracienką tkaninę. Skalowanie tego wymaga lat inwestycji i wiedzy specjalistycznej.
Nittobo potraja moce w swojej fabryce w Fukushimie w Japonii, ale nowe dostawy trafią na rynek dopiero w połowie 2027 roku. W międzyczasie ceny wzrosły o 20 do 30%, a terminy realizacji materiałów niższego szczebla, takich jak laminaty pokryte miedzią, wydłużyły się z typowych 8 do 10 tygodni do ponad 20. Bill Ho, analityk z Yuanta, powiedział Tom's Hardware: "Przy jeszcze bardziej ograniczonych dostawach T-glass dostawcy nie podają już terminów realizacji."
Bilal Hachemi, analityk z Yole Group zajmujący się łańcuchem dostaw podłoży układów scalonych, stwierdził, że T-glass "ma określone wartości przenikalności i współczynnika rozszerzalności cieplnej, które lepiej pasują do układów AI, zwłaszcza do organicznego rdzenia". Zwrócił też uwagę, że branża podłoży układów scalonych działa historycznie na cienkich marżach. Nawet umiarkowany wzrost popytu może więc wywołać niedobory. "Każdy wzrost popytu na materiały warstwowe, materiał ABF czy T-glass może spowodować potencjalny niedobór, bo to kłóci się z podstawami tej branży" - powiedział.
Ten niedobór jest tak dotkliwy, bo napędzają go najwięksi gracze. Hiperskalerzy zamawiają coraz większe obudowy chipów, a każda generacja używa większego interposera i bardziej złożonego podłoża. Według danych Nvidii, na które powołuje się Tom's Hardware, rozmiary interposera wzrosły z 814mm² dla architektury Hopper do 1 700mm² dla Blackwell, czyli o 109%. Nadchodzące generacje Rubin i Feynman mają skalować się dalej.
Większe obudowy, więcej materiału
Bank of America szacuje, że segment materiałów elektronicznych Nittobo odnotuje prawie dwukrotny wzrost sprzedaży z 40 900 000 000 jenów (266 000 000 dolarów) w 2025 roku do 87 700 000 000 jenów do marca 2028 roku, przy marży operacyjnej zbliżającej się do 48%. Takashi Enomoto, analityk badawczy Bank of America, powiedział, że popyt na ultracienki T-glass również rośnie, w związku z odchodzeniem od E-glass w urządzeniach najnowszej generacji.
Walka o przydział już się zaczęła. Hachemi opisał bezpośredni kontakt Nvidii z dostawcą materiałów wyższego szczebla jako bezprecedensowy: "Po raz pierwszy widzimy, jak Nvidia, klient końcowy, zwraca się do dostawców materiałów wyższego szczebla, żeby zabezpieczyć moce i mieć pewność, że je dostanie." Obawa polega na tym, że gdy Nvidia zabezpieczy swoją część, konkurencyjni nabywcy chipów będą walczyć o resztę.
Nittobo nie siedzi bezczynnie. Poza rozbudową w Fukushimie podwaja moce produkcji surowej przędzy w swojej fabryce na Tajwanie i importuje przędzę z powrotem do Japonii w celu wytwarzania tkaniny. Zawarła też umowę o współpracy z Nanya Plastics na zlecenie części tkania. To pokazuje, jak ciasny jest rynek: Nittobo łączy siły z jednym ze swoich największych konkurentów, żeby złagodzić wąskie gardło. Do 2027 roku około 20% tkaniny szklanej Nittobo ma być tkane przez Nanyę.
Ściana pamięci i odpowiedź w postaci sklejania
Materiał do pakowania to jedno ograniczenie. Przepustowość pamięci to drugie i jest przedmiotem osobnej dyskusji przewijającej się przez tegoroczne konferencje o chipach. Artykuł ServeTheHome o prezentacji d-Matrix na Hot Chips 2026 przedstawia problem: wagi modeli stale rosną, a pamięć podręczna KV skaluje się wraz z długością kontekstu pomnożoną przez rozmiar partii. Sześćdziesiąt cztery osoby przy kontekście 1M mogą oznaczać około 935 GB pamięci podręcznej KV.
SRAM osiąga docelową przepustowość, ale tylko w małej skali. Para kart akceleratora SRAM Corsair osiąga około 300 TB/s przy opóźnieniu około 1 ns, ale mieści tylko około 4 GB. HBM rozwiązuje połowę problemu z pojemnością, ale ma trudności z przepustowością, a d-Matrix podaje praktyczny pułap około 20 TB/s dla pakietów HBM4. Tak wysoka przepustowość ma swoją cenę w energii: przy 2,4 pJ/bit przesyłanie 100 TB/s przez HBM pochłania około 1,92 kW, zanim w ogóle policzy się ruch w sieci połączeń.
Odpowiedzią d-Matrix jest sklejanie jednostek obliczeniowych bezpośrednio na matrycach DRAM. Logiczna matryca TSMC N4 leży na matrycy DRAM 3D z wykorzystaniem sklejania powierzchniowego 36 um, procesu, który firma opisuje jako sprawdzony, tani, masowy i o wysokiej wydajności. Wyzwanie termiczne jest realne: d-Matrix twierdzi, że stos 1-Hi z logiką na górze o gęstości mocy nie większej niż 0,5 W/mm² można chłodzić cieczą i utrzymać DRAM poniżej 100 C. Pionowe wejście/wyjście 3D to około 0,3 do 0,4 pJ, czyli około 10 razy mniej niż HBM.
Istnieją kompromisy inżynieryjne. Każdy silnik tensorowy potrzebuje flitu 128B na dostęp, a przy 3 bankach na kanał pojedynczy dostęp zwraca 96B, marnując około 33% przepustowości. Poprawka d-Matrix, nazwana blokowaniem strumieniowym, współdzieli jeden częściowy dostęp 32B między trzy flity, dzięki czemu nadmiarowe pobieranie spada do zera. Przy 32GB na kartę skalowanie do 72 kart może pomieścić model frontier, taki jak Kimi K3, przy kontekście 1M.
Microsoft i Rebellions pokazują ten sam trend
Maia 200 firmy Microsoft, zaprezentowana na Hot Chips 2026 i relacjonowana na żywo przez ServeTheHome, to chip 3nm ze 140 000 000 000 tranzystorów, 6 stosami HBM3e, przepustowością HBM 7TB/s, TDP 750 watów i wydajnością 10 000 TFLOPS w FP4. Matryca SoC ma 820mm². Microsoft wdraża go w centrach danych Azure w projekcie sieciowym tylko do skalowania w górę: 128 szaf i 6 000 chipów połączonych przełącznikami poziomu 0 i poziomu 1 przez ujednolicony Ethernet. Testy uwagi pokazują efektywny szczyt 1,65 PFLOPS, a testy zbiorcze osiągają prawie 1,3TB/s w BF16 AllReduce.
Na Hot Chips 2025 Rebellions pokazał inne podejście do tego samego problemu pakowania. REBEL-Quad wykorzystuje cztery miejsca HBM3E na 144GB pamięci i UCIe jako połączenie między chipletami. Zbudowano go na Samsung SF4X i CoWoS-S, z czterema układami ASIC obliczeniowymi i czterema zintegrowanymi kondensatorami krzemowymi na pakiet. ServeTheHome zauważył, że to karta dual PCIe Gen5 x16 i że firma przeprowadziła na żywo demonstrację Llama 3.3 70B przy średnim czasie 35,5 ms na token wyjściowy na płytce deweloperskiej.
Środowisko akademickie też się rusza. Stanford, Carnegie Mellon, Penn, MIT i SkyWater Technology poinformowały o pierwszym monolitycznym chipie 3D zbudowanym w amerykańskiej fabryce, zaprezentowanym na 71. Międzynarodowym Spotkaniu Urządzeń Elektronowych IEEE w grudniu 2025 roku. Wczesne testy sprzętu pokazują, że prototyp przewyższa porównywalne chipy 2D około czterokrotnie, a symulacje wyższych wersji wskazują na nawet dwunastokrotną poprawę w obciążeniach AI, w tym tych wywodzących się z LLaMA firmy Meta. Subhasish Mitra, profesor Stanford, który kierował pracami, powiedział, że takie przełomy są sposobem, w jaki branża osiąga 1 000-krotne poprawy wydajności sprzętu, których będą wymagać przyszłe systemy AI.
Nic z tego nie nadchodzi w tempie, jakiego wymaga obecny niedobór. Ograniczenie T-glass to problem na lata, a badania nad sklejaniem i pakowaniem, które mogłyby później złagodzić presję, są wciąż w większości na slajdach prezentacji i płytkach deweloperskich.
Źródła
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Scientists and U.S. foundry achieve 3D chip breakthrough to accelerate AIEN
- 05Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.