Akceleratory AI: wąskie gardło w pakowaniu, którego nikt nie wycenia, i startupy grające przeciw HBM
Japońska firma, o której większość operatorów centrów danych nie słyszała, kontroluje około 90% globalnych dostaw tkaniny szklanej. Ta tkanina siedzi w każdej zaawansowanej obudowie chipu AI, a kolejna linia produkcyjna firmy ruszy dopiero w połowie 2027 roku.

T-glass firmy Nittobo to tkanina szklana o niskim współczynniku rozszerzalności cieplnej. Leży w organicznym rdzeniu podłoży układów scalonych, czyli w warstwie łączącej chip z płytką drukowaną. Jak podaje Tom's Hardware, firma ma około 90% globalnych dostaw. Popyt tak bardzo przewyższył podaż, że terminy realizacji laminatów miedzianych wydłużyły się z typowych 8 do 10 tygodni do ponad 20. Ceny wzrosły o 20 do 30%.
Ta liczba znaczy więcej, niż wygląda. Każda generacja akceleratora AI mieści większy interposer i bardziej złożone podłoże, więc każdy chip zużywa więcej materiału. Dane samej Nvidii, cytowane przez Tom's Hardware, podają rozmiary interposera na 814 mm² dla Hoppera i 1 700 mm² dla Blackwella, czyli wzrost o 109%, a Rubin i Feynman mają skalować dalej. Podaż nie może odpowiedzieć szybko. T-glass wymaga pieców do topienia elektrycznego pracujących w temperaturze od 1 600 do 1 700°C, a Nittobo potraja moce w zakładzie w Fukushimie. Nowa produkcja trafi na rynek dopiero w połowie 2027 roku.
Analitycy cytowani w tym raporcie opisują rynek, na którym substytucja jest trudna. „Nie jest łatwo zastąpić T-glass” – powiedział Tom's Hardware Bilal Hachemi z Yole Group, wskazując na konkretne wartości przenikalności elektrycznej i rozszerzalności cieplnej, które pasują do chipów AI, zwłaszcza do organicznego rdzenia. Analityk Yuanta Bill Ho stwierdził, że dostawcy przestali w ogóle podawać terminy realizacji. Takashi Enomoto z Bank of America przewiduje, że sprzedaż materiałów elektronicznych Nittobo niemal się podwoi z 40,9 mld jenów (266 mln dolarów) w 2025 roku do 87,7 mld jenów do marca 2028 roku, przy marży operacyjnej zbliżającej się do 48%.
Jeden szczegół zwraca uwagę. Hachemi powiedział, że bezpośrednie zwrócenie się Nvidii do dostawcy materiałów na wcześniejszym etapie łańcucha było w tej części branży czymś niespotykanym. Jeśli największy nabywca zablokuje moce jako pierwszy, wszyscy inni negocjują o to, co zostanie.
Przepustowość pamięci to druga ściana
Gdy pakowanie się zacieśnia, projektanci akceleratorów spierają się o pamięć. Na Hot Chips 2026 d-Matrix pokazał Raptor, akcelerator, który nakłada układ logiczny TSMC N4 na układ DRAM 3D, łącząc je twarzą do twarzy w technologii 36 mikronów, jak podaje ServeTheHome. Argument jest taki, że ani SRAM, ani HBM osobno nie wystarczają do wnioskowania. SRAM daje przepustowość, ale mieści mało danych, a HBM daje pojemność, ale napotyka ograniczenia szybkości pinów, liczby stosów i miejsca na obudowie. d-Matrix podaje praktyczny sufit około 20 TB/s dla pakietów HBM4.
Przepustowość ma rachunek za prąd. Opracowanie ServeTheHome podaje HBM na 2,4 pJ/bit, co oznacza, że 100 TB/s kosztuje około 1,92 kW, zanim dojdzie ruch w sieci połączeń. Pionowe IO 3D wypada na około 0,3 do 0,4 pJ, czyli jakieś dziesięć razy mniej, bo to ścieżka o skali milimetra, a nie centymetra przez interposer.
Liczby d-Matrix są konkretne i pozbawione blasku. Każdy silnik tensorowy potrzebuje flitu 128B na dostęp, ale banki 32B w 256 kanałach dają 3 banki na kanał po odjęciu zapasowych, co zwraca 96B na dostęp. Dwa dostępy pobierają 192B, żeby dostarczyć 128B, marnując około 33% przepustowości przy blisko 33 TB/s. Poprawka firmy, blokowanie strumieni, dzieli jeden częściowy dostęp między trzy flity, dzięki czemu 384B na wejściu odpowiada 384B na wyjściu, a nadmiarowe pobieranie spada do zera. Przy 32 GB na kartę, wagach 4-bitowych i pamięci KV 8-bitowej d-Matrix twierdzi, że skala 72 kart pomieści model frontier przy kontekście 1M.
Chiplety i zmiana licencjonowania RISC-V
Ograniczenia pakowania i kompromisy pamięciowe popychają producentów ku różnym strategiom integracji. Rebellions pokazał swój REBEL-Quad na Hot Chips 2025: cztery ASIC obliczeniowe, cztery miejsca HBM3E na 144 GB i UCIe-A jako połączenie międzyukładowe, zbudowane na Samsung SF4X i CoWoS-S, jak podaje ServeTheHome. Karta działa na dwóch PCIe Gen5 x16, a firma pokazała Llama 3.3 70B na płytce deweloperskiej przy średnio 35,5 ms na token wyjściowy.
ServeTheHome zauważył, że wybór PCIe kłóci się z przejściem Nvidii na Gen6, ale za istotniejszy fakt uznał sam pokaz na żywo: działający chip oparty na UCIe publicznie, co jest na tyle rzadkie, że warto to odnotować. Po stronie obliczeń SiFive przeniosło się z licencjonowania rdzeni CPU RISC-V innym firmom na sprzedaż własnego projektu akceleratora. The Register podał 19 września 2024 roku, że klastry Intelligence XM firmy SiFive łączą cztery rdzenie Intelligence X CPU z własnym silnikiem matematyki macierzowej, z przepustowością pamięci do 1 TB/s na klaster i do 16 TOPS w INT8 lub 8 teraFLOPS w BF16 na gigaherc.
John Ronco, starszy wiceprezes i dyrektor generalny SiFive na Wielką Brytanię, powiedział The Register, że część klientów nadal chce własnego sprzętu, ale inni woleli jedną kompleksową ofertę. Spodziewał się, że większość chipów zbudowanych na tym projekcie użyje od czterech do ośmiu klastrów, i wahał się co do tego, jak daleko to się skaluje, choć slajdy firmy sugerują, że możliwe jest 512 klastrów. Dla porównania najwyższe układy Blackwella Nvidii mają 2,5 petaFLOPS w BF16.
SiFive dostarcza już projekty RISC-V używane w tensorowych jednostkach przetwarzających Google i w Blackhole firmy Tenstorrent, a dyrektor generalny Patrick Little twierdził w gotowym oświadczeniu, że firma zaopatruje pięć z firm „Wspaniałej Siódemki”, co The Register oznaczył jako prawdopodobnie nie wszystkie związane z AI.
Sankcje wciąż przerysowują mapę
Łańcuch dostaw przerysowują też kontrole eksportowe. The Register podał 28 października 2024 roku, że TSMC miało odciąć chińskiego projektanta Sophgo w związku z podejrzeniami, że próbował dostarczać komponenty Huawei. Reuters, powołując się na dwie osoby znające sprawę, wskazał klienta, który zamówił chip przypominający Huawei Ascend 910B. Sophgo zaprzeczyło jakimkolwiek bezpośrednim lub pośrednim relacjom biznesowym z Huawei i oświadczyło, że przekazało TSMC szczegółowy raport z dochodzenia. Bitmain, powiązany z Sophgo, nazwał te zarzuty fałszywymi i bezpodstawnymi.
The Register zauważył, że historia Bitmain nie jest czysta: w 2021 roku prokuratorzy wkroczyli do jego biur na Tajwanie i oskarżyli dwa podmioty stowarzyszone o próbę nielegalnego rekrutowania tajwańskich inżynierów. TSMC przestało robić interesy z Huawei w 2020 roku na mocy przepisów USA.
Huawei Ascend 910B ma 320 teraFLOPS w FP16 lub 640 teraFLOPS w Int8, czyli mniej więcej tyle, co czteroletni A100 Nvidii, według tego raportu. Wolniejszy od obecnej czołówki, ale dostępny, a to właśnie ma znaczenie, gdy limity eksportowe wciąż się zaostrzają.
Źródła
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04SiFive expands from RISC-V cores for AI chips to designing its own full-fat acceleratorEN
- 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.