Wyścig o moc obliczeniową to już nie dokładanie kart. Raport IDC o dwóch drogach chińskich centrów AI
Na AICC 2026 raport IDC rozłożył lukę obliczeniową na dwie warstwy: górny limit możliwości i skalę produkcji. Do 2030 roku luka może sięgnąć 380 900 000 000 dolarów, a samo dokładanie kart przestaje wystarczać, bo Prefill i Decode mają różne obciążenia.

Rywalizacja o moc obliczeniową dla AI przez lata sprowadzała się do jednego słowa: dokładać. Dokładać karty, szafy, generatory. Na AICC 2026 IDC opublikowało „Raport oceny rozwoju chińskiej mocy obliczeniowej dla sztucznej inteligencji 2026”. Problem rozbito w nim na dwie warstwy: górny limit możliwości i skalę produkcji.
Najpierw popyt. Z raportu wynika, że do 2030 roku światowe zadania wnioskowania AI będą rosły o 4 000 000 000 000 000 rocznie. Zużycie tokenów w pojedynczym zadaniu wieloetapowym wzrosło z kilkudziesięciu do kilkuset tysięcy. Współpraca wielu agentów dodatkowo potęguje te dwa czynniki. Dane IDC pokazują, że od tego roku do 2030 złożona roczna stopa wzrostu globalnego zużycia tokenów wyniesie 4 823%.
Podaż nie nadąża. Według raportu globalny wskaźnik zaspokojenia zapotrzebowania na moc obliczeniową dla AI spadał od 79% w 2024 roku, a w 2027 ma zjechać do 71%. Nawet jeśli presja w łańcuchu dostaw półprzewodników zmaleje, w 2030 roku uda się odbudować tylko do około 77%. Do 2030 roku bezwzględna wartość luki obliczeniowej sięgnie 380 900 000 000 dolarów, czyli niemal dziesięciokrotności poziomu z 2024 roku.
Dlaczego dokładanie kart przestaje działać? Bo obciążenia wnioskowania w erze agentów są niejednorodne. Prefill to zadanie o dużej równoległości i dużej gęstości obliczeniowej. Decode przetwarza token po tokenie, szeregowo, i bardziej zużywa przepustowość pamięci. Attention często sięga do rosnącego KV Cache, a MoE ma jeszcze rzadkie obliczenia i wielkoskalowe trasowanie. Dokładanie tego samego rodzaju mocy obliczeniowej łatwo prowadzi do zachwiania proporcji zasobów.
Producenci sprzętu odpowiadają dwiema drogami. Pierwsza to droga możliwości, na przykład superwęzłowy serwer AI Yuanbrain SD200 Ultra: liczba układów w całej maszynie rośnie z 64 do 128, pamięć VRAM i pamięć rozszerzona rosną do 8TB i 64TB. Producent twierdzi, że jedna maszyna pomieści i uruchomi model Kimi K3 o 2 800 000 000 000 parametrów, a nawet pozwoli wdrożyć na niej model o 10 000 000 000 000 parametrów. Dzięki jednolitemu adresowaniu i symetrycznym połączeniom bezpośrednim opóźnienie komunikacji All to All spada do 0,69 mikrosekundy, a superoperatory redukują liczbę operatorów do jednej dziesiątej. Producent podaje, że wydajność wnioskowania na Kimi K3 rośnie ponad trzykrotnie.
Druga droga to droga pojemności, na przykład wielomocowy zespół obliczeniowy Yuanbrain HC2000: pełne chłodzenie cieczą i zasilanie o wysokim przepływie, moc zasilania jednej szafy powyżej 300 kilowatów, do 256 kart akceleracji AI, gęstość mocy obliczeniowej czterokrotnie wyższa niż w tradycyjnej szafie chłodzonej powietrzem, a zagregowana przepustowość wewnątrz szafy sięga 200Tbps. Różne typy układów dzielą się pracą według etapu wnioskowania: Prefill trafia na układy o dużej mocy obliczeniowej, Decode na układy z dużą pojemnością HBM.
Obie drogi mają jeden wspólny warunek: moc obliczeniowa musi być wykorzystana pełniej. Opublikowana przez DeepSeek praca o DSec wskazuje w tym samym kierunku. Trening agentów wymaga tworzenia ogromnej liczby sandboxów na sekundę, a presja na harmonogramowanie klastra jest znacznie większa niż przy tradycyjnym pretreningu. Dla chińskich centrów AI najbliższa rywalizacja nie dotyczy tego, kto ma więcej kart, ale tego, kto potrafi drobniej rozdzielać zadania między niejednorodne zasoby.
Źródła
2Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.