Chińscy dostawcy mocy obliczeniowej przekonują, że liczy się software
„Półtora karty 6000D bije jedną B300” — tak chiński dostawca chmury obliczeniowej podsumowuje optymalizację wnioskowania. Inspur mówi z kolei o luce w mocach obliczeniowych wartej 381 mld dolarów do 2030 roku.

W dyskusji o kosztach AI dominuje cena kart graficznych. Chiński dostawca infrastruktury 是石科技 (METASTONE) przekonuje, że większe rezerwy siedzą w oprogramowaniu. Firma zoptymalizowała obsługę modelu DeepSeek-V4.1-Flash tak, żeby działał na ośmiu kartach połączonych wyłącznie przez PCIe, bez szybkiej magistrali międzyprocesorowej.
Efekt opisał 量子位: przepustowość wejściowa wzrosła z 1932 do 13 274 tokenów na sekundę, czyli 6,87 raza. Kluczem było uzupełnienie jądra obliczeniowego i przebudowa komunikacji między kartami, a także ponowne użycie pamięci podręcznej kontekstu. Firma podsumowuje to zdaniem, że „półtora karty 6000D bije jedną B300”, czyli że tańszy, wolniejszy sprzęt wygrywa z droższym, jeśli dobrze ułoży się przetwarzanie. Spółka zarządza ponad 20 000 P mocy obliczeniowej w kilkunastu centrach i deklaruje dostępność usługi na poziomie powyżej 99,95 proc.
Drugi głos pochodzi od Inspur (浪潮信息). Firma oparła się na danych IDC podczas konferencji AICC 2026. Zgodnie z nimi światowy popyt na moc obliczeniową do AI będzie zaspokojony w 79 proc. w 2024 roku, w 71 proc. w 2027 roku i około 77 proc. w 2030 roku. Luka między potrzebami a podażą sięgnie 380,9 mld dolarów, dziesięciokrotnie więcej niż w 2024 roku. Zużycie tokenów ma rosnąć w tempie ponad 48-krotnym rok do roku w ujęciu skumulowanym, a zadania wnioskowania dobić do 4000 bilionów rocznie w 2030 roku.
Inspur odpowiada na to sprzętem. System SD200 Ultra mieści 128 układów, 8 TB pamięci i 64 TB przestrzeni dyskowej w jednej maszynie. Ma to pozwalać na obsługę modeli o bilionie parametrów bez rozdzielania ich na wiele szaf. Opóźnienie komunikacji wszystkie-do-wszystkich zredukowano do 0,69 mikrosekundy.
Dla kupujących moc obliczeniową płynie z tego wniosek, że cena za token przestaje być funkcją wyłącznie ceny sprzętu. Coraz częściej decyduje o niej to, jak sprawnie dostawca potrafi wykorzystać to, co już ma, a to zmienia reguły przetargów na usługi chmurowe.
Wniosek dla kupujących jest praktyczny. Skoro kilkukrotny wzrost przepustowości dało samo przepisanie obsługi pamięci podręcznej i rozłożenie pracy między dostępne układy, decyzja o zakupie nowej generacji sprzętu powinna być poprzedzona audytem oprogramowania. Dostawca, który potrafi pokazać zmierzone wartości na tej samej infrastrukturze, sprzedaje dziś nie moc obliczeniową, lecz oszczędność. To zarazem najprostszy sposób, w jaki chińscy operatorzy centrów danych odpowiadają na ograniczenia eksportowe: tam, gdzie nie można dokupić najmocniejszych kart, liczy się przede wszystkim sprawność tego, co już stoi w serwerowni.
Źródła
2Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.