OpenAI wdraża ASIC-y Jalapeno na hostach AMD Turin, gdy chłodzenie płynem wypiera powietrze
OpenAI wdraża swoje ASIC-y Jalapeno w połączeniu z hostami AMD EPYC Turin, z których każdy ma 1,5 TB pamięci, poinformował 2 października szef działu sprzętu. Szersza budowa centrów danych napotyka limit chłodzenia, którego powietrze już nie jest w stanie utrzymać.

Nowy ASIC Jalapeno od OpenAI jest wdrażany wewnętrznie w połączeniu z hostami AMD EPYC Turin, z których każdy ma 1,5 TB pamięci, podało Tom's Hardware 2 października. Redakcja zapytała o to Richarda Ho, wiceprezesa i szefa działu sprzętu w OpenAI, który nazwał wybór Turin "praktycznym" i stwierdził, że nowy procesor Vera od Nvidia jest "trochę w tyle... pod względem dojrzałości".
To wymowne przyznanie się ze strony firmy, która mocno opiera się na chipach Nvidia. Ho przedstawił to jako zarządzanie ryzykiem, a nie kwestię preferencji.
"Nasz sposób podejścia do tego projektu dotyczył naprawdę redukcji ryzyka i możliwości szybkiego wykonania tego projektu" powiedział Ho w rozmowie z Tom's Hardware Premium. "W programie Jalapeno staraliśmy się podejmować bardzo praktyczne decyzje. Chcieliśmy być agresywni w celach dotyczących wydajności i kosztów, ale nie chcieliśmy podejmować niepotrzebnych ryzyk".
Wdrożenie w skali racka po raz pierwszy opisało SemiAnalysis, według tego samego raportu. Tom's Hardware zauważył, że alternatywy oparte na Arm, takie jak Axiom od Google Cloud, Graviton od AWS i własny chip AGI od Arm, pozycjonowane są jako CPU agentic, przeznaczone do przyspieszania pętli rozumowania wykonywanych przez obciążenia agentic. Turin to x86. OpenAI wybrał go mimo to, a odpowiedź Ho sugeruje, że dojrzałość otaczającej platformy była ważniejsza niż zestaw instrukcji.
Dlaczego racki stają się coraz gorętsze
Wybory sprzętowe na górze łańcucha mają fizyczne konsekwencje na dole. Wanma Technology, w przewodniku po szafach z chłodzeniem płynem z 29 września, stwierdza, że tradycyjne szafy serwerowe chłodzone powietrzem osiągają maksimum między 8 a 10 kilowatami na rack, to progi ustalone dziesięciolecia temu, gdy pobór mocy procesorów był umiarkowany. Nowoczesne chipy do obliczeń o wysokiej wydajności pobierają teraz 700 watów, 1200 watów lub więcej na jednostkę, a wyposażenie jednej szafy w kilka z nich przekracza to, co wymuszone powietrze jest w stanie odprowadzić.
Wynikiem jest termiczne ograniczanie wydajności, utrata wydajności lub wprost awaria, jeśli chłodzenie nie nadąża. Wanma opisuje przejście na chłodzenie płynem jako konieczność, a nie optymalizację dla każdego, kto wdraża nowoczesne obliczenia w skali.
CoolIT, w artykule sponsorowanym opublikowanym przez IEEE Spectrum 22 września, podaje twardszą liczbę: powyżej 250 kW na rack, podejście hybrydowe, łączące chłodzenie płynem i powietrzem, przestaje działać, ponieważ podział 70/30 między płynem a powietrzem nadal pozostawia 75 kW ciepła do odprowadzenia przez system powietrzny. CoolIT twierdzi, że płyn może pochłonąć skutecznie całe ciepło, a udział powietrza spada poniżej 1 procenta obciążenia, co pozwala serwerowi działać bez wentylatorów. Firma mówi, że jej pętle są budowane z modułowych bloków coldplate, sprawdzonych w sześciu generacjach projektów bez wentylatorów.
To ujęcie ze strony dostawcy i należy je czytać w tym kontekście. Ale kierunek jest spójny z tym, co kupują operatorzy.
CDU otrzymują oznaczenie kwalifikacyjne
Nvidia podjęła kroki w celu standaryzacji części łańcucha dostaw 21 września, ogłaszając DSX Ready, program kwalifikacyjny dla produktów partnerów, które spełniają wymagania referencyjnego projektu fabryki AI DSX. Program wystartował z dwiema kategoriami: systemami magazynowania energii bateryjnej (BESS) i jednostkami dystrybucji chłodzenia (CDU). Kwalifikowane produkty BESS na starcie pochodziły od Hitachi Energy, LG Energy Solution i Tesli; kwalifikowane CDU pochodziły od LG Electronics, LiquidStack i Vertiv.
Blog Nvidii jest wyraźny co do ograniczeń tego oznaczenia. Przejście kwalifikacji "nie zastępuje inżynierii na poziomie obiektu ani nie implikuje stabilności na poziomie obiektu", czytamy. W przypadku CDU, ścieżka używa zestawu samokwalifikacji, aby określić, czy konkretna oferta spełnia odpowiednie wymagania funkcjonalne. Budowniczy nadal muszą wypracować, jak kwalifikowana jednostka wpasowuje się w ich obiekt, konfigurację i potrzeby operacyjne.
Osiem dni później, 29 września, Trane Technologies ogłosiła platformę LiquidStack CDU 2.X podczas Yotta 2026 w Swords w Irlandii. HPCwire raportuje, że jednostka jest niezależna od architektury, z przepływem do 3750 litrów na minutę przy 3,5 bara, i jest zaprojektowana, aby wspierać obecne platformy GPU oraz zapas na kolejne generacje, w tym Nvidia Vera Rubin.
"Operatorzy potrzebują infrastruktury chłodzenia, która może się dostosowywać, gdy platformy GPU i gęstość racków ewoluują" powiedział Scott Smith, General Manager LiquidStack w Trane Technologies, w komunikacie. "CDU 2.X łączy wydajność i elastyczność, których klienci potrzebują dziś, z zapasem na przygotowanie się do tego, co nadejdzie".
Ten sam komunikat cytuje temperatury wejściowe obiektu do 45C i architekturę VFD o ultraniskiej harmonicznej, mającą na celu zmniejszenie zniekształceń harmonicznego u źródła. Obsługiwane są wdrożenia na końcu rzędu i obok racków.
Montaż to łatwa część
Kevin Roof, Dyrektor ds. Ofert i Zarządzania Akwizycją w LiquidStack, argumentował w Data Center POST, że branża zadaje złe pytanie. Wdrożenie przyciąga uwagę, napisał, ale operacje decydują, czy wydajność utrzyma się przez dekadę. Instalacja mierzona jest w tygodniach; operacje w latach.
Jego konkretne ostrzeżenie dotyczy zakresu rażenia (blast radius). Ocena odporności przez liczenie redundantnych CDU pomija to, jak awaria propaguje się przez całą sieć dystrybucji i sterowania płynem. Zwraca też uwagę na dryf wydajności, argumentując, że dane operacyjne w czasie rzeczywistym pozwalają operatorom wyłapać degradację, zanim komponent faktycznie zawiedzie. W tym ujęciu pętla chłodzenia to system powiązany, w którym zmiana konfiguracji racka, akceleratorów lub strategii sterowania może zmienić zachowanie gdzie indziej w pętli.
Tolerancje produkcyjne wpływają na ten sam problem. XEBEC Deburring Technologies zauważa, że płyty zimne są budowane ze złożonymi wewnętrznymi kanałami, przecinającymi się otworami, frezowanymi kanałami i powierzchniami uszczelniającymi, a obróbka skrawaniem pozostawia drzazgi. Luźne cząstki mogą tworzyć problemy z zanieczyszczeniem; drzazgi w pobliżu obszarów uszczelniania komplikują montaż. Argumentem firmy jest to, że usuwanie drzazg powinno należeć do procesu obróbki, a nie być manualnym dodatkiem, co jest argumentem dostawcy, ale wskazuje na realny ciężar inspekcji.
Płyny i pytania, które kupujący zadają naprawdę
FAQ Telecomate dotyczące chłodzenia bezpośrednio na chip (direct-to-chip), skierowane do inżynierów sieciowych i zespołów zaopatrzenia, dotyczy tego, czy moduły cold plate mogą działać na płynach dielektrycznych o nieprzewodzącej przewodności. Odpowiedzią jest tak, z zastrzeżeniami: dielektryki eliminują ryzyko zwarcia pętli wodnych, ale generalnie mają niższą przewodność termiczną i wyższą lepkość niż mieszanki glikolu z wodą, więc przepływy, dobór pomp i geometria mikrokanalów muszą być specyfikowane odpowiednio. Zgodnie z FAQ, większość głównych dostawców DTC publikuje zatwierdzone listy płynów i macierze kompatybilności materiałów obejmujące miedź, aluminium, stal nierdzewną oraz uszczelki EPDM i fluoropolimerowe.
FAQ rysuje też linię między jednofazowym a dwufazowym DTC dielektrycznym. Jednofazowy utrzymuje płyn w stanie ciekłym i polega na wzroście ciepła właściwego; dwufazowy pozwala mu wrzeć na powierzchni chipa i skraplać się w zdalnym wymienniku ciepła, przenosząc ciepło jako energię utajoną. Dla kart linii telekom i przełączników 1U-2U, FAQ nazywa fazę pojedynczą bardziej praktycznym wyborem, rezerwując fazę dwufazową dla bardzo wysokich TDP ASIC powyżej mniej więcej 500 W na pakiet.
To wytyczne z technicznego FAQ, a nie benchmark, i to samo zastrzeżenie dotyczy przewodników doboru. Obraz operacyjny jest bardziej ugruntowany niż marketing.
To obraz, dla którego ujawnienie przez OpenAI ma znaczenie poza jednym programem chipów. Wybór hostów Turin i uruchamianie Jalapeno obok nich to decyzja obliczeniowa, ale każdy z tych racków ląduje w obiekcie, który musi usunąć ciepło. Między sufitem powietrznym 8-10 kW, który opisuje Wanma, a progiem 250 kW, którego cytuje CoolIT, przestrzeń na projekty hybrydowe szybko się zawęża. Dostawcy reagują programami kwalifikacyjnymi, CDU o wyższym przepływie i listami kompatybilności płynów. Operatorzy, tymczasem, są informowani, że trudna część zaczyna się po rozpakowaniu skrzyń.
Źródła
8- 01OpenAI's Jalapeno ASICs are deployed alongside AMD EPYC 'Turin' CPUs as hostsEN
- 02How Liquid-Cooled Server Cabinets Are Reshaping Data Center Infrastructure for AI WorkloadsEN
- 03The Future Is Fanless: 100% Heat Capture for Liquid Cooled AI ServersEN
- 04NVIDIA Launches DSX Ready to Qualify Power and Cooling Products for AI FactoriesEN
- 05LiquidStack CDU 2.X Brings Flexible Cooling to AI and HPC Data CentersEN
- 06The Real Challenges of Liquid Cooling Begin After InstallationEN
- 07Data Center Liquid Cooling: Deburring and Surface Finishing MatterEN
- 08Direct-to-Chip Liquid Cooling FAQ: Expert Answers to Technical Deployment QuestionsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.