Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

OpenAI wdraża ASIC-y Jalapeno na hostach AMD Turin, gdy chłodzenie płynem wypiera powietrze

OpenAI wdraża swoje ASIC-y Jalapeno w połączeniu z hostami AMD EPYC Turin, z których każdy ma 1,5 TB pamięci, poinformował 2 października szef działu sprzętu. Szersza budowa centrów danych napotyka limit chłodzenia, którego powietrze już nie jest w stanie utrzymać.

TechnologiaAnalizaAnna KaczmarekOpublikowano: 2 października 20266 min czytaniaŹródła 8
OpenAI wdraża ASIC-y Jalapeno na hostach AMD Turin, gdy chłodzenie płynem wypiera powietrze

Nowy ASIC Jalapeno od OpenAI jest wdrażany wewnętrznie w połączeniu z hostami AMD EPYC Turin, z których każdy ma 1,5 TB pamięci, podało Tom's Hardware 2 października. Redakcja zapytała o to Richarda Ho, wiceprezesa i szefa działu sprzętu w OpenAI, który nazwał wybór Turin "praktycznym" i stwierdził, że nowy procesor Vera od Nvidia jest "trochę w tyle... pod względem dojrzałości".

To wymowne przyznanie się ze strony firmy, która mocno opiera się na chipach Nvidia. Ho przedstawił to jako zarządzanie ryzykiem, a nie kwestię preferencji.

"Nasz sposób podejścia do tego projektu dotyczył naprawdę redukcji ryzyka i możliwości szybkiego wykonania tego projektu" powiedział Ho w rozmowie z Tom's Hardware Premium. "W programie Jalapeno staraliśmy się podejmować bardzo praktyczne decyzje. Chcieliśmy być agresywni w celach dotyczących wydajności i kosztów, ale nie chcieliśmy podejmować niepotrzebnych ryzyk".

Wdrożenie w skali racka po raz pierwszy opisało SemiAnalysis, według tego samego raportu. Tom's Hardware zauważył, że alternatywy oparte na Arm, takie jak Axiom od Google Cloud, Graviton od AWS i własny chip AGI od Arm, pozycjonowane są jako CPU agentic, przeznaczone do przyspieszania pętli rozumowania wykonywanych przez obciążenia agentic. Turin to x86. OpenAI wybrał go mimo to, a odpowiedź Ho sugeruje, że dojrzałość otaczającej platformy była ważniejsza niż zestaw instrukcji.

Dlaczego racki stają się coraz gorętsze

Wybory sprzętowe na górze łańcucha mają fizyczne konsekwencje na dole. Wanma Technology, w przewodniku po szafach z chłodzeniem płynem z 29 września, stwierdza, że tradycyjne szafy serwerowe chłodzone powietrzem osiągają maksimum między 8 a 10 kilowatami na rack, to progi ustalone dziesięciolecia temu, gdy pobór mocy procesorów był umiarkowany. Nowoczesne chipy do obliczeń o wysokiej wydajności pobierają teraz 700 watów, 1200 watów lub więcej na jednostkę, a wyposażenie jednej szafy w kilka z nich przekracza to, co wymuszone powietrze jest w stanie odprowadzić.

Wynikiem jest termiczne ograniczanie wydajności, utrata wydajności lub wprost awaria, jeśli chłodzenie nie nadąża. Wanma opisuje przejście na chłodzenie płynem jako konieczność, a nie optymalizację dla każdego, kto wdraża nowoczesne obliczenia w skali.

CoolIT, w artykule sponsorowanym opublikowanym przez IEEE Spectrum 22 września, podaje twardszą liczbę: powyżej 250 kW na rack, podejście hybrydowe, łączące chłodzenie płynem i powietrzem, przestaje działać, ponieważ podział 70/30 między płynem a powietrzem nadal pozostawia 75 kW ciepła do odprowadzenia przez system powietrzny. CoolIT twierdzi, że płyn może pochłonąć skutecznie całe ciepło, a udział powietrza spada poniżej 1 procenta obciążenia, co pozwala serwerowi działać bez wentylatorów. Firma mówi, że jej pętle są budowane z modułowych bloków coldplate, sprawdzonych w sześciu generacjach projektów bez wentylatorów.

To ujęcie ze strony dostawcy i należy je czytać w tym kontekście. Ale kierunek jest spójny z tym, co kupują operatorzy.

CDU otrzymują oznaczenie kwalifikacyjne

Nvidia podjęła kroki w celu standaryzacji części łańcucha dostaw 21 września, ogłaszając DSX Ready, program kwalifikacyjny dla produktów partnerów, które spełniają wymagania referencyjnego projektu fabryki AI DSX. Program wystartował z dwiema kategoriami: systemami magazynowania energii bateryjnej (BESS) i jednostkami dystrybucji chłodzenia (CDU). Kwalifikowane produkty BESS na starcie pochodziły od Hitachi Energy, LG Energy Solution i Tesli; kwalifikowane CDU pochodziły od LG Electronics, LiquidStack i Vertiv.

Blog Nvidii jest wyraźny co do ograniczeń tego oznaczenia. Przejście kwalifikacji "nie zastępuje inżynierii na poziomie obiektu ani nie implikuje stabilności na poziomie obiektu", czytamy. W przypadku CDU, ścieżka używa zestawu samokwalifikacji, aby określić, czy konkretna oferta spełnia odpowiednie wymagania funkcjonalne. Budowniczy nadal muszą wypracować, jak kwalifikowana jednostka wpasowuje się w ich obiekt, konfigurację i potrzeby operacyjne.

Osiem dni później, 29 września, Trane Technologies ogłosiła platformę LiquidStack CDU 2.X podczas Yotta 2026 w Swords w Irlandii. HPCwire raportuje, że jednostka jest niezależna od architektury, z przepływem do 3750 litrów na minutę przy 3,5 bara, i jest zaprojektowana, aby wspierać obecne platformy GPU oraz zapas na kolejne generacje, w tym Nvidia Vera Rubin.

"Operatorzy potrzebują infrastruktury chłodzenia, która może się dostosowywać, gdy platformy GPU i gęstość racków ewoluują" powiedział Scott Smith, General Manager LiquidStack w Trane Technologies, w komunikacie. "CDU 2.X łączy wydajność i elastyczność, których klienci potrzebują dziś, z zapasem na przygotowanie się do tego, co nadejdzie".

Ten sam komunikat cytuje temperatury wejściowe obiektu do 45C i architekturę VFD o ultraniskiej harmonicznej, mającą na celu zmniejszenie zniekształceń harmonicznego u źródła. Obsługiwane są wdrożenia na końcu rzędu i obok racków.

Montaż to łatwa część

Kevin Roof, Dyrektor ds. Ofert i Zarządzania Akwizycją w LiquidStack, argumentował w Data Center POST, że branża zadaje złe pytanie. Wdrożenie przyciąga uwagę, napisał, ale operacje decydują, czy wydajność utrzyma się przez dekadę. Instalacja mierzona jest w tygodniach; operacje w latach.

Jego konkretne ostrzeżenie dotyczy zakresu rażenia (blast radius). Ocena odporności przez liczenie redundantnych CDU pomija to, jak awaria propaguje się przez całą sieć dystrybucji i sterowania płynem. Zwraca też uwagę na dryf wydajności, argumentując, że dane operacyjne w czasie rzeczywistym pozwalają operatorom wyłapać degradację, zanim komponent faktycznie zawiedzie. W tym ujęciu pętla chłodzenia to system powiązany, w którym zmiana konfiguracji racka, akceleratorów lub strategii sterowania może zmienić zachowanie gdzie indziej w pętli.

Tolerancje produkcyjne wpływają na ten sam problem. XEBEC Deburring Technologies zauważa, że płyty zimne są budowane ze złożonymi wewnętrznymi kanałami, przecinającymi się otworami, frezowanymi kanałami i powierzchniami uszczelniającymi, a obróbka skrawaniem pozostawia drzazgi. Luźne cząstki mogą tworzyć problemy z zanieczyszczeniem; drzazgi w pobliżu obszarów uszczelniania komplikują montaż. Argumentem firmy jest to, że usuwanie drzazg powinno należeć do procesu obróbki, a nie być manualnym dodatkiem, co jest argumentem dostawcy, ale wskazuje na realny ciężar inspekcji.

Płyny i pytania, które kupujący zadają naprawdę

FAQ Telecomate dotyczące chłodzenia bezpośrednio na chip (direct-to-chip), skierowane do inżynierów sieciowych i zespołów zaopatrzenia, dotyczy tego, czy moduły cold plate mogą działać na płynach dielektrycznych o nieprzewodzącej przewodności. Odpowiedzią jest tak, z zastrzeżeniami: dielektryki eliminują ryzyko zwarcia pętli wodnych, ale generalnie mają niższą przewodność termiczną i wyższą lepkość niż mieszanki glikolu z wodą, więc przepływy, dobór pomp i geometria mikrokanalów muszą być specyfikowane odpowiednio. Zgodnie z FAQ, większość głównych dostawców DTC publikuje zatwierdzone listy płynów i macierze kompatybilności materiałów obejmujące miedź, aluminium, stal nierdzewną oraz uszczelki EPDM i fluoropolimerowe.

FAQ rysuje też linię między jednofazowym a dwufazowym DTC dielektrycznym. Jednofazowy utrzymuje płyn w stanie ciekłym i polega na wzroście ciepła właściwego; dwufazowy pozwala mu wrzeć na powierzchni chipa i skraplać się w zdalnym wymienniku ciepła, przenosząc ciepło jako energię utajoną. Dla kart linii telekom i przełączników 1U-2U, FAQ nazywa fazę pojedynczą bardziej praktycznym wyborem, rezerwując fazę dwufazową dla bardzo wysokich TDP ASIC powyżej mniej więcej 500 W na pakiet.

To wytyczne z technicznego FAQ, a nie benchmark, i to samo zastrzeżenie dotyczy przewodników doboru. Obraz operacyjny jest bardziej ugruntowany niż marketing.

To obraz, dla którego ujawnienie przez OpenAI ma znaczenie poza jednym programem chipów. Wybór hostów Turin i uruchamianie Jalapeno obok nich to decyzja obliczeniowa, ale każdy z tych racków ląduje w obiekcie, który musi usunąć ciepło. Między sufitem powietrznym 8-10 kW, który opisuje Wanma, a progiem 250 kW, którego cytuje CoolIT, przestrzeń na projekty hybrydowe szybko się zawęża. Dostawcy reagują programami kwalifikacyjnymi, CDU o wyższym przepływie i listami kompatybilności płynów. Operatorzy, tymczasem, są informowani, że trudna część zaczyna się po rozpakowaniu skrzyń.

Komentarze 0

Źródła

8
  1. 01OpenAI's Jalapeno ASICs are deployed alongside AMD EPYC 'Turin' CPUs as hostsEN
  2. 02How Liquid-Cooled Server Cabinets Are Reshaping Data Center Infrastructure for AI WorkloadsEN
  3. 03The Future Is Fanless: 100% Heat Capture for Liquid Cooled AI ServersEN
  4. 04NVIDIA Launches DSX Ready to Qualify Power and Cooling Products for AI FactoriesEN
  5. 05LiquidStack CDU 2.X Brings Flexible Cooling to AI and HPC Data CentersEN
  6. 06The Real Challenges of Liquid Cooling Begin After InstallationEN
  7. 07Data Center Liquid Cooling: Deburring and Surface Finishing MatterEN
  8. 08Direct-to-Chip Liquid Cooling FAQ: Expert Answers to Technical Deployment QuestionsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.