OpenAI déploie ses ASIC Jalapeno sur des hôtes AMD Turin, le refroidissement liquide prend le relais de l'air
OpenAI déploie ses ASIC Jalapeno avec des hôtes AMD EPYC Turin dotés chacun de 1,5 To de mémoire, a déclaré son responsable matériel le 2 octobre. L'expansion des centres de données bute sur une limite de refroidissement que l'air ne peut plus atteindre.

Le nouvel ASIC Jalapeno d'OpenAI est déployé en interne avec des hôtes AMD EPYC Turin, chacun doté de 1,5 To de mémoire, selon Tom's Hardware du 2 octobre. Le média a interrogé Richard Ho, vice-président et responsable matériel chez OpenAI, qui a qualifié le choix de Turin de « pragmatique ». Il a ajouté que le nouveau CPU Vera de Nvidia est « un peu en retard… sur ce niveau de maturité ».
C'est une admission notable de la part d'une entreprise qui s'appuie fortement sur les puces Nvidia. Ho a présenté ce choix comme une gestion des risques plutôt que comme une préférence.
« Notre approche de cette conception était vraiment axée sur la réduction des risques et la possibilité de réaliser cette conception rapidement », a déclaré Ho à Tom's Hardware Premium. « Pour le programme Jalapeno, nous cherchions à prendre des décisions très pragmatiques. Nous voulions être agressifs sur les objectifs de performance et de coût, mais nous ne voulions pas prendre de risques inutiles. »
Le déploiement à l'échelle du rack a été décrit pour la première fois par SemiAnalysis, selon le même rapport. Tom's Hardware a noté que les alternatives basées sur Arm, telles qu'Axiom de Google Cloud, Graviton d'AWS et la puce AGI d'Arm elle-même, sont positionnées comme des CPU agentiques, destinées à accélérer les boucles de raisonnement des charges de travail agentiques. Turin est x86. OpenAI l'a choisi malgré tout. La réponse de Ho suggère que la maturité de la plateforme environnante comptait plus que le jeu d'instructions.
Pourquoi les racks deviennent de plus en plus chauds
Les choix matériels en amont ont une conséquence physique en aval. Wanma Technology, dans un guide de cabine de refroidissement liquide daté du 29 septembre, indique que les cabines de serveurs traditionnelles refroidies à l'air plafonnent entre 8 et 10 kilowatts par rack. C'est un seuil fixé il y a des décennies, lorsque la consommation des processeurs était modeste. Les puces de calcul haute performance consomment désormais 700 watts, 1 200 watts, voire plus par unité. Remplir une seule cabine avec plusieurs d'entre elles dépasse ce que l'air forcé peut dissiper.
Le résultat est le thermal throttling, la perte de performance, ou la panne complète si le refroidissement ne suit pas. Wanma décrit le passage au liquide comme une nécessité, et non une optimisation, pour quiconque déploie du calcul moderne à grande échelle.
CoolIT, dans un article parrainé publié par IEEE Spectrum le 22 septembre, donne un chiffre plus précis : au-delà de 250 kW par rack, une approche hybride liquide et air cesse de fonctionner. Un ratio liquide-air de 70/30 laisse encore 75 kW de chaleur au système d'air à évacuer. CoolIT affirme que le liquide peut prendre efficacement toute la chaleur, l'air passant sous 1 % de la charge. Cela permet à un serveur de fonctionner sans ventilateur. L'entreprise précise que ses boucles sont construites à partir de blocs de cold plate modulaires éprouvés sur six générations de conceptions sans ventilateur.
C'est un cadrage de fournisseur, à lire comme tel. Mais la direction est cohérente avec ce que les opérateurs achètent.
Les CDU obtiennent un badge de qualification
Nvidia a cherché à standardiser une partie de la chaîne d'approvisionnement le 21 septembre en annonçant DSX Ready. C'est un programme de qualification pour les produits partenaires qui répondent aux exigences de conception de référence DSX AI factory de Nvidia. Le programme a lancé deux catégories : les systèmes de stockage d'énergie par batterie et les unités de distribution de refroidissement. Les produits BESS qualifiés au lancement provenaient de Hitachi Energy, LG Energy Solution et Tesla. Les CDU qualifiées provenaient de LG Electronics, LiquidStack et Vertiv.
Le blog de Nvidia est explicite sur les limites du badge. Le passage de la qualification « ne remplace pas l'ingénierie au niveau du site ni n'implique la stabilité au niveau du site ». Pour les CDU, le processus utilise une suite d'auto-qualification pour déterminer si une offre spécifique répond aux exigences fonctionnelles applicables. Les constructeurs doivent toujours déterminer comment une unité qualifiée s'intègre à leur site, leur configuration et leurs besoins opérationnels.
Huit jours plus tard, le 29 septembre, Trane Technologies a annoncé la plateforme CDU 2.X de LiquidStack lors de Yotta 2026 à Swords, en Irlande. HPCwire rapporte que l'unité est agnostique par rapport à l'architecture. Elle offre une capacité de débit de jusqu'à 3 750 litres par minute à 3,5 bar. Elle est conçue pour supporter les plateformes GPU actuelles, avec de la marge pour les générations suivantes, y compris Nvidia Vera Rubin.
« Les opérateurs ont besoin d'infrastructures de refroidissement capables de s'adapter à l'évolution des plateformes GPU et des densités de rack », a déclaré Scott Smith, directeur général de LiquidStack chez Trane Technologies, dans l'annonce. « CDU 2.X combine les performances et la flexibilité dont les clients ont besoin aujourd'hui avec la marge pour se préparer à ce qui vient. »
La même annonce cite des températures d'entrée de site jusqu'à 45C et une architecture VFD à ultra-faibles harmoniques destinée à réduire la distorsion harmonique à la source. Le déploiement en fin de rangée et adjacent au rack sont tous deux pris en charge.
L'installation est la partie facile
Kevin Roof, directeur de la gestion des offres et des captures chez LiquidStack, a argumenté dans Data Center POST que l'industrie pose la mauvaise question. Le déploiement attire l'attention, a-t-il écrit, mais les opérations déterminent si la performance se maintient pendant une décennie. L'installation se mesure en semaines ; les opérations se mesurent en années.
Son avertissement spécifique porte sur le rayon d'explosion. Évaluer la résilience en comptant les CDU redondants ignore la façon dont une défaillance se propage à travers tout le réseau de distribution et de contrôle des fluides. Il signale également la dérive de performance. Les données opérationnelles en temps réel permettent aux opérateurs de détecter la dégradation avant qu'un composant ne tombe réellement en panne. Dans cette lecture, une boucle de refroidissement est un système interconnecté. Un changement de configuration de rack, d'accélérateurs ou de stratégie de contrôle peut altérer le comportement ailleurs dans la boucle.
Les tolérances de fabrication alimentent le même problème. XEBEC Deburring Technologies note que les cold plates sont construites avec des passages internes complexes, des trous croisés, des canaux usinés et des surfaces d'étanchéité. L'usinage laisse des bavures. Les particules lâches peuvent créer des problèmes de contamination. Les bavures près des zones d'étanchéité compliquent l'assemblage. L'argument de l'entreprise est que le débavurage doit appartenir au processus d'usinage, et non être un après-coup manuel. C'est un argument de fournisseur, mais il pointe vers une charge d'inspection réelle.
Les fluides, et les questions que les acheteurs posent vraiment
La FAQ directe vers la puce de Telecomate, destinée aux ingénieurs réseau et aux équipes d'approvisionnement, aborde la question de savoir si les modules de cold plate peuvent fonctionner avec des fluides diélectriques non conducteurs. La réponse est oui, avec des réserves. Les diélectriques éliminent le risque de court-circuit des boucles à base d'eau, mais ont généralement une conductivité thermique plus faible et une viscosité plus élevée que les mélanges glycol-eau. Les débits, le dimensionnement des pompes et la géométrie des microcanaux doivent donc être spécifiés en conséquence. La plupart des grands fabricants DTC publient des listes de fluides approuvés et des matrices de compatibilité des matériaux couvrant le cuivre, l'aluminium, l'acier inoxydable, les joints EPDM et fluoropolymère, selon la FAQ.
Elle trace également une ligne entre le DTC diélectrique mono-phase et bi-phase. Le mono-phase maintient le fluide à l'état liquide et s'appuie sur l'élévation de chaleur sensible. Le bi-phase permet au fluide de bouillir sur la surface de la puce et de se condenser dans un échangeur de chaleur distant, déplaçant la chaleur comme énergie latente. Pour les cartes de ligne télécom et les commutateurs 1U-2U, la FAQ qualifie le mono-phase de choix plus pragmatique. Elle réserve le bi-phase aux ASIC à très haute TDP, au-dessus d'environ 500 W par package.
Ceci est un guide issu d'une FAQ technique, pas un benchmark. La même réserve s'applique aux guides de sélection. Le tableau opérationnel est plus établi que le marketing.
C'est ce tableau qui rend la divulgation d'OpenAI importante au-delà d'un programme de puce. Choisir des hôtes Turin et exécuter Jalapeno avec eux est une décision de calcul. Mais chacun de ces racks atterrit dans une installation qui doit évacuer la chaleur. Entre le plafond d'air de 8-10 kW décrit par Wanma et le seuil de 250 kW cité par CoolIT, l'espace pour les conceptions hybrides se resserre rapidement. Les fournisseurs répondent avec des programmes de qualification, des CDU à débit plus élevé et des listes de compatibilité des fluides. Les opérateurs, entre-temps, se font dire que la partie difficile commence après le déballage des caisses.
Sources
8- 01OpenAI's Jalapeno ASICs are deployed alongside AMD EPYC 'Turin' CPUs as hostsEN
- 02How Liquid-Cooled Server Cabinets Are Reshaping Data Center Infrastructure for AI WorkloadsEN
- 03The Future Is Fanless: 100% Heat Capture for Liquid Cooled AI ServersEN
- 04NVIDIA Launches DSX Ready to Qualify Power and Cooling Products for AI FactoriesEN
- 05LiquidStack CDU 2.X Brings Flexible Cooling to AI and HPC Data CentersEN
- 06The Real Challenges of Liquid Cooling Begin After InstallationEN
- 07Data Center Liquid Cooling: Deburring and Surface Finishing MatterEN
- 08Direct-to-Chip Liquid Cooling FAQ: Expert Answers to Technical Deployment QuestionsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.