Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Le mur de la mémoire dans les accélérateurs d'IA : d-Matrix, Microsoft et la poussée du DRAM 3D

Les accélérateurs d'IA se heurtent à un problème de mémoire que les concepteurs contournent de plus en plus en empilant les puces verticalement. d-Matrix a profité de Hot Chips 2026 pour défendre Raptor, son design qui place une puce logique TSMC N4 au-dessus d'une puce DRAM 3D. L'entreprise affirme qu'il dépasse le plafond de bande passante que les boîtiers HBM atteignent, autour de 20 TB/s.

TechnologieExpliquéCamille RousseauPublié le: 27 septembre 20265 min de lectureSources 2
Le mur de la mémoire dans les accélérateurs d'IA : d-Matrix, Microsoft et la poussée du DRAM 3D

Les poids des modèles grossissent sans cesse, et le KV cache suit la longueur de contexte multipliée par la taille du batch. ServeTheHome, qui rapporte la présentation de d-Matrix à Hot Chips 2026 le 14 septembre, pose le calcul : 64 utilisateurs à 1M de contexte peuvent représenter environ 935 GB de KV cache. Poids et cache posent ensemble un problème de capacité et de bande passante. Les deux continuent de croître.

La SRAM atteint l'objectif de bande passante, mais seulement à très petite échelle. Une paire de cartes accélératrices Corsair SRAM atteint environ 300 TB/s pour une latence d'environ 1 ns, mais ne contient qu'environ 4 GB. Une cellule SRAM 6T est environ 10 fois plus grande qu'une cellule DRAM, et les fuites atteignent des dizaines de watts à l'échelle du GB. La SRAM convient donc à un modèle draft en décodage spéculatif, pas à stocker les poids d'un modèle de frontière.

Le HBM résout la capacité, pas la bande passante

Le HBM règle la moitié capacité mais peine sur la bande passante. La vitesse des broches et la largeur d'E/S par puce de base progressent lentement, et le nombre de piles reste limité par la surface de boîtier disponible, environ 8 à 16 piles par boîtier. d-Matrix cite un plafond pratique de bande passante autour de 20 TB/s pour les boîtiers HBM4 tels que le NVIDIA Vera Rubin et l'AMD Instinct MI455.

Une bande passante aussi élevée a un prix énergétique. À 2,4 pJ/bit, pousser 100 TB/s à travers du HBM consomme environ 1,92 kW avant même de compter le trafic de fabric. D'après l'article de ServeTheHome, les boîtiers actuels manquent à la fois de surface et de budget énergétique pour atteindre une bande passante de classe SRAM avec du HBM.

d-Matrix répond en empilant le calcul directement au-dessus des puces DRAM. L'empilement crée un défi thermique, car des centaines de watts doivent s'échapper par les TSV dans une pile DRAM sensible à la température. S'y ajoute un défi d'alimentation lié à la chute IR. d-Matrix affirme qu'une pile 1-Hi avec logique au-dessus, à pas plus de 0,5 W/mm2, peut être refroidie par liquide et maintenir la DRAM sous 100 C.

L'entreprise place le DRAM 3D entre les deux extrêmes sur une échelle énergétique. La SRAM sur puce coûte environ 50 fJ, tandis que les systèmes 2.5D HBM4 se situent dans la plage de 2,5 à 5 pJ lorsque l'énergie au niveau de la puce est incluse. L'IO vertical 3D se situe autour de 0,3 à 0,4 pJ, environ 10 fois moins que le HBM, car c'est un chemin sans PHY à l'échelle millimétrique plutôt qu'une route d'interposeur à l'échelle centimétrique. Moins de couches empilées que le HBM signifie aussi une puce plus grande et un meilleur rendement.

Le décodage est ce qui prend le temps

Le prefill traite de nombreux tokens de prompt en parallèle et bute sur le débit de calcul, tandis que le décodage produit un token à la fois et bute généralement sur la bande passante mémoire. L'attention peut basculer vers le calcul avec un GQA élevé et le décodage spéculatif, et le MoE reste limité par la mémoire même à des tailles de batch modestes. Le décodage est la phase qui réclame une bande passante énorme.

Comme le décodage domine le temps d'exécution réel, la partie limitée par la mémoire compte le plus. d-Matrix souligne que la majeure partie du temps d'inférence se passe dans la phase de décodage, donc améliorer la bande passante de décodage améliore la performance globale d'inférence. À 32GB par carte, avec des poids en 4 bits et un KV cache en 8 bits, d-Matrix dimensionne pour tenir dans une seule baie. Une montée en échelle de 72 cartes peut héberger un modèle de frontière tel que Kimi K3 à 1M de contexte, et la désagrégation et le multi-baie vont au-delà d'une seule baie Raptor.

L'implémentation elle-même s'appelle Raptor. Une puce logique TSMC N4 repose au-dessus d'une puce DRAM 3D via un empilement face-à-face de 36 um, un procédé que d-Matrix décrit comme éprouvé, peu coûteux, à gros volume et à haut rendement. Chaque moteur tensoriel a besoin d'un flit de 128B par accès, et avec 32B livrés par accès de colonne depuis des bancs de 32B, cela revient à avoir besoin de 4 bancs par canal. La puce compte 840 bancs, 768 après 72 de réserve, répartis sur 256 canaux pour seulement 3 bancs par canal. Avec 3 bancs par canal, un seul accès renvoie 96B, donc livrer un flit de 128B prend deux accès et récupère 192B, gaspillant environ 33 pour cent de la bande passante près de 33 TB/s.

Le blocage de flux récupère ce gaspillage. d-Matrix partage un accès partiel de 32B entre trois flits, donc 4 accès à 96B alimentent 3 flits à 128B, avec 384B entrants pour 384B sortants. Le sur-appel tombe à zéro et aucun réseau de décalage n'est nécessaire. Déplacer 100 TB/s à 0,37 pJ/bit revient à 296 W rien que pour l'IO, et le DBI classique pourrait économiser 20 pour cent. Le basculement de flux apporte ces 20 pour cent sans broche supplémentaire, en comparant chaque flit au précédent et en inversant si besoin, avec un seul bit de métadonnée par flit porté à côté de l'ECC.

Le Maia 200 de Microsoft prend l'autre voie

Microsoft a profité de Hot Chips 2026 pour détailler son accélérateur Maia 200 de deuxième génération, que ServeTheHome a couvert le 26 août. La puce 3nm compte 140 milliards de transistors, six piles de HBM3e, 7TB/s de bande passante HBM et un TDP de 750 Watt, avec 10 000 TFLOPS de performance FP4 sur une puce SoC de 820mm2. Elle utilise une architecture de flux de données Software Defined Local Access, où le flux de données est fixé à la compilation et l'accès aux données reste dans les éléments de calcul. Il n'y a pas de réseau de montée en échelle : la diapositive de Microsoft montre 128 baies et 6 000 puces dans un domaine de montée en échelle sur Ethernet unifié.

Deux paris différents, une contrainte partagée. Que le remède soit d'empiler la DRAM sous la logique ou d'associer le HBM à un flux de données défini par logiciel, les deux designs sont façonnés par le coût de déplacement des bits vers et depuis la mémoire.

Commentaires 0

Sources

2
  1. 01d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  2. 02Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.