Accélérateurs pour datacenters IA : cœurs RISC-V, pénurie de T-glass et DRAM 3D
Les accélérateurs IA évoluent sur trois fronts en même temps : qui licencie les briques de base, qui obtient les matériaux d'assemblage, et comment la mémoire s'empile sous le calcul. The Register rapportait le 19 septembre 2024 que SiFive propose désormais ses propres plans d'accélérateur, et plus seulement des cœurs de CPU RISC-V.

SiFive concevait depuis longtemps des cœurs de CPU RISC-V que d'autres entreprises greffent sur leurs puces IA. Cette semaine, la société a annoncé qu'elle allait licencier un accélérateur d'apprentissage automatique complet. La série Intelligence XM réunit quatre cœurs de CPU RISC-V SiFive Intelligence X reliés à un moteur de calcul matriciel maison, rapporte The Register.
John Ronco, SVP et GM de SiFive pour le Royaume-Uni, a déclaré à The Register que certains clients veulent toujours construire leur propre matériel, mais que d'autres « voulaient davantage une offre clé en main de la part de SiFive ». Jusqu'ici, l'entreprise plaçait ses cœurs de CPU à côté de moteurs matriciels tiers, comme dans les tensor processing units de Google. Les clusters XM inversent la logique : SiFive fournit désormais toute la conception de l'accélérateur, que le client personnalise et envoie en fonderie.
Ce que livre réellement un cluster
Chaque cluster XM de base prend en charge jusqu'à 1 To/s de bande passante mémoire via une interface de hub cohérente. SiFive compte atteindre jusqu'à 16 TOPS en INT8 ou 8 téraFLOPS en BF16 par gigahertz.
Les chiffres par gigahertz peuvent tromper, car il ne s'agit pas d'une puce finie. La performance finale dépend du nombre de clusters placés par le client, de leur câblage, des autres éléments présents sur le die, et du budget de puissance et de refroidissement. Ronco s'attend à ce que la plupart des conceptions utilisent entre quatre et huit clusters. À une fréquence de 1 GHz, cela donne entre 4 et 8 To/s de bande passante mémoire en pointe et jusqu'à 32 à 64 téraFLOPS en BF16. Une Nvidia H100 produit près d'un pétaFLOPS de BF16 dense, ce qui flatte Nvidia. Mais les FLOPS ne font pas tout pour les charges limitées par la bande passante, comme l'inférence. Ronco a indiqué que les clusters XM ne serviront probablement pas beaucoup à l'entraînement des IA.
L'échelle reste la question ouverte. Ronco s'est montré hésitant sur l'ampleur possible de la conception, et The Register notait que la technologie de gravure et la surface du die fixeront les limites. La présentation produit de l'entreprise suggère que 512 clusters XM sont possibles. À 1 GHz sans problème thermique ni de puissance, cela représenterait environ quatre pétaFLOPS de calcul matriciel BF16. Les GPU Blackwell de Nvidia dans leur configuration la plus haute sont annoncés à 2,5 pétaFLOPS en BF16.
SiFive a aussi indiqué qu'il publierait une implémentation de référence open source de sa SiFive Kernel Library afin de réduire les barrières d'adoption du RISC-V. Son PDG, Patrick Little, a affirmé dans un communiqué préparé que l'entreprise fournit des conceptions de puces à base de RISC-V à cinq des entreprises du « Magnificent 7 », un groupe qui comprend Microsoft, Apple, Nvidia, Alphabet, Amazon, Meta et Tesla. The Register notait qu'il soupçonne que tout ce silicium ne concerne pas l'IA.
Le goulot d'étranglement de l'assemblage que personne ne regarde
Les conceptions, c'est une chose. Les matériaux en sont une autre. Une entreprise japonaise nommée Nittobo contrôle environ 90 % de l'offre mondiale d'un tissu de fibre de verre spécialisé appelé T-glass, présent dans chaque boîtier de puce IA avancée, selon Tom's Hardware. Le T-glass est un tissu de verre à faible CTE utilisé dans le cœur organique des substrats de CI, la couche d'interconnexion entre une puce et sa carte de circuit imprimé. Il maintient la stabilité dimensionnelle des grands boîtiers de puces chauds à mesure qu'ils gagnent en densité.
La demande a dépassé l'offre. Nittobo triple la capacité de son usine de Fukushima, mais la nouvelle production n'arrivera sur le marché qu'à la mi-2027. Les prix ont déjà augmenté de 20 % à 30 %, et les délais pour les matériaux en aval, comme les laminés cuivrés, sont passés d'une normale de 8 à 10 semaines à plus de 20. « Avec une offre de T-glass encore plus contrainte aujourd'hui, les fournisseurs ne communiquent plus de délais », a déclaré Bill Ho, analyste chez Yuanta, à Tom's Hardware.
Remplacer le T-glass n'est pas simple. Bilal Hachemi, analyste chez Yole Group qui suit la chaîne d'approvisionnement des substrats de CI, a déclaré que le matériau « possède des valeurs diélectriques et de CTE spécifiques qui conviennent mieux aux puces IA, en particulier pour le cœur organique ». L'industrie des substrats fonctionne sur des marges faibles, si bien que même de modestes pics de demande peuvent déclencher des pénuries. « Toute hausse de la demande de matériaux de build-up, de matériau ABF ou de T-glass peut provoquer une pénurie potentielle, car cela va à l'encontre des bases de cette industrie », a déclaré Hachemi.
Les hyperscalers aggravent la situation en commandant des boîtiers toujours plus grands. Selon des données Nvidia citées par Tom's Hardware, les tailles d'interposeur sont passées de 814 mm2 pour Hopper à 1 700 mm2 pour Blackwell, soit une hausse de 109 %, les générations Rubin et Feynman grimpant encore. Bank of America estime que le segment des matériaux électroniques de Nittobo va presque doubler son chiffre d'affaires, de 40,9 milliards de yens, environ 266 millions de dollars, en 2025 à 87,7 milliards de yens d'ici mars 2028, avec des marges opérationnelles proches de 48 %.
Nittobo double la capacité de fil brut de son usine taïwanaise, importe du fil vers le Japon pour la fabrication du tissu, et externalise une partie du tissage chez Nanya Plastics, l'un de ses principaux concurrents. D'ici 2027, environ 20 % du tissu de verre de Nittobo devrait être tissé par Nanya, a divulgué l'entreprise. Hachemi a déclaré que le fait que Nvidia contacte directement un fournisseur de matériaux en amont comme Nittobo est sans précédent. Il a averti qu'une fois que Nvidia aura verrouillé sa part, les acheteurs de puces rivaux se disputeront ce qui reste.
DRAM 3D et le mur de la mémoire
La mémoire est le troisième front. À Hot Chips 2026, d-Matrix a présenté son accélérateur Raptor, qui empile directement le calcul au-dessus de puces DRAM, selon ServeTheHome. Les poids des modèles ne cessent de croître et le cache KV évolue avec la longueur de contexte multipliée par la taille du lot. L'exemple de ServeTheHome : 64 utilisateurs à 1 M de contexte peuvent représenter environ 935 Go de cache KV. C'est à la fois un problème de capacité et de bande passante.
La SRAM atteint la cible de bande passante, mais seulement à très petite échelle. Une paire de cartes accélératrices SRAM Corsair atteint environ 300 To/s pour environ 1 nanoseconde de latence, mais ne contient qu'environ 4 Go. La HBM résout la capacité mais peine sur la bande passante, avec un plafond pratique autour de 20 To/s pour les boîtiers HBM4 comme les Nvidia Vera Rubin et AMD Instinct MI455, selon d-Matrix. La DRAM 3D empilée se situe entre les deux : l'IO vertical 3D coûte environ 0,3 à 0,4 pJ, soit environ 10 fois moins que la HBM, car c'est un chemin millimétrique sans PHY plutôt qu'une route d'interposeur centimétrique.
Raptor place un die logique TSMC N4 au-dessus d'un die DRAM 3D en utilisant un empilement face à face de 36 microns, un procédé que d-Matrix décrit comme éprouvé, peu coûteux, à fort volume et à haut rendement. Chaque carte contient 32 Go, et d-Matrix affirme qu'une montée en échelle de 72 cartes peut héberger un modèle de frontière comme Kimi K3 à 1 M de contexte avec des poids en 4 bits et un cache KV en 8 bits.
L'ingénierie n'est pas terminée. d-Matrix indique qu'un empilement 1-Hi logique au-dessus, à pas plus de 0,5 W/mm2, peut être refroidi par liquide et maintenir la DRAM sous 100 °C. Son die compte 840 bancs, 768 après 72 de réserve, répartis sur 256 canaux, ce qui donne 3 bancs par canal. Un flit de 128 B ne se divise pas également sur cet ensemble, si bien qu'un accès unique renvoie 96 B et que deux accès récupèrent 192 B, gaspillant environ 33 % de la bande passante près de 33 To/s. Son schéma de blocage de flux partage un accès partiel de 32 B entre trois flits, ramenant la surlecture à zéro.
Reste la puissance d'IO. Déplacer 100 To/s à 0,37 pJ/bit représente 296 W rien que pour l'IO, et le DBI classique pourrait économiser 20 %. La HBM s'en sort avec le DBI parce que ses rafales multi-cycles permettent au PHY de voir la rafale complète. La liaison 3D-DRAM 256 bits mono-cycle de d-Matrix n'a ni rafale ni broche de bande latérale pour signaler le choix d'inversion, elle utilise donc le retournement de flux, en comparant chaque flit au précédent et en inversant au besoin.
Rien de tout cela n'arrive tout seul. Les plans d'accélérateur RISC-V, un quasi-monopole sur un tissu d'assemblage et la DRAM empilée doivent tous s'aligner avant que la prochaine génération de silicium pour datacenters soit livrée.
Sources
3- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 03D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.