Comment fonctionnent vraiment les accélérateurs d'IA : cœurs, briques de clusters et mémoire
SiFive propose désormais sous licence un cluster d'accélérateur d'IA prêt à l'emploi, bâti autour de quatre cœurs CPU RISC-V et de son propre moteur de calcul matriciel, rapporte The Register le 19 septembre 2024.

SiFive conçoit depuis des années des cœurs CPU RISC-V pour les puces d'IA d'autres entreprises. La société commercialise maintenant une conception complète d'accélérateur. Chaque cluster Intelligence XM associe quatre de ses cœurs CPU RISC-V de la série X à un moteur de calcul matriciel maison, selon The Register.
C'est un changement. Les unités de traitement tensoriel de Google utilisent déjà des cœurs X280 de SiFive pour alimenter leurs unités de multiplication matricielle. John Ronco, de SiFive UK, a déclaré à The Register que les conceptions de la société équipent aussi les cœurs CPU de l'accélérateur Blackhole de Tenstorrent. La différence, cette fois, est que SiFive apporte son propre moteur matriciel au lieu de rattacher ses cœurs à celui d'un tiers.
Ce que disent les chiffres, et ce qu'ils ne disent pas
Chaque cluster prend en charge jusqu'à 1TB/sec de bande passante mémoire via une interface de hub cohérente. Il devrait fournir jusqu'à 16 TOPS en INT8 ou 8 teraFLOPS en BF16 par gigahertz. Ce cadrage par gigahertz compte parce qu'un cluster n'est pas une puce. La performance dépend du nombre de clusters qu'un client place sur le die, de leur câblage, de ce qui les entoure et de la fréquence finale de la puce.
Ronco s'attend à ce que la plupart des conceptions utilisent quatre à huit clusters. À 1GHz, cela donnerait 4 à 8TB/sec de bande passante mémoire en pointe et 32 à 64 teraFLOPS en BF16. Les diapositives produit de SiFive suggèrent que 512 clusters sont possibles. À 1GHz, cela représenterait environ quatre pétaFLOPS en BF16, au-dessus des 2,5 pétaFLOPS que Nvidia annonce pour ses GPU Blackwell haut de gamme. Une Nvidia H100, en comparaison, délivre près d'un pétaFLOPS en BF16 dense.
Le hic, c'est la physique. Tenir 1GHz sur 512 clusters sans buter sur les limites thermiques ou de puissance reste la question ouverte. Ronco s'est montré hésitant à dire jusqu'où la conception monte en échelle. Il s'attend aussi à ce que les clusters ne servent pas largement à l'entraînement des modèles d'IA. SiFive indique qu'elle publiera une implémentation de référence open source de sa SiFive Kernel Library.
La bande passante mémoire, goulot d'étranglement récurrent
Si les accélérateurs sont construits ainsi, c'est que l'inférence, en particulier la phase de décodage, est limitée par la mémoire. d-Matrix, lors de sa présentation à Hot Chips 2026, a posé le problème sans détour : 64 utilisateurs à 1M de contexte peuvent représenter environ 935GB de KV cache. Sa conception Raptor empile un die logique TSMC N4 sur de la DRAM 3D, avec un empilement face à face de 36 micromètres à 32GB par carte, et une baie de 72 cartes dimensionnée pour les modèles de frontière.
Rebellions a montré une autre approche à Hot Chips 2025. Son REBEL-Quad réunit quatre ASIC de calcul et quatre sites HBM3E pour 144GB de mémoire sur un package Samsung SF4X et CoWoS-S, avec UCIe-A comme interconnexion de chiplets. ServeTheHome l'a vu tourner sur Llama 3.3 70B sur une carte de développement à 35,5 millisecondes en moyenne par token de sortie.
Fournisseurs, packaging et pression en amont
Rien de tout cela ne part sans matériaux de packaging. Tom's Hardware rapportait en mars 2026 que Nittobo contrôle environ 90% de l'offre mondiale de T-glass, le tissu de verre à faible CTE utilisé dans les cœurs de substrats IC. Les prix ont grimpé de 20 à 30%, et les délais des laminés cuivrés dépassaient 20 semaines, contre 8 à 10 en temps normal. Nittobo triple la capacité de son usine de Fukushima, mais la nouvelle offre n'atteindra pas le marché avant mi-2027. Bank of America estime que le segment des matériaux électroniques verra ses ventes presque doubler, de 40,9 milliards de yens en 2025 à 87,7 milliards de yens d'ici mars 2028.
La couche politique est tout aussi emmêlée. TSMC aurait coupé les ponts avec le concepteur chinois Sophgo en octobre 2024, après qu'un client a commandé une puce ressemblant à l'Ascend 910B de Huawei. Sophgo a nié toute relation avec Huawei et affirmé avoir soumis un rapport d'enquête à TSMC.
Sources
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.