Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Accélérateurs IA : le goulot du packaging que personne ne facture, et les start-up qui parient contre le HBM

Une entreprise japonaise dont la plupart des exploitants de centres de données n'ont jamais entendu parler contrôle environ 90 % de l'approvisionnement mondial d'un tissu de verre présent dans chaque boîtier de puce IA avancée. Sa prochaine ligne de production n'arrivera pas avant la mi-2027.

TechnologieAnalyseCamille RousseauPublié le: 27 septembre 20265 min de lectureSources 5
Accélérateurs IA : le goulot du packaging que personne ne facture, et les start-up qui parient contre le HBM

Le T-glass de Nittobo est un tissu de verre à faible CTE utilisé dans le cœur organique des substrats de CI, la couche d'interconnexion entre une puce et sa carte de circuit imprimé. Selon Tom's Hardware, l'entreprise détient environ 90 % de l'approvisionnement mondial. La demande l'a tellement dépassée que les délais en aval pour les laminés cuivrés sont passés de 8 à 10 semaines à plus de 20. Les prix ont augmenté de 20 à 30 %.

Ce chiffre compte plus qu'il n'y paraît. Chaque génération d'accélérateur IA embarque un interposeur plus grand et un substrat plus complexe, si bien que chaque puce consomme davantage de matière. Les données de Nvidia, citées par Tom's Hardware, situent la taille des interposeurs à 814 mm² pour Hopper et 1 700 mm² pour Blackwell, soit une hausse de 109 %, Rubin et Feynman devant monter encore. L'offre ne peut pas répondre rapidement. Le T-glass exige des fours à fusion électrique fonctionnant entre 1 600 et 1 700 °C, et Nittobo triple la capacité de son usine de Fukushima, la nouvelle production n'atteignant le marché qu'à la mi-2027.

Les analystes cités dans ce rapport décrivent un marché où la substitution est difficile. « Il n'est pas facile de remplacer le T-glass », a déclaré Bilal Hachemi du Yole Group à Tom's Hardware, en pointant des valeurs diélectriques et de CTE précises qui conviennent aux puces IA, en particulier le cœur organique. L'analyste de Yuanta Bill Ho a indiqué que les fournisseurs avaient cessé de communiquer des délais. Takashi Enomoto de Bank of America s'attend à ce que les ventes de matériaux électroniques de Nittobo fassent presque le double, passant de 40,9 milliards de ¥ (266 millions de $) en 2025 à 87,7 milliards de ¥ d'ici mars 2028, avec des marges opérationnelles proches de 48 %.

Un détail ressort. Hachemi a déclaré que le fait que Nvidia s'adresse directement à un fournisseur de matériaux en amont était sans précédent dans cette partie de la chaîne. Si le plus gros acheteur verrouille la capacité en premier, tous les autres négocient sur ce qui reste.

La bande passante mémoire est l'autre mur

Pendant que le packaging se resserre, les concepteurs d'accélérateurs se disputent sur la mémoire. À Hot Chips 2026, d-Matrix a présenté Raptor, un accélérateur qui empile une puce logique TSMC N4 sur une puce de DRAM 3D par empilement face à face de 36 microns, selon ServeTheHome. L'argument est que ni la SRAM ni le HBM ne convient seul à l'inférence : la SRAM offre de la bande passante mais peu de capacité, et le HBM offre de la capacité mais se heurte à la vitesse des broches, au nombre d'empilements et à la surface disponible du boîtier. d-Matrix cite un plafond pratique autour de 20 TB/s pour les boîtiers HBM4.

La bande passante a une facture énergétique. L'article de ServeTheHome situe le HBM à 2,4 pJ/bit, ce qui signifie que 100 TB/s coûtent environ 1,92 kW avant le trafic de fabric. L'IO 3D vertical se situe autour de 0,3 à 0,4 pJ, soit environ dix fois moins, parce qu'il s'agit d'un trajet à l'échelle du millimètre et non d'une route d'interposeur à l'échelle du centimètre.

Les chiffres de d-Matrix sont précis et sans éclat. Chaque moteur tensoriel a besoin d'un flit de 128B par accès, mais des bancs de 32B sur 256 canaux donnent 3 bancs par canal après les redondances, soit 96B par accès. Deux accès prélèvent 192B pour livrer 128B, gaspillant environ 33 % de la bande passante près de 33 TB/s. La solution de l'entreprise, le stream blocking, partage un accès partiel entre trois flits, si bien que 384B entrant correspondent à 384B sortant, la surlecture tombant à zéro. À 32GB par carte avec des poids en 4 bits et un cache KV en 8 bits, d-Matrix affirme qu'une grappe de 72 cartes peut héberger un modèle de frontière à 1M de contexte.

Les chiplets et le virage des licences RISC-V

Les contraintes de packaging et les compromis mémoire poussent les fournisseurs vers différentes stratégies d'intégration. Rebellions a montré son REBEL-Quad à Hot Chips 2025 : quatre ASIC de calcul, quatre sites HBM3E pour 144GB, et UCIe-A comme interconnexion puce à puce, construit sur Samsung SF4X et CoWoS-S, selon ServeTheHome. La carte fonctionne en double PCIe Gen5 x16, et l'entreprise a fait la démonstration de Llama 3.3 70B sur une carte de développement à une moyenne de 35,5 msec par token de sortie.

ServeTheHome a noté que le choix du PCIe cadre mal avec l'orientation de Nvidia vers le Gen6, mais a considéré la démo en direct comme le fait le plus significatif : une puce fonctionnelle basée sur UCIe en public, ce qui est assez rare pour être signalé. Côté calcul, SiFive est passé de la licence de cœurs CPU RISC-V intégrés dans le silicium IA d'autres entreprises à la vente de son propre design d'accélérateur. The Register a rapporté le 19 septembre 2024 que les grappes Intelligence XM de SiFive associent quatre cœurs CPU Intelligence X à un moteur de calcul matriciel maison, avec jusqu'à 1TB/sec de bande passante mémoire par grappe et jusqu'à 16 TOPS d'INT8 ou 8 teraFLOPS de BF16 par gigahertz.

John Ronco, SVP et GM de SiFive pour le Royaume-Uni, a déclaré à The Register que certains clients veulent encore leur propre matériel, mais que d'autres préféraient une offre clé en main. Il s'attendait à ce que la plupart des puces construites sur ce design utilisent quatre à huit grappes, et se montrait hésitant sur la portée de la mise à l'échelle, bien que la présentation de l'entreprise suggère que 512 grappes sont possibles. Pour situer, les meilleures puces Blackwell de Nvidia sont annoncées à 2,5 petaFLOPS de BF16.

SiFive fournit déjà des designs RISC-V utilisés dans les unités de traitement tensoriel de Google et dans le Blackhole de Tenstorrent, et le PDG Patrick Little a affirmé dans une déclaration préparée que l'entreprise approvisionne cinq des firmes du « Magnificent 7 », une affirmation que The Register a signalée comme probablement pas toutes liées à l'IA.

Les sanctions continuent de redessiner la carte

La chaîne d'approvisionnement est aussi redessinée par les contrôles à l'exportation. The Register a rapporté le 28 octobre 2024 que TSMC aurait coupé les ponts avec le concepteur chinois Sophgo en raison de soupçons selon lesquels il tentait de fournir des composants à Huawei. Reuters, citant deux personnes proches du dossier, a identifié le client qui avait commandé une puce ressemblant à l'Ascend 910B de Huawei. Sophgo a nié toute relation d'affaires directe ou indirecte avec Huawei et a déclaré avoir soumis un rapport d'enquête détaillé à TSMC. Bitmain, associé à Sophgo, a qualifié les allégations de fausses et sans fondement.

The Register a noté que le passé de Bitmain n'est pas irréprochable : en 2021, des procureurs ont perquisitionné ses bureaux taïwanais et accusé deux affiliés d'avoir tenté de recruter illégalement des ingénieurs taïwanais. TSMC a cessé ses activités avec Huawei en 2020 en vertu des règles américaines.

L'Ascend 910B de Huawei est annoncé à 320 teraFLOPS de FP16 ou 640 teraFLOPS d'Int8, à peu près au niveau de l'A100 de Nvidia, vieux de quatre ans, selon ce rapport. Plus lent que la frontière actuelle, mais disponible, ce qui est l'essentiel quand les plafonds à l'exportation ne cessent de se resserrer.

Commentaires 0

Sources

5
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  4. 04SiFive expands from RISC-V cores for AI chips to designing its own full-fat acceleratorEN
  5. 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.