Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Inférence : un moteur chinois fait bondir le débit de DeepSeek V4.1 Flash de 6,87 fois sur GPU PCIe

Sur huit cartes PCIe sans interconnexion haut débit, le moteur Meta-Infer de METASTONE est passé de 1 932 à 13 274 jetons par seconde en optimisant les kernels et la communication par le logiciel, sans toucher au modèle.

TechnologieAnalyseSophie LeclercPublié le: 24 septembre 20266 min de lectureSources 2
Inférence : un moteur chinois fait bondir le débit de DeepSeek V4.1 Flash de 6,87 fois sur GPU PCIe

Le débat sur les puces d'IA se déplace. La question n'est plus seulement de savoir qui peut acheter le matériel le plus performant, mais qui sait exploiter au mieux le matériel déjà là. C'est la thèse de la société chinoise METASTONE, rapportée par 量子位 (QbitAI), à travers son moteur d'inférence Meta-Infer.

La faille entre le framework et le matériel

Beaucoup de cartes graphiques savent charger un modèle, télécharger les poids et lancer un service. Elles fonctionnent. Mais leurs performances réelles en test de charge restent souvent très inférieures aux niveaux annoncés. Le modèle n'a pas de défaut et le matériel n'est pas en panne. La perte vient de l'écart entre le framework et le matériel. Ces cartes n'ont pas d'interconnexion haut débit entre elles et ne figurent pas dans les matrices de validation officielles des frameworks ouverts. Résultat : des opérateurs retombent silencieusement sur des implémentations génériques peu efficaces, les paramètres de communication restent calibrés pour d'autres architectures, et la configuration mémoire ou de parallélisme reprend des valeurs par défaut prévues pour un autre matériel.

Six virgule huit sept fois plus de débit

Meta-Infer s'attaque à ce problème par le logiciel seul, sans modifier la structure du modèle ni la sémantique des tâches. L'approche se décline en quatre volets : complétion des kernels, optimisation des opérateurs et refonte de la communication, réglage du parallélisme et de la capacité mémoire, enfin réutilisation du cache.

Le premier volet corrige des métadonnées et des tailles de page qui empêchent l'exécution des opérateurs optimisés natifs, remplace des kernels anciens inadaptés et élargit le seuil des chemins de communication rapides. Sur un environnement de huit cartes PCIe, avec la version communautaire de référence pour DeepSeek-V4.1-Flash, le débit d'entrée n'était que de 1 932 jetons par seconde. Après cette phase de correction, il monte à 5 850 jetons par seconde.

Le second volet s'attaque aux goulots d'étranglement. Sur une architecture PCIe, la bande passante entre cartes est bien inférieure à celle d'une interconnexion dédiée, et appliquer les stratégies par défaut fait passer le temps en attentes de communication. En fusionnant les opérateurs, en recouvrant le calcul par la communication et en réécrivant la logique de communication collective, le moteur atteint 13 274 jetons par seconde, soit un facteur de 6,87, avec un support de contexte très long.

La méthodologie se veut générique. Sur un autre modèle, le débit d'entrée passe de 14 546 à 22 584 jetons par seconde. Dès la seule phase de co-adaptation, plusieurs modèles gagnent entre 20 % et 33 % de débit.

Un opérateur tiers

METASTONE se présente comme un opérateur de calcul de bout en bout indépendant, non lié à un fournisseur de modèles. La société indique gérer plus de 20 000 petaflops de ressources, exploiter une dizaine de centres de calcul intelligents et deux centres nationaux de supercalcul, avec un engagement de disponibilité supérieur à 99,95 %. Son équipe revendique trois prix Gordon Bell.

Quand le matériel est contraint, l'optimisation logicielle devient le principal levier de performance.

Commentaires 0

Sources

2
  1. 01量子位 (QbitAI) : PCIe 显卡被低估了 — DeepSeek 推理吞吐翻近 7 倍ZH
  2. 02量子位 (QbitAI) : page d'accueil de la rédactionZH

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.