DeepSeek V4.1 Flash : 552 milliards de paramètres, multimodal natif et prix en baisse
DeepSeek a lancé V4.1 Flash le 10 septembre 2026. Ce modèle MoE de 552 milliards de paramètres n'en active que 8 milliards en entrée, et ses besoins en HBM pour le KV Cache sont quatre fois plus faibles que ceux de la génération précédente.

DeepSeek a lancé le modèle V4.1 Flash le 10 septembre 2026. La société le présente comme le plus petit format de sa nouvelle série d'architectures, avec une compréhension visuelle multimodale native. Le modèle est déjà disponible dans l'API DeepSeek : il suffit de remplacer le nom du modèle par deepseek-flash.
V4.1 Flash est un modèle MoE de 552 milliards de paramètres, bâti sur une architecture Causal-Encoder-Decoder inédite. Entrée et sortie ne sont pas symétriques : la phase d'entrée n'active que 8 milliards de paramètres, celle de sortie 16 milliards. DeepSeek explique que cette structure vise un plafond de capacités plus élevé, une inférence plus rapide et un débit supérieur. Elle doit aussi permettre de passer à des modèles de taille plus grande.
Le cache est l'autre point central de cette mise à jour. Par rapport à la génération précédente, le KV Cache de V4.1 Flash divise par quatre les besoins en HBM et par huit ceux en SSD. DeepSeek indique que dans les scénarios d'usage d'Agent, le coût des hits de cache pèse souvent lourd. Compresser le KV Cache fait donc baisser nettement le coût de ces tâches. La société donne aussi une courbe de long terme : par rapport au premier modèle, le KV Cache a été réduit de 437 fois.
Les prix changent aussi. En heures creuses, l'entrée avec hit de cache coûte 0,02 yuan par million de tokens, l'entrée sans hit 1 yuan par million de tokens, la sortie 4 yuan par million de tokens. En heures pleines, les tarifs doublent. Les nouveaux prix s'appliquent à partir du 10 septembre 2026 à 12 h.
Côté open source, les poids du modèle sont publiés sous licence MIT. DeepSeek dit vouloir soutenir pleinement la communauté open source pour l'adaptation de l'inférence et élargir par tous les moyens le périmètre de déploiement. Les équipes qui ont des besoins de déploiement à grande échelle et les ressources correspondantes peuvent contacter l'équipe.
Le sort des anciennes versions est aussi précisé. V4 Flash et V4 Flash Vision Exp sont retirés. Pour la compatibilité, les noms deepseek-v4-flash et deepseek-v4-flash-vision-exp sont temporairement routés vers V4.1 Flash. DeepSeek prévoit également de retirer progressivement V4 Pro : après un certain délai, les requêtes concernées seront toutes routées vers V4.1 Flash et facturées au tarif unitaire de V4.1 Flash. Les partenaires WorkBuddy (avec CodeBuddy) et OpenCode sont déjà intégrés à pleine échelle.
Pour le déploiement et l'écosystème, V4.1 Flash prend en charge les principaux frameworks d'inférence vLLM, SGLang et TensorRT. Il propose les formats de quantification FP8, BF16, GPTQ, AWG et GGUF, avec une longueur de contexte allant jusqu'à 1 million de tokens. Les équipes peuvent donc brancher le nouveau modèle sur leur pile d'inférence existante à faible coût de modification.
Sources
3- 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.