DeepSeek V4.1 Flash : 552 milliards de paramètres et un encodeur-décodeur asymétrique
Le 10 septembre 2026, DeepSeek a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal de 552 milliards de paramètres. Il active 8 milliards de paramètres par token en entrée et 16 milliards en sortie. L'architecture change, pas seulement l'échelle.

Le 10 septembre 2026, DeepSeek a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal de 552 milliards de paramètres de base, avec un contexte allant jusqu'à un million de tokens. Ce n'est pas une mise à jour de routine. L'architecture change, et la façon de compter le cache d'attention aussi. D'après la fiche du modèle, V4.1-Flash n'active que 8 milliards de paramètres par token pendant le prétraitement du prompt (prefill) et 16 milliards pendant la génération de la réponse (decode).
Des coûts répartis inégalement, volontairement
Le cœur de la construction est l'architecture Causal Encoder-Decoder (CED) : un Transformer de 40 couches, divisé en un encodeur causal de 20 couches et un décodeur de 20 couches. Dans les modèles classiques, chaque couche du décodeur calcule son propre état caché. Ici, le KV cache global du décodeur est projeté à partir des états cachés finaux de l'encodeur. L'asymétrie entre 8 et 16 milliards est intentionnelle. Les charges de travail agentiques consistent surtout à lire de longs contextes, et le fabricant a donc optimisé l'entrée en priorité.
La couche MoE compte 1 expert partagé et 384 experts routés, dont 6 sont choisis par token. S'y ajoutent les composants cités dans la fiche du modèle : Single-Pass mHC (mélange modifié du flux résiduel avec le kernel Mega-mHC), Engram, une mémoire conditionnelle de 196 milliards de paramètres rarement interrogée via une recherche par tokens, et DSpark, un décodage spéculatif avec génération de brouillon semi-autorégressive et vérification pilotée par un calendrier de confiance.
45 000 milliards de tokens et la vision dès le départ
Le modèle a été entraîné de zéro sur un corpus multimodal de 45 000 milliards de tokens. L'attention clairsemée a été apprise avec une longueur de séquence de 64 000 tokens. Le contexte n'a été étendu à 1 million de tokens qu'à l'étape des 34 000 milliards de tokens, donc après l'essentiel de l'entraînement. Après le pré-entraînement, la recette standard a été appliquée : SFT, puis apprentissage par renforcement, et enfin distillation on-policy. Le fabricant souligne que les changements ne portaient pas sur les algorithmes mais sur les données. Des tâches et des environnements agentiques ont été synthétisés automatiquement à grande échelle.
L'entrée image est prise en charge par l'encodeur DeepSeek-ViT, entraîné de zéro avec 2D-RoPE et un downsampling 3×3 pixel-unshuffle, plus un projecteur MLP à deux couches. Images et texte arrivent dans un espace commun dès le début du pré-entraînement. Ce n'est pas un adaptateur ajouté après coup.
La fiche du modèle sur Hugging Face note 621 396 téléchargements le mois dernier et une licence MIT. Des variantes de déploiement ont été préparées pour vLLM, SGLang, TensorRT et Docker Model Runner, ainsi que des quantifications FP8, BF16, GPTQ, AWG et GGUF. Le portail chinois IT之家 attire l'attention sur le même point que la fiche : dans les scénarios agentiques, ce sont les accès au cache qui génèrent la majeure partie de la facture. Une compression plus forte du KV cache se traduit donc directement par le coût de la tâche. DeepSeek a aussi annoncé le retrait des anciens deepseek-v4-flash et deepseek-v4-flash-vision-exp, et la redirection des requêtes vers V4-Pro vers V4.1-Flash à ses tarifs.
Sources
3- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.