IA

DeepSeek V4.1 Flash : 552 milliards de paramètres, 8 milliards actifs, cache 60 % moins cher — et il égale Opus 5 en programmation

Adrian Kessler

DeepSeek V4.1 Flash fonctionne sur une nouvelle architecture que l’entreprise appelle Causal Encoder-Decoder. Ses 552 milliards de paramètres couvrent un encodeur à 20 couches et un décodeur à 20 couches, mais seulement 8 milliards s’activent sur les tokens d’entrée et 16 milliards sur les tokens de sortie. Cela le rend structurellement plus léger que les modèles qui activent des tranches de paramètres plus grandes pour chaque opération — un choix de conception qui se traduit directement par une réduction des coûts d’inférence et une meilleure efficacité mémoire.

Les gains mémoire sont précis. Le cache KV de V4.1 Flash se situe à 890 octets par token, soit environ un quart de celui du V4-Flash. La mise en cache FP4 et Compressed Sparse Attention 2 réduisent l’empreinte du cache persistant à un huitième de la génération précédente. L’entrée en cache coûte désormais 0,003 $ par million de tokens en heures creuses — une baisse de 60 % par rapport au V4-Flash. L’entrée non mise en cache a baissé de 33 %, la sortie de 11 %.

Sur les benchmarks que les développeurs suivent le plus, le modèle tient sa place. DeepSWE v1.1 — le test autonome de génie logiciel — lui donne 74,2, légèrement devant l’Opus 5 d’Anthropic avec 74,0 et au-dessus du GPT-5.6 Sol avec 73,0. GPQA Diamond obtient 90,9. L’écart qui se démarque est Terminal-Bench 3.0 : 30,0 contre 43,3 pour Opus 5, une différence réelle sur des tâches nécessitant un débogage interactif prolongé.

La vision est intégrée dès le pré-entraînement. Auparavant, V4 séparait la vision en une variante distincte Vision-Exp. V4.1 Flash remplace les deux par un modèle unique construit autour de DeepSeek-ViT, un encodeur spécialement entraîné, co-développé avec le modèle de langage depuis le début. Le palier multimodal a disparu — chaque appel bénéficie par défaut de la vision.

La fenêtre de contexte est de 1 million de tokens avec une sortie plafonnée à 384 000, suffisante pour l’analyse de documents longs et les workflows agentiques étendus sans découpage. Les appelants API existants utilisant les anciens identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp sont déjà redirigés vers V4.1 Flash. Le 14 septembre, le trafic de DeepSeek V4 Pro bascule également — au tarif Flash.

DeepSeek a décrit V4.1 Flash comme « le plus petit modèle de notre nouvelle famille d’architectures ». Un V4.1 Pro plus grand, basé sur la même conception Causal Encoder-Decoder, est sous-entendu. S’il maintient la trajectoire d’efficacité de Flash, il prolongerait le rapport performance/prix de cette architecture plus haut dans la courbe des benchmarks — sur un territoire actuellement occupé par des modèles qui coûtent nettement plus cher par million de tokens.

Le point architectural importe au-delà du tableau de prix. La croissance du cache KV est une contrainte primordiale pour l’exécution de grands modèles sur des contextes longs, et elle évolue avec chaque token traité. L’approche de V4.1 Flash — moins de paramètres actifs, cache compressé — répond directement à cette contrainte. C’est un modèle utilisable pour les déploiements en contexte long, pas une optimisation de cas marginal.

Étiquettes: , , , , ,

Discussion

Il y a 0 commentaire.