DeepSeek-V4.1-Flash: 552 milliards de paramètres, 8 seulement mobilisés pour lire votre prompt
DeepSeek-V4.1-Flash est le modèle de langage multimodal ouvert du laboratoire chinois DeepSeek, premier d'une nouvelle génération d'architecture avec lecture d'images native et un contexte d'un million de tokens. Sorti le 10 septembre 2026 sous licence MIT, il se télécharge librement sur Hugging Face. Côté API, comptez 0,15 $ le million de tokens lus (environ 0,14 €) en heures creuses. Le modèle rédige un français impeccable, même si la console et la documentation restent en anglais.
- Contexte d'un million de tokens en entrée
- Poids ouverts sous licence MIT, usage commercial permis
- Lecture d'images native, entraînée dès le départ
- Tarif du cache parmi les plus bas du marché
- Débit soutenu, environ 214 tokens par seconde
- Raisonnement pur derrière Claude Opus 5 et GPT-5.6 Sol
- Auto-hébergement réservé aux serveurs multi-GPU bien équipés
- Réponses assez verbeuses quand l'effort de raisonnement grimpe
Encodeur-décodeur causal, la mécanique asymétrique du modèle
L'architecture Causal Encoder-Decoder inaugurée ici active 8 milliards de paramètres pour lire votre prompt et 16 milliards pour rédiger la réponse, sur un total de 552 milliards organisés en mélange d'experts. Lire coûte donc moins cher que générer, un choix pensé pour les agents qui avalent des contextes énormes.
Autre levier, le cache mémoire descend à 890 octets par token, environ un quart de la génération précédente. Vos agents qui relisent en boucle le même dépôt ou les mêmes instructions système paient beaucoup moins (c'est là que dort l'essentiel de la facture d'un agent, on l'oublie souvent).
- Contexte de 1 048 576 tokens, jusqu'à 384 000 tokens en sortie
- Curseur d'effort de raisonnement réglable de 1 à 100
- Entraîné de zéro sur 45 000 milliards de tokens multimodaux
- Vision native, images et texte appris ensemble dès le pré-entraînement
DeepSeek-V4.1-Flash face à Claude Opus 5 et GPT-5.6 Sol
Sur les tests publiés au lancement, V4.1-Flash devance son propre grand frère V4-Pro sur la plupart des épreuves de code et d'agents, ce qui a poussé DeepSeek à en faire le modèle par défaut de son API. Face aux ténors américains, le tableau est plus nuancé.
Il grappille la première place sur DeepSWE et Automation-Bench, puis rend des points dès qu'il faut raisonner sans outils. Pour situer ces scores dans la hiérarchie du moment, un classement des modèles de langage tenu à jour aide à garder la tête froide.
| Benchmark | V4.1-Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE v1.1 | 74,2 | 74,0 | 73,0 |
| Automation-Bench | 54,8 | 50,3 | 45,8 |
| Terminal-Bench 3.0 | 30,0 | 43,3 | 34,4 |
| Humanity's Last Exam | 36,8 | 56,3 | 44,5 |
Combien coûte DeepSeek-V4.1-Flash, entre heures pleines et heures creuses
L'API facture 0,15 $ le million de tokens lus (environ 0,14 €) et 0,60 $ le million généré (environ 0,55 €) en heures creuses, montants doublés en heures pleines. Le token déjà en cache tombe à 0,003 $ le million, un plancher rarement vu.
Les heures pleines couvrent 01h00 à 04h00 et 06h00 à 10h00 UTC en semaine, tout le reste est creux. Vous planifiez vos gros travaux d'agents le week-end et la note fond de moitié. Le nom de modèle à renseigner est deepseek-flash, et des hébergeurs tiers le servent aussi, OpenRouter en tête. Ces chiffres bougeant vite chez DeepSeek, la grille de la page officielle des tarifs reste la seule référence fiable.
Questions fréquentes
DeepSeek-V4.1-Flash est-il gratuit ?
Les poids du modèle sont gratuits et téléchargeables sur Hugging Face sous licence MIT, usage commercial compris. L'API officielle, elle, se facture au token, avec des heures creuses à moitié prix. Entre les deux, des hébergeurs tiers comme OpenRouter le proposent aussi à l'usage, sans abonnement.
Peut-on faire tourner DeepSeek-V4.1-Flash en local ?
Oui, mais avec du matériel sérieux. Avec 552 milliards de paramètres, prévoyez environ 300 Go de mémoire GPU en quantification 4 bits, donc un serveur multi-GPU plutôt qu'un portable. En dessous de très gros volumes, l'API ou un hébergeur tiers revient nettement moins cher que l'auto-hébergement.
Que devient DeepSeek-V4-Pro après la sortie de V4.1-Flash ?
DeepSeek avait annoncé rediriger les requêtes V4-Pro vers V4.1-Flash à partir du 14 septembre 2026, avant de faire machine arrière. Le laboratoire maintient finalement l'API V4-Pro avec une facturation inchangée, en attendant l'arrivée d'un futur V4.1-Pro annoncé comme le prochain vaisseau amiral.
DeepSeek-V4.1-Flash égale-t-il Claude Opus 5 ou GPT-6 ?
Sur les tâches d'agents et de code, il joue dans la même cour pour une fraction du prix. Sur le raisonnement sans outils, il reste derrière, avec 40 points à l'Artificial Analysis Intelligence Index contre 53 pour GPT-6 Astra et Claude Fable 5.1, à effort de raisonnement maximal.
Verdict : Un agent qui relit le même dépôt toute la journée coûte une fortune ailleurs, presque rien ici. Les équipes qui font tourner des agents de code ou d'automatisation à haut volume tiennent leur meilleur rapport intelligence-prix, quitte à garder un gros modèle de raisonnement sous le coude pour les cas épineux.
