DeepSeek savait raisonner, coder, appeler des outils et tenir un contexte massif. Il lui manquait pourtant quelque chose d’assez basique pour un agent moderne. Il ne voyait pas.
Ce manque obligeait à construire un pipeline bancal. DeepSeek pouvait assurer le raisonnement, mais une capture d’écran, une facture ou un graphique devait partir vers un autre modèle. Il fallait donc ajouter un fournisseur, un routage, une politique de données, une facture et quelques secondes de latence. Le 21 août 2026, cette anomalie a enfin commencé à disparaître.
deepseek-v4-flash-vision-exp reprend les capacités textuelles de V4 Flash, accepte texte et images, conserve un contexte de 1 million de tokens et facture les images au même tarif d’entrée que V4 Flash.
Le trou enfin comblé
Le sujet ne date pas d’hier. Lors de la sortie de DeepSeek V3 en décembre 2024, l’équipe invitait déjà à attendre le support multimodal. Depuis, DeepSeek a fait bouger le marché sur le raisonnement, le coût et les modèles ouverts, mais sa gamme officielle restait étrangement aveugle.
Il faut tout de même apporter une nuance. DeepSeek n’était pas absent de la recherche multimodale. Les familles Janus, Janus-Pro et DeepSeek-VL savaient déjà comprendre des images, avec des poids disponibles pour l’auto-hébergement. Ce qui manquait était une variante Vision de la gamme principale, disponible dans l’API, compatible avec les formats habituels et alignée sur les capacités agentiques de V4 Flash.
Voilà pourquoi je considère ce lancement comme plus important qu’une option supplémentaire. C’est enfin le modèle qui manquait à DeepSeek depuis tout ce temps. Il ne complète pas seulement une matrice de fonctionnalités. Il permet à DeepSeek de couvrir une chaîne agentique beaucoup plus entière.
Un agent peut désormais recevoir une capture d’interface, repérer une erreur, lire un tableau, relier ce qu’il voit à sa connaissance du code puis appeler un outil. Le raisonnement et la perception vivent dans le même modèle. L’architecture devient plus simple et surtout plus cohérente.
Ce que DeepSeek annonce vraiment
DeepSeek présente V4 Flash Vision Exp comme un modèle expérimental multimodal aligné sur V4 Flash pour le texte. Il conserve donc les capacités d’agent, de raisonnement et de connaissance générale de la branche Flash.
L’entreprise affirme aussi que les performances sur les benchmarks d’agents multimodaux se rapprochent d’Opus 4.8. Le signal est fort, mais il faut le lire correctement. L’annonce ne fournit pas le détail des scores ni le protocole complet. Je retiens donc une ambition de niveau frontier, pas encore une victoire démontrée sur tous les usages.
| Capacité | DeepSeek V4 Flash Vision Exp |
|---|---|
| Entrées | Texte et images |
| Contexte | 1 million de tokens |
| Sortie maximale | 384K tokens |
| API | Chat Completions, Responses et Messages Anthropic |
| Formats | JPEG, PNG, GIF et WebP |
| Statut | Expérimental |
Pourquoi les agents changent de dimension
La vision devient vraiment intéressante lorsqu’elle sort du simple « décris-moi cette image ». Avec des outils, elle transforme des éléments visuels en actions.
- Support et QA. Un agent reçoit une capture, identifie l’état de l’interface, rapproche le problème d’une base de connaissances puis ouvre un ticket renseigné.
- Documents métier. Il lit une facture, un bon de commande ou un formulaire, vérifie les champs et transmet les données à un workflow.
- Data et monitoring. Il analyse un graphique, détecte une rupture visuelle et interroge ensuite les métriques ou les logs.
- Développement. Il compare une maquette à un rendu, observe un bug responsive et propose une correction de code.
- Agents poste de travail. Il comprend l’écran avant de décider quel outil appeler ou quelle étape exécuter.
DeepSeek indique que le modèle fonctionne avec les frameworks d’agents et a publié DeepSeek Harness 0.1.1 avec une prise en charge immédiate. C’est probablement là que la nouveauté a le plus de valeur. La vision n’est pas isolée. Elle rejoint un modèle déjà pensé pour raisonner et utiliser des outils.
Pour une utilisation agentique avec Hermes Agent, la conséquence est très concrète. Jusqu’ici, DeepSeek pouvait assurer le raisonnement, mais une capture ou une image obligeait à basculer vers un modèle doté de la vision, comme Codex. Avec V4 Flash Vision Exp, le même fournisseur peut désormais lire l’image, raisonner dessus et poursuivre l’action. Fini le croisement DeepSeek / Codex uniquement pour donner des yeux à Hermes. Le routage, la gouvernance des données, l’observabilité et la facturation redeviennent beaucoup plus simples.
Un coût presque dérisoire
Le choix tarifaire est agressif. Chaque image est redimensionnée et convertie en tokens, avec un plafond de 384 tokens par image. Ces tokens sont ensuite facturés exactement comme l’entrée de V4 Flash.
| Tarif au 22 août 2026 | Hors pointe | Pointe |
|---|---|---|
| Entrée avec cache | 0,007 $ / 1M | 0,014 $ / 1M |
| Entrée sans cache | 0,22 $ / 1M | 0,44 $ / 1M |
| Sortie | 0,66 $ / 1M | 1,32 $ / 1M |
Au plafond de 384 tokens, la seule lecture d’une image représente environ 0,000084 $ hors pointe ou 0,000169 $ en pointe, hors texte et sortie générée. Même un lot de 600 images au plafond reste autour de 0,05 $ ou 0,10 $ pour l’entrée visuelle. Ce calcul théorique ne remplace pas le coût complet d’un workflow, mais il montre à quel point la perception visuelle devient peu chère.
Les petites images sont agrandies jusqu’à environ 384 × 384 pixels. Les grandes sont réduites vers une enveloppe proche de 800 × 800 pixels. Envoyer un fichier 5000 × 5000 n’offre donc pas plus de précision facturée qu’un 2000 × 2000 après ce redimensionnement. Il vaut mieux découper un document dense en zones utiles que pousser aveuglément une image gigantesque.
L’API en quelques lignes
L’intégration reprend le client OpenAI. Une image peut être envoyée en base64, par URL ou avec un file_id. Cette dernière méthode est la plus propre lorsqu’un même document doit être réutilisé dans plusieurs requêtes.
from openai import OpenAI
client = OpenAI(
api_key="<DEEPSEEK_API_KEY>",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Analyse cette capture et liste les anomalies visibles."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/capture.webp",
"detail": "high",
},
},
],
}],
)
print(response.choices[0].message.content)
Le réglage detail="low" réduit l’image à 512 × 512 pour aller plus vite et payer moins. Les modes high, original et, pour l’instant, auto conservent l’image originale avant la tokenisation interne.
Les limites à connaître
La fiche est impressionnante, mais le suffixe exp n’est pas décoratif. Avant de confier un flux critique au modèle, je testerais la stabilité des réponses, les petits textes, les tableaux denses, les documents inclinés, les graphiques ambigus et l’usage réel des outils après l’analyse visuelle.
| Limite | Valeur officielle |
|---|---|
| Corps de requête | 48 MiB |
| Image base64 ou URL | 32 MiB maximum |
| Image via Files API | 64 MiB maximum |
| Nombre d’images | 600 par requête |
| Total des images | 64 MiB sans file_id, 200 MiB avec |
| Dimensions | 8192 px par côté, 4096 px à partir de 15 images |
Dans Chat Completions, les images doivent se trouver dans les messages utilisateur. Les placer dans un message système ou assistant renvoie une erreur 400. Le modèle Vision doit aussi être appelé explicitement. Les autres modèles DeepSeek rejettent les blocs image.
La compatibilité OpenAI facilite un test, mais elle ne transforme pas un modèle expérimental en composant fiable par magie. Ajoutez des jeux d’essai, une validation métier et un repli vers un autre modèle pour les cas sensibles.
Mon verdict
C’est enfin le modèle qui manquait à DeepSeek depuis tout ce temps. DeepSeek avait déjà le prix, le raisonnement, le code, les outils et le contexte. Avec Vision, il récupère enfin les yeux.
Le plus intéressant n’est pas de demander au modèle ce qu’il voit sur une photo. C’est de lui permettre d’observer un élément métier, de raisonner dessus puis d’agir dans la même boucle. À ce tarif, cela peut remettre à plat beaucoup de routages multimodaux qui réservaient automatiquement la vision à un fournisseur plus cher.
Je ne déclarerais pas encore la partie gagnée. La proximité annoncée avec Opus 4.8 doit être confrontée à des tests indépendants et à des cas réels. Mais DeepSeek vient de fermer le plus gros trou de sa gamme, sans sacrifier le prix qui a fait sa force. C’est une nouveauté à tester rapidement.
Questions rapides
Quel est le nom exact du modèle DeepSeek Vision ?
Le modèle s’appelle deepseek-v4-flash-vision-exp. Il faut utiliser cet identifiant dans les requêtes API.
Combien coûte l’analyse d’une image ?
Une image représente au maximum 384 tokens. Elle est facturée au tarif d’entrée de V4 Flash, auquel il faut ajouter le texte envoyé et la réponse générée.
Quelle méthode choisir pour envoyer les images ?
Une URL convient à un test rapide. Le base64 est pratique pour un fichier local léger. La Files API est préférable pour une image lourde ou réutilisée dans plusieurs requêtes.
Sources
- DeepSeek — annonce de V4 Flash Vision Exp, 21 août 2026.
- DeepSeek — guide officiel de l’API Vision.
- DeepSeek — modèles et tarification.
- DeepSeek — lancement de V3 et promesse du support multimodal, 26 décembre 2024.
- DeepSeek — lancement de la preview V4, 24 avril 2026.
- DeepSeek — dépôt officiel des modèles multimodaux Janus et Janus-Pro.




