DeepSeek savait raisonner, coder, appeler des outils et tenir un contexte massif. Il lui manquait pourtant quelque chose d’assez basique pour un agent moderne. Il ne voyait pas.

Ce manque obligeait à construire un pipeline bancal. DeepSeek pouvait assurer le raisonnement, mais une capture d’écran, une facture ou un graphique devait partir vers un autre modèle. Il fallait donc ajouter un fournisseur, un routage, une politique de données, une facture et quelques secondes de latence. Le 21 août 2026, cette anomalie a enfin commencé à disparaître.

À retenir

deepseek-v4-flash-vision-exp reprend les capacités textuelles de V4 Flash, accepte texte et images, conserve un contexte de 1 million de tokens et facture les images au même tarif d’entrée que V4 Flash.

Le trou enfin comblé

Le sujet ne date pas d’hier. Lors de la sortie de DeepSeek V3 en décembre 2024, l’équipe invitait déjà à attendre le support multimodal. Depuis, DeepSeek a fait bouger le marché sur le raisonnement, le coût et les modèles ouverts, mais sa gamme officielle restait étrangement aveugle.

Il faut tout de même apporter une nuance. DeepSeek n’était pas absent de la recherche multimodale. Les familles Janus, Janus-Pro et DeepSeek-VL savaient déjà comprendre des images, avec des poids disponibles pour l’auto-hébergement. Ce qui manquait était une variante Vision de la gamme principale, disponible dans l’API, compatible avec les formats habituels et alignée sur les capacités agentiques de V4 Flash.

Voilà pourquoi je considère ce lancement comme plus important qu’une option supplémentaire. C’est enfin le modèle qui manquait à DeepSeek depuis tout ce temps. Il ne complète pas seulement une matrice de fonctionnalités. Il permet à DeepSeek de couvrir une chaîne agentique beaucoup plus entière.

Un agent peut désormais recevoir une capture d’interface, repérer une erreur, lire un tableau, relier ce qu’il voit à sa connaissance du code puis appeler un outil. Le raisonnement et la perception vivent dans le même modèle. L’architecture devient plus simple et surtout plus cohérente.

Ce que DeepSeek annonce vraiment

DeepSeek présente V4 Flash Vision Exp comme un modèle expérimental multimodal aligné sur V4 Flash pour le texte. Il conserve donc les capacités d’agent, de raisonnement et de connaissance générale de la branche Flash.

L’entreprise affirme aussi que les performances sur les benchmarks d’agents multimodaux se rapprochent d’Opus 4.8. Le signal est fort, mais il faut le lire correctement. L’annonce ne fournit pas le détail des scores ni le protocole complet. Je retiens donc une ambition de niveau frontier, pas encore une victoire démontrée sur tous les usages.

CapacitéDeepSeek V4 Flash Vision Exp
EntréesTexte et images
Contexte1 million de tokens
Sortie maximale384K tokens
APIChat Completions, Responses et Messages Anthropic
FormatsJPEG, PNG, GIF et WebP
StatutExpérimental

Pourquoi les agents changent de dimension

La vision devient vraiment intéressante lorsqu’elle sort du simple « décris-moi cette image ». Avec des outils, elle transforme des éléments visuels en actions.

  • Support et QA. Un agent reçoit une capture, identifie l’état de l’interface, rapproche le problème d’une base de connaissances puis ouvre un ticket renseigné.
  • Documents métier. Il lit une facture, un bon de commande ou un formulaire, vérifie les champs et transmet les données à un workflow.
  • Data et monitoring. Il analyse un graphique, détecte une rupture visuelle et interroge ensuite les métriques ou les logs.
  • Développement. Il compare une maquette à un rendu, observe un bug responsive et propose une correction de code.
  • Agents poste de travail. Il comprend l’écran avant de décider quel outil appeler ou quelle étape exécuter.

DeepSeek indique que le modèle fonctionne avec les frameworks d’agents et a publié DeepSeek Harness 0.1.1 avec une prise en charge immédiate. C’est probablement là que la nouveauté a le plus de valeur. La vision n’est pas isolée. Elle rejoint un modèle déjà pensé pour raisonner et utiliser des outils.

Pour une utilisation agentique avec Hermes Agent, la conséquence est très concrète. Jusqu’ici, DeepSeek pouvait assurer le raisonnement, mais une capture ou une image obligeait à basculer vers un modèle doté de la vision, comme Codex. Avec V4 Flash Vision Exp, le même fournisseur peut désormais lire l’image, raisonner dessus et poursuivre l’action. Fini le croisement DeepSeek / Codex uniquement pour donner des yeux à Hermes. Le routage, la gouvernance des données, l’observabilité et la facturation redeviennent beaucoup plus simples.

Un coût presque dérisoire

Le choix tarifaire est agressif. Chaque image est redimensionnée et convertie en tokens, avec un plafond de 384 tokens par image. Ces tokens sont ensuite facturés exactement comme l’entrée de V4 Flash.

Tarif au 22 août 2026Hors pointePointe
Entrée avec cache0,007 $ / 1M0,014 $ / 1M
Entrée sans cache0,22 $ / 1M0,44 $ / 1M
Sortie0,66 $ / 1M1,32 $ / 1M

Au plafond de 384 tokens, la seule lecture d’une image représente environ 0,000084 $ hors pointe ou 0,000169 $ en pointe, hors texte et sortie générée. Même un lot de 600 images au plafond reste autour de 0,05 $ ou 0,10 $ pour l’entrée visuelle. Ce calcul théorique ne remplace pas le coût complet d’un workflow, mais il montre à quel point la perception visuelle devient peu chère.

Les petites images sont agrandies jusqu’à environ 384 × 384 pixels. Les grandes sont réduites vers une enveloppe proche de 800 × 800 pixels. Envoyer un fichier 5000 × 5000 n’offre donc pas plus de précision facturée qu’un 2000 × 2000 après ce redimensionnement. Il vaut mieux découper un document dense en zones utiles que pousser aveuglément une image gigantesque.

L’API en quelques lignes

L’intégration reprend le client OpenAI. Une image peut être envoyée en base64, par URL ou avec un file_id. Cette dernière méthode est la plus propre lorsqu’un même document doit être réutilisé dans plusieurs requêtes.

Python · image par URL
from openai import OpenAI

client = OpenAI(
    api_key="<DEEPSEEK_API_KEY>",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Analyse cette capture et liste les anomalies visibles."},
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://example.com/capture.webp",
                    "detail": "high",
                },
            },
        ],
    }],
)

print(response.choices[0].message.content)

Le réglage detail="low" réduit l’image à 512 × 512 pour aller plus vite et payer moins. Les modes high, original et, pour l’instant, auto conservent l’image originale avant la tokenisation interne.

Les limites à connaître

La fiche est impressionnante, mais le suffixe exp n’est pas décoratif. Avant de confier un flux critique au modèle, je testerais la stabilité des réponses, les petits textes, les tableaux denses, les documents inclinés, les graphiques ambigus et l’usage réel des outils après l’analyse visuelle.

LimiteValeur officielle
Corps de requête48 MiB
Image base64 ou URL32 MiB maximum
Image via Files API64 MiB maximum
Nombre d’images600 par requête
Total des images64 MiB sans file_id, 200 MiB avec
Dimensions8192 px par côté, 4096 px à partir de 15 images

Dans Chat Completions, les images doivent se trouver dans les messages utilisateur. Les placer dans un message système ou assistant renvoie une erreur 400. Le modèle Vision doit aussi être appelé explicitement. Les autres modèles DeepSeek rejettent les blocs image.

!
Production

La compatibilité OpenAI facilite un test, mais elle ne transforme pas un modèle expérimental en composant fiable par magie. Ajoutez des jeux d’essai, une validation métier et un repli vers un autre modèle pour les cas sensibles.

Mon verdict

C’est enfin le modèle qui manquait à DeepSeek depuis tout ce temps. DeepSeek avait déjà le prix, le raisonnement, le code, les outils et le contexte. Avec Vision, il récupère enfin les yeux.

Le plus intéressant n’est pas de demander au modèle ce qu’il voit sur une photo. C’est de lui permettre d’observer un élément métier, de raisonner dessus puis d’agir dans la même boucle. À ce tarif, cela peut remettre à plat beaucoup de routages multimodaux qui réservaient automatiquement la vision à un fournisseur plus cher.

Je ne déclarerais pas encore la partie gagnée. La proximité annoncée avec Opus 4.8 doit être confrontée à des tests indépendants et à des cas réels. Mais DeepSeek vient de fermer le plus gros trou de sa gamme, sans sacrifier le prix qui a fait sa force. C’est une nouveauté à tester rapidement.

Questions rapides

Quel est le nom exact du modèle DeepSeek Vision ?

Le modèle s’appelle deepseek-v4-flash-vision-exp. Il faut utiliser cet identifiant dans les requêtes API.

Combien coûte l’analyse d’une image ?

Une image représente au maximum 384 tokens. Elle est facturée au tarif d’entrée de V4 Flash, auquel il faut ajouter le texte envoyé et la réponse générée.

Quelle méthode choisir pour envoyer les images ?

Une URL convient à un test rapide. Le base64 est pratique pour un fichier local léger. La Files API est préférable pour une image lourde ou réutilisée dans plusieurs requêtes.

Sources