Venerd� DeepSeek ha pubblicato DeepSeek-V4-Flash-Vision-Exp, un modello multimodale sperimentale che l'azienda di Hangzhou presenta come vicino a Opus-4.8 di Anthropic sui compiti agentici. La tabella che accompagna l'annuncio contiene undici benchmark, e il nuovo modello ne vince tre. Sugli altri otto resta indietro, in due casi di parecchio: su NL2Repo si ferma a 57,7 contro 69,7, dodici punti di distanza.

Il modello parte dal V4-Flash testuale e vi aggiunge la capacit� di leggere immagini e schermate, e poi di agire su quello che vede. � gi� attivo sulla piattaforma API dell'azienda, che insieme al modello ha rilasciato la versione 0.1.1 del proprio framework agentico, con il supporto integrato. Su X DeepSeek scrive che il modello sperimentale "eguaglia DeepSeek-V4-Flash sulle capacit� testuali, inclusi agenti, ragionamento e conoscenza del mondo", e che sui benchmark agentici multimodali "compie un balzo notevole rispetto a V4-Flash, portando le prestazioni agentiche multimodali vicino a Opus-4.8".

Le distanze, benchmark per benchmark

Le tre vittorie arrivano con margini sottili: DeepSWE per 1,3 punti, Agents' Last Exam per 1,6, ZeroBench per 1,0. Sul resto della griglia il quadro si rovescia, e in due punti lo scarto diventa consistente: oltre ai dodici punti di NL2Repo, DSBench-Hard vede 63,6 contro 71,7. Restano invece davvero ravvicinati Toolathlon-Verified, 75,9 contro 76,2, Chartography, 64,3 contro 65,0, e Terminal Bench 2.1, 83,9 contro 85,0.