A DeepSeek lançou o V4-Flash-Vision-Exp, um modelo multimodal experimental que, segundo a empresa, se aproxima do desempenho do Claude Opus 4.8, da Anthropic, em vários testes de referência. Assim, o laboratório chinês reforça a aposta em capacidades visuais e agentes de IA com custos potencialmente mais baixos do que os praticados por concorrentes norte-americanos.
O DeepSeek-V4-Flash-Vision-Exp é uma versão multimodal do atual modelo de texto V4-Flash, e não um novo modelo de referência da empresa. De acordo com a DeepSeek, mantém as capacidades de texto do V4-Flash, incluindo comportamento agentivo, raciocínio e conhecimento geral, e acrescenta compreensão de imagens.
Uma variante visual, não um novo modelo de topo DeepSeek
Nos benchmarks multimodais orientados para agentes divulgados pela empresa, o novo modelo reduz de forma significativa a diferença para o Opus 4.8. No ApexBench, o V4-Flash-Vision-Exp obteve 36,5 em Pass@1, face aos 39,4 do Opus 4.8. Já no Agents’ Last Exam, superou o modelo da Anthropic, com 27,3 pontos contra 25,7.
Além disso, no ZeroBench, o modelo da DeepSeek alcançou 35,0, enquanto o Opus 4.8 registou 34,0. Por outro lado, em avaliações mais centradas em texto, como o Terminal Bench 2.1, ficou cerca de um ponto abaixo do rival: 83,9 contra 85,0. A distância é, porém, mais expressiva no NL2Repo, onde obteve 57,7, comparativamente aos 69,7 do Opus 4.8.
Importa salientar que a DeepSeek avaliou os seus próprios modelos através do seu Harness Minimal Mode interno. Por isso, estes resultados ainda não foram validados de forma independente.
Preços, ferramentas e contexto competitivo
O modelo já está disponível através da API da DeepSeek, com o identificador deepseek-v4-flash-vision-exp. As imagens são faturadas por número de tokens, com um limite de 384 tokens por imagem, aplicando-se a mesma tabela de preços do V4-Flash.
Desta forma, a empresa pretende manter os custos abaixo dos valores cobrados por laboratórios norte-americanos por capacidades semelhantes. Em simultâneo, a DeepSeek lançou a versão 0.1.1 do seu framework Harness, que inclui suporte nativo para o novo modelo.
A empresa também disponibilizou uma Files API. Esta ferramenta permite aos programadores carregar uma imagem apenas uma vez e reutilizá-la em vários pedidos através de um identificador de ficheiro. Segundo a DeepSeek, a utilização da Files API é gratuita.
O lançamento acontece num momento de competição crescente, tanto na China (com empresas como a Alibaba e a Moonshot AI) como nos Estados Unidos, onde Anthropic e OpenAI continuam a disputar a liderança em modelos avançados. Ainda assim, o V4-Flash-Vision-Exp não deve ser visto como um lançamento de topo de gama.
Em vez disso, representa uma estratégia cada vez mais comum entre os laboratórios chineses: levar capacidades multimodais e agentivas para modelos intermédios, mais acessíveis e fáceis de adotar. Assim, o sucesso desta versão experimental dependerá da adesão dos programadores, mas deixa claro que a próxima fase da concorrência em IA também passará por tornar o raciocínio visual mais económico e amplamente disponível.
Fica ainda mais conectado:
- X-Men | Quem são os atores e qual o futuro na Marvel
- Google Gemini 3.7 Flash entra no Modo IA do Google Search
- Qwen – Modelo básico da Alibaba rivaliza com GPT-5.6 e DeepSeek

