---
title: "DeepSeek lança modelo de visão V4-Flash-Exp com custo muito menor que Anthropic"
author: "Gustavo Ramos O. Klein"
date: "2026-08-23 08:45:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/08/23/deepseek-lanca-modelo-de-visao-v4-flash-exp-com-custo-muito-menor-que-anthropic/md"
---

## Resumo
- A DeepSeek lançou o modelo experimental V4-Flash-Vision-Exp em 21 de agosto de 2026.
- A ferramenta adiciona compreensão de imagens, gráficos e capturas de tela ao V4-Flash.
- O acesso ocorre por API, com compatibilidade com formatos Anthropic e OpenAI.
- A visão não tem cobrança separada: cada imagem consome no máximo 384 tokens.
- Os preços variam entre horários de pico e fora de pico, com janela de contexto de 1 milhão de tokens.
- O modelo ficou próximo do Opus-4.8 em benchmarks multimodais, mas ainda deve ser tratado com cautela por estar em fase experimental.

---

Em 21 de agosto de 2026, a **DeepSeek** lançou o modelo experimental **V4-Flash-Vision-Exp**, uma extensão do V4-Flash que adiciona compreensão de imagens, gráficos e capturas de tela ao processamento textual. A novidade ataca um gargalo recorrente para quem desenvolve agentes de inteligência artificial: fazer o sistema conversar com dados visuais sem transformar cada imagem em uma despesa separada. O modelo chegou por **API**, isto é, uma ponte para que outros softwares enviem solicitações e recebam respostas automaticamente, e foi comparado ao Opus-4.8 da Anthropic em avaliações multimodais. A seguir, o ponto é desbugar o que muda na integração, como a cobrança funciona e por que desempenho próximo não elimina os cuidados de um lançamento experimental.

## Uma ponte entre texto, imagens e agentes

O primeiro passo para entender a novidade é separar visão computacional de uma simples função de anexar arquivos. No V4-Flash-Vision-Exp, a **visão computacional**, capacidade de interpretar conteúdo visual, foi integrada ao modelo de texto V4-Flash-0731. Segundo a DeepSeek, a nova versão mantém as capacidades de texto, raciocínio e conhecimento de mundo do V4-Flash, mas passa a analisar imagens e capturas de tela. Essa combinação aproxima o modelo de fluxos de trabalho em que um agente precisa interpretar uma informação visual antes de decidir o que fazer, levando a conversa entre software e usuário para além do texto.

Essa mesma expansão foi desenhada para conversar com ferramentas que já fazem parte do trabalho de desenvolvedores. A **API oficial** oferece suporte a Chat Completions, mensagens compatíveis com Anthropic e respostas compatíveis com OpenAI, três formatos de comunicação que funcionam como idiomas técnicos para diferentes plataformas. A empresa também ativou a **Files API** no lançamento, permitindo fazer um único upload de uma imagem e reutilizá-la em várias solicitações, uma escolha voltada à otimização da largura de banda. A documentação da [DeepSeek](https://api-docs.deepseek.com/news/news260821/) mostra, portanto, uma estratégia de interoperabilidade: em vez de manter a visão isolada em uma interface própria, o modelo tenta se encaixar em pontes já usadas por aplicações e agentes.

## O preço está na forma de processar tokens

Na prática, a principal diferença de custo está no modo como a visão entra na conta. A **DeepSeek** não adicionou uma tarifa específica para interpretar imagens: cada arquivo visual é convertido em tokens, unidades que o modelo processa para calcular a resposta, e segue a estrutura de cobrança do V4-Flash. O limite informado é de **384 tokens por imagem**, o que impede que a resolução completa de uma fotografia ou captura de tela seja transferida integralmente para a conta. Para quem constrói um agente que examina documentos ou telas, essa regra torna a despesa visual parte do mesmo diálogo de entrada e saída já conhecido na API, em vez de criar uma tabela separada apenas para imagens.

Para completar essa lógica, as imagens passam por uma padronização antes do processamento. Avaliações técnicas indicam que elas são redimensionadas para **800 por 800 pixels**, independentemente da resolução original, e custam sempre no máximo 384 tokens. A consequência prática é que uma imagem originalmente muito grande não mantém todo o seu volume visual dentro da solicitação, algo que precisa ser considerado quando detalhes pequenos fazem parte da tarefa. O modelo oferece uma ponte de baixo custo entre a aplicação e a informação visual, mas essa ponte tem uma largura definida: o desenvolvedor precisa verificar se o redimensionamento preserva o elemento que o agente precisa ler.

O valor por token também varia conforme o horário de uso. Segundo um guia independente atualizado em 23 de agosto de 2026, a entrada sem cache do **V4 Flash Vision Exp** custa US$ 0,22 por 1 milhão de tokens fora do horário de pico e US$ 0,44 durante o pico; na saída, os valores são de US$ 0,66 e US$ 1,32, respectivamente. Desde a mesma atualização, os fins de semana, no horário de Pequim, são considerados integralmente fora do pico. A API ainda oferece uma **janela de contexto de 1 milhão de tokens**, volume máximo de informação que pode ser considerado em uma interação, criando espaço para solicitações extensas sem alterar o fato de que entrada, saída e horário afetam a conta.

## Benchmarks mostram proximidade, não igualdade em tudo

Esse desenho de preço só ganha significado quando é colocado ao lado do desempenho medido. Em avaliações reportadas, o **V4-Flash-Vision-Exp** alcançou 36,5 pontos no ApexBench, usando a métrica Pass@1, que observa o resultado obtido na primeira tentativa, contra 39,4 do Opus-4.8. Em outro teste, chamado **Agents' Last Exam**, o modelo da DeepSeek marcou 27,3 pontos, acima dos 25,7 registrados pelo concorrente. Os números desenham uma relação mais precisa do que a promessa de simplesmente igualar um rival: a DeepSeek ficou atrás em uma medição e à frente em outra, enquanto se aproximou do modelo da Anthropic em tarefas ligadas a agentes multimodais.

Além da leitura visual, o novo modelo preserva competências que fazem diferença na conexão com aplicações. O **V4-Flash-Vision-Exp** retém capacidades de codificação, uso de ferramentas e processamento de documentos presentes no V4-Flash. Isso permite enxergar a novidade como uma camada visual adicionada a um modelo que já trabalha com tarefas textuais e operações externas, e não apenas como um leitor de imagens separado. Em um agente autônomo, por exemplo, a captura de tela pode ser a entrada, o raciocínio pode organizar a decisão e uma ferramenta pode executar a ação seguinte, embora cada etapa ainda precise ser validada pelo desenvolvedor que controla a integração.

## Da demonstração à integração com outros serviços

A compatibilidade entre formatos é onde a notícia ganha um sentido mais amplo para equipes técnicas. Uma aplicação que já conversa com serviços por meio de mensagens compatíveis com Anthropic ou respostas compatíveis com OpenAI encontra no **V4-Flash-Vision-Exp** uma porta de entrada para imagens, gráficos e capturas de tela, segundo as especificações divulgadas. Isso não significa que toda troca de modelo seja automática, pois cada produto precisa validar mensagens, limites e resultados, mas reduz a distância entre a aplicação e o novo recurso visual. A API funciona como uma mesa de negociação: cada plataforma mantém sua forma de falar, enquanto o modelo oferece pontos de conexão para que o diálogo aconteça.

Essa integração pode ser organizada em etapas objetivas. Primeiro, o desenvolvedor precisa definir se a imagem será enviada diretamente em uma solicitação ou armazenada pela **Files API** para reutilização em múltiplos pedidos. Depois, deve acompanhar o consumo máximo de 384 tokens por imagem, separar o custo de entrada do custo de saída e observar a diferença entre horários de pico e fora de pico. Por fim, a equipe precisa testar tarefas de visão junto com codificação, documentos e uso de ferramentas, porque os benchmarks não medem todas as combinações possíveis. A novidade entrega as pontes, mas cabe a quem integra conferir se cada trecho do caminho preserva a informação necessária.

## O próximo passo é testar antes de colocar em produção

Ainda assim, a palavra **experimental** não é um detalhe editorial. A imprensa financeira chinesa informou que a DeepSeek recomenda cautela no uso imediato em ambientes de produção até que novas iterações de estabilidade sejam concluídas. Isso muda a forma de interpretar os preços e os benchmarks: uma API barata e próxima de um concorrente em avaliações pode ser atraente para protótipos, comparações e testes controlados, mas a decisão de substituir uma solução existente depende também da consistência das respostas e do comportamento em tarefas reais. O desempenho medido abre a conversa; a estabilidade decide se essa conversa pode sustentar um serviço.

Por enquanto, o caminho mais seguro é usar a **API do V4-Flash-Vision-Exp** em testes delimitados, comparar as respostas com as tarefas visuais que a aplicação realmente precisa executar e registrar o consumo de tokens em diferentes horários. A Files API pode ser avaliada quando a mesma imagem precisar participar de várias solicitações, enquanto a janela de 1 milhão de tokens deve ser considerada ao planejar interações extensas. O lançamento não encerra a disputa com a Anthropic, mas muda a pergunta para os desenvolvedores: em vez de perguntar apenas qual modelo entende mais, será preciso medir qual ponte conecta visão, ferramentas e custo com estabilidade suficiente para o uso pretendido.