NoticiasInteligência ArtificialTecnologia

DeepSeek-V4-Flash-Vision-Exp: novo modelo multimodal da DeepSeek já está disponível na API

A DeepSeek ampliou sua linha de modelos com o lançamento do DeepSeek-V4-Flash-Vision-Exp, uma versão experimental multimodal do V4-Flash capaz de processar texto e imagens dentro de uma mesma requisição.

O anúncio foi publicado pela empresa no X, por meio do perfil oficial @deepseek_ai, em 21 de agosto de 2026. O modelo já está disponível na plataforma de API da DeepSeek para desenvolvedores que desejam experimentar recursos de visão computacional, agentes multimodais e análise de documentos e interfaces.

Além da chegada do novo modelo, a empresa também apresentou recursos relacionados ao armazenamento e reutilização de imagens por meio da Files API, reduzindo a necessidade de enviar repetidamente os mesmos arquivos em diferentes requisições.

PUBLICIDADE

O que é o DeepSeek-V4-Flash-Vision-Exp?

O DeepSeek-V4-Flash-Vision-Exp é uma versão experimental multimodal baseada no DeepSeek-V4-Flash. Na prática, ele preserva as capacidades textuais do modelo original, incluindo raciocínio, conhecimento de mundo e execução de tarefas orientadas por agentes, mas adiciona a capacidade de interpretar conteúdo visual.

Isso permite que uma aplicação envie uma imagem acompanhada de instruções em texto e peça ao modelo para identificar objetos, interpretar gráficos, analisar documentos, compreender screenshots ou responder perguntas relacionadas ao conteúdo visual apresentado.

Segundo a própria DeepSeek, o novo modelo apresenta um avanço significativo em benchmarks envolvendo agentes multimodais quando comparado ao V4-Flash exclusivamente textual, aproximando seu desempenho de modelos avançados como o Claude Opus-4.8.

A arquitetura continua baseada em Mixture-of-Experts (MoE), com aproximadamente 284 bilhões de parâmetros totais e 13 bilhões de parâmetros ativos durante a inferência.

O modelo também herda características importantes do V4-Flash, incluindo uma janela de contexto de até 1 milhão de tokens e suporte a grandes volumes de saída, podendo chegar a 384 mil tokens.

benchmark DeepSeek-V4-Flash-Vision-Exp

Principais recursos do DeepSeek-V4-Flash-Vision-Exp

Entre as capacidades mais relevantes do novo modelo estão:

  • Capacidades textuais preservadas: mantém recursos de raciocínio, agentes e conhecimento de mundo presentes no DeepSeek-V4-Flash.
  • Visão nativa: permite analisar fotografias, documentos, screenshots, gráficos e outros conteúdos visuais.
  • Perguntas e respostas sobre imagens: aplicações podem combinar uma imagem com perguntas ou instruções em linguagem natural.
  • Agentes multimodais: o modelo pode combinar interpretação visual com ferramentas e automações.
  • Entrada multimodal: texto e imagens podem fazer parte da mesma conversa ou prompt.
  • Análise de interfaces: screenshots de sites, softwares e outros sistemas podem ser interpretados pelo modelo.
  • Leitura de documentos: tabelas, elementos visuais e textos presentes em arquivos ou imagens podem ser analisados em conjunto.
  • Compatibilidade com diferentes APIs: estão disponíveis formatos como Chat Completions, Messages e Responses API.

O modelo também funciona com o DeepSeek Harness 0.1.1, lançado no mesmo período com suporte voltado à integração entre modelos, ferramentas e agentes.

Como enviar imagens para o modelo

A DeepSeek disponibiliza diferentes maneiras de fornecer imagens ao DeepSeek-V4-Flash-Vision-Exp.

Entre elas estão:

  • imagens codificadas em Base64;
  • imagens hospedadas em uma URL externa;
  • arquivos armazenados utilizando a Files API.

Para aplicações que precisam analisar repetidamente a mesma imagem ou documento, a Files API tende a ser a opção mais eficiente.

Files API permite armazenar e reutilizar imagens

Junto com os novos recursos multimodais, a DeepSeek disponibilizou a Files API, que permite realizar o upload de arquivos e posteriormente reutilizá-los nas chamadas à API.

Em vez de transmitir a mesma imagem novamente a cada requisição, o desenvolvedor pode fazer o upload uma única vez e utilizar o identificador file_id.

O fluxo funciona basicamente da seguinte maneira:

  1. a aplicação envia a imagem para a Files API;
  2. a DeepSeek retorna um file_id;
  3. esse identificador passa a ser usado nas requisições seguintes;
  4. o mesmo arquivo pode ser reutilizado em diferentes prompts.

Essa abordagem pode reduzir consumo de banda e também facilita aplicações que trabalham continuamente com os mesmos documentos, imagens ou screenshots.

Outro benefício é evitar problemas relacionados aos limites de tamanho do corpo das requisições HTTP, principalmente quando arquivos maiores precisam ser processados diversas vezes.

A documentação oficial está disponível em Deepseek Docs

Quanto custa usar o DeepSeek-V4-Flash-Vision-Exp?

Um dos pontos mais interessantes do lançamento é que a capacidade visual não utiliza, segundo a estrutura apresentada pela empresa, uma tarifa separada específica para visão.

As imagens são convertidas em tokens e contabilizadas junto aos tokens de entrada.

Cada imagem pode consumir até 384 tokens, dependendo de suas características e do processamento necessário.

O modelo utiliza a estrutura de preços do DeepSeek-V4-Flash.

Entre os valores de referência divulgados para períodos off-peak estão:

  • Input com cache miss: US$ 0,22 por 1 milhão de tokens;
  • Input com cache hit: US$ 0,007 por 1 milhão de tokens;
  • Output: US$ 0,66 por 1 milhão de tokens.

Os preços podem variar de acordo com os horários de utilização, já que a DeepSeek trabalha com diferenças entre períodos de pico e off-peak.

Por isso, para aplicações em produção, é recomendável consultar a tabela oficial antes de realizar estimativas de custo.

Como usar o DeepSeek-V4-Flash-Vision-Exp na API

Para acessar o novo modelo, basta definir o parâmetro model utilizando o identificador:

deepseek-v4-flash-vision-exp

A partir daí, imagens e instruções podem ser enviadas utilizando os formatos disponibilizados pela API.

A documentação completa sobre os recursos de visão pode ser consultada em: Site oficial Deepseek

Entre os formatos de imagem suportados estão:

  • JPEG;
  • PNG;
  • GIF;
  • WebP.

Segundo os limites divulgados pela plataforma, uma única requisição pode trabalhar com até 600 imagens, embora existam restrições adicionais relacionadas às dimensões das imagens e ao tamanho total da requisição.

Para que o novo modelo pode ser utilizado?

Adicionar visão ao V4-Flash aumenta consideravelmente a quantidade de aplicações que podem ser construídas utilizando a infraestrutura da DeepSeek.

Um dos exemplos mais evidentes são os chamados GUI Agents, agentes de inteligência artificial capazes de interpretar interfaces gráficas.

Um sistema desse tipo pode receber um screenshot de um site ou aplicativo, compreender os elementos exibidos e determinar quais ações precisam ser executadas.

Mas esse está longe de ser o único cenário.

Análise de documentos

Empresas podem utilizar o modelo para interpretar documentos que combinam texto, tabelas, gráficos e elementos visuais.

Isso pode ser útil para:

  • relatórios;
  • dashboards;
  • documentos financeiros;
  • apresentações;
  • formulários;
  • materiais digitalizados.

Automação baseada em screenshots

Sistemas de automação podem utilizar screenshots como fonte de informação.

Um agente pode, por exemplo, analisar visualmente o estado de uma aplicação antes de determinar qual ação deverá executar.

Interpretação de gráficos

Também é possível fornecer gráficos e pedir que o modelo identifique tendências, valores importantes ou diferenças entre conjuntos de dados.

Aplicações multimodais

Outra possibilidade está na construção de aplicações nas quais texto e imagem fazem parte naturalmente da mesma interação.

Um usuário pode fotografar um problema, enviar a imagem e fazer perguntas sobre ela sem precisar transformar previamente o conteúdo visual em texto.

A aposta da DeepSeek em agentes multimodais

O lançamento do DeepSeek-V4-Flash-Vision-Exp também indica uma movimentação mais ampla da DeepSeek em direção aos agentes de inteligência artificial.

A chegada do Harness 0.1.1 no mesmo período reforça essa estratégia.

Em vez de oferecer apenas um modelo capaz de responder prompts, a ideia passa a envolver um ecossistema no qual o modelo consegue combinar:

texto + visão + raciocínio + ferramentas + agentes.

Esse tipo de arquitetura é particularmente importante para agentes capazes de interagir com computadores, navegadores e aplicações.

Um modelo puramente textual pode compreender instruções ou analisar dados estruturados, mas encontra limitações quando precisa interpretar diretamente o estado visual de uma interface.

Com visão integrada, screenshots passam a funcionar como parte do contexto do agente.

Conclusão

O DeepSeek-V4-Flash-Vision-Exp representa mais um passo da DeepSeek na expansão de seus modelos para além da geração e interpretação de texto.

Ao adicionar compreensão de imagens, suporte a agentes multimodais, integração com ferramentas e a nova Files API, a empresa amplia significativamente as possibilidades de uso do V4-Flash.

O modelo pode ser particularmente interessante para quem trabalha com agentes de IA, automação baseada em screenshots, interpretação de documentos, análise de gráficos e aplicações que precisam combinar texto e imagem.

Por se tratar de uma versão experimental, seu comportamento e especificações ainda podem passar por mudanças. Ainda assim, o lançamento mostra que a DeepSeek pretende competir diretamente em uma das áreas mais disputadas da inteligência artificial atualmente: modelos capazes não apenas de conversar, mas também de interpretar visualmente o ambiente ao seu redor e agir a partir dessas informações.

Modelo: deepseek-v4-flash-vision-exp
Documentação oficial: api-docs.deepseek.com
Documentação da Files API: https://api-docs.deepseek.com/guides/files_api/
Documentação de visão: https://api-docs.deepseek.com/guides/vision/
Anúncio original: X/@deepseek_ai

PUBLICIDADE

Diogo Fernando

Apaixonado por tecnologia e cultura pop, programo para resolver problemas e transformar vidas. Empreendedor e geek, busco novas ideias e desafios. Acredito na tecnologia como superpoder do século XXI.