NoticiasInteligência ArtificialTecnologia

FLUX 3 Video abre acesso antecipado com áudio

PUBLICIDADE

Atualizado em 29 de julho de 2026: a Black Forest Labs abriu o acesso antecipado ao FLUX 3 Video, sistema de IA capaz de gerar vídeos de até 20 segundos com áudio nativo a partir de texto, imagens, quadros-chave ou clipes de referência. A novidade marca a primeira parte disponível do FLUX 3, um modelo de base multimodal treinado conjuntamente em imagem, vídeo e áudio. Segundo a empresa, o objetivo é aproximar geração visual, som, linguagem e previsão de ações em uma arquitetura unificada.

O que é o FLUX 3 Video

O FLUX 3 Video é uma ferramenta de geração de vídeo por inteligência artificial criada pela Black Forest Labs, mesma empresa associada à família de modelos FLUX para criação de imagens. Na prática, o sistema permite transformar instruções em vídeo, continuar cenas já existentes, preservar personagens entre tomadas e criar sequências com múltiplos planos.

A diferença central está no áudio nativo. Em vez de gerar apenas imagem em movimento e depender de uma etapa separada para som, o modelo cria vídeo e áudio dentro do mesmo processo. Isso pode incluir efeitos sonoros, ambiente, fala e diálogos multilíngues, dependendo do prompt e dos materiais de referência usados.

PUBLICIDADE

“Um modelo multimodal para imagem, vídeo, áudio e previsão de ações. As criações são mais fiéis à vida em todos os estilos.”

Black Forest Labs, anúncio oficial do FLUX 3

Como funciona a geração por texto, imagem e clipes do FLUX 3 Video

De acordo com a Black Forest Labs, o FLUX 3 Video aceita diferentes entradas. O usuário pode começar com uma descrição em texto, enviar uma imagem, definir keyframes ou usar um clipe de referência. A partir disso, o modelo interpreta aparência, movimento e som como partes do mesmo evento, não como tarefas isoladas.

  • Texto para vídeo com áudio nativo.
  • Imagem para vídeo com movimento coerente.
  • Keyframes para controlar início e fim.
  • Clipes de referência para estilo e ação.
  • Continuação de vídeo e áudio existentes.
  • Preservação de personagens entre cenas.

Esse desenho técnico busca resolver uma limitação comum em geradores de vídeo com IA: a perda de consistência entre planos. Se o modelo consegue carregar elementos centrais, como um personagem, um objeto ou um cenário, fica mais fácil criar narrativas curtas com continuidade visual e sonora.

Arquitetura multimodal e método Self-Flow

O FLUX 3 foi treinado em uma arquitetura unificada para aprender relações entre imagem, vídeo e áudio. A linguagem funciona como ponte entre percepção e instrução: ela descreve o que deve acontecer, enquanto o modelo tenta alinhar aparência, movimento, som e objetivo da cena.

A empresa afirma que o sistema se apoia no método Self-Flow, usado para alinhar geração e compreensão multimodal. Em termos simples, a abordagem tenta fazer com que o modelo entenda melhor como diferentes mídias representam o mesmo acontecimento. Isso é importante para prompts complexos, diálogos multilíngues e vídeos nos quais som e imagem precisam parecer sincronizados.

Por que o áudio nativo importa?

Áudio nativo reduz a dependência de ferramentas externas e melhora a coerência entre fala, ambiente, ação e movimento. Para criadores, isso pode acelerar protótipos, storyboards, anúncios e cenas conceituais.

FLUX 3 Video: Testes preliminares e comparação com rivais

Nos testes iniciais divulgados, a Black Forest Labs gerou clipes de 10 segundos em 720p com áudio. A empresa diz que o FLUX 3 Video foi preferido em comparações internas contra alguns concorrentes importantes do mercado de geração de vídeo por IA.

Modelo comparadoPreferência pelo FLUX 3Contexto
Grok Imagine VideoAté 69%Comparações preliminares de qualidade
Kling v3 Pro60%Avaliação ainda em desenvolvimento
Gemini Omni Flash e Seedance 2.052%Resultados próximos entre sistemas
Runway Gen-4.577%Teste interno com clipes curtos
Luma Ray 3.293%Maior diferença relatada pela empresa

Apesar dos números chamarem atenção, eles devem ser lidos com cautela. A própria Black Forest Labs informa que tanto o modelo quanto o sistema de avaliação ainda estão em desenvolvimento. Portanto, os resultados não equivalem a um benchmark independente, auditado ou definitivo.

O acesso antecipado ao FLUX 3 Video não significa lançamento público amplo: por enquanto, a entrada depende de solicitação e aprovação.

FLUX 3 Image, APIs e pesos privados

Além do vídeo, o FLUX 3 também deve chegar à geração e edição de imagens. A Black Forest Labs afirma que o FLUX 3 Image terá suporte a estilos variados, múltiplas proporções, diferentes resoluções, textos multilíngues e prompts mais complexos do que versões anteriores durante avaliações intermediárias de treinamento.

O acesso antecipado ao FLUX 3 Image está previsto para as próximas semanas. No futuro, a empresa planeja oferecer o ecossistema por APIs e pesos privados. Também há previsão de uma base FLUX 3 Dev com pesos abertos para imagem, vídeo, áudio e previsão de ações, o que pode atrair desenvolvedores, pesquisadores e estúdios interessados em adaptar o modelo.

IA generativa, robótica e previsão de ações

A ambição da Black Forest Labs vai além de criar vídeos realistas. A empresa posiciona o FLUX 3 como um passo rumo a modelos capazes de perceber, prever e agir em ambientes físicos e digitais. Essa direção conecta geração multimodal com robótica, automação e simulação de tarefas.

O trabalho de ação segue dois caminhos. O primeiro é a previsão de ações diretamente dentro do FLUX 3. O segundo envolve modelos especializados ajustados a partir do backbone de vídeo com menos dados específicos por tarefa. Um dos primeiros projetos parceiros é o FLUX-mimic, criado com a mimic robotics e testado em tarefas de produção na Audi.

Se essa estratégia funcionar, modelos de vídeo poderão deixar de ser apenas ferramentas criativas e passar a servir como base para treinamento de agentes, simulações industriais e sistemas que relacionam linguagem, percepção e ação. Ainda assim, há desafios relevantes: custo computacional, segurança, direitos autorais, controle de estilo, avaliação independente e risco de uso indevido em deepfakes.

Como solicitar acesso antecipado

Interessados podem solicitar acesso por meio do formulário divulgado pela Black Forest Labs. Como se trata de uma fase inicial, a disponibilidade tende a ser limitada e direcionada a criadores, empresas, pesquisadores e parceiros capazes de testar o FLUX 3 Video em cenários reais.

Considerações finais

O FLUX 3 Video chega como uma das apostas mais ambiciosas da Black Forest Labs na disputa por modelos multimodais. A geração de vídeos de até 20 segundos com áudio nativo, continuidade de cenas e suporte a texto, imagem, keyframes e clipes coloca o sistema em confronto direto com Runway, Kling, Luma, Grok, Gemini e Seedance. O avanço é promissor, mas ainda precisa ser confirmado por testes independentes e uso público em escala.

  1. O que é o FLUX 3 Video?

    É um modelo de IA para gerar vídeos com áudio nativo. Ele cria clipes de até 20 segundos a partir de texto, imagens, keyframes ou referências.

  2. O FLUX 3 Video já está disponível para todos?

    Não. Ele está em acesso antecipado. A entrada depende de solicitação pelo formulário oficial e aprovação da Black Forest Labs.

  3. O modelo gera áudio automaticamente?

    Sim. O FLUX 3 Video foi anunciado com áudio nativo, incluindo som ambiente, fala e diálogos multilíngues conforme o prompt.

  4. Quais rivais foram citados nos testes?

    A empresa comparou o modelo com Grok Imagine Video, Kling v3 Pro, Gemini Omni Flash, Seedance 2.0, Runway Gen-4.5 e Luma Ray 3.2.

  5. O FLUX 3 também terá versão para imagem?

    Sim. O FLUX 3 Image deve entrar em acesso antecipado nas próximas semanas, com edição, estilos variados e suporte a prompts complexos.

Diogo Fernando

Apaixonado por tecnologia e cultura pop, programo para resolver problemas e transformar vidas. Empreendedor e geek, busco novas ideias e desafios. Acredito na tecnologia como superpoder do século XXI.