
FLUX 3 Video abre acesso antecipado com áudio
Atualizado em 29 de julho de 2026: a Black Forest Labs abriu o acesso antecipado ao FLUX 3 Video, sistema de IA capaz de gerar vídeos de até 20 segundos com áudio nativo a partir de texto, imagens, quadros-chave ou clipes de referência. A novidade marca a primeira parte disponível do FLUX 3, um modelo de base multimodal treinado conjuntamente em imagem, vídeo e áudio. Segundo a empresa, o objetivo é aproximar geração visual, som, linguagem e previsão de ações em uma arquitetura unificada.
Tabela de conteúdos
O que é o FLUX 3 Video
O FLUX 3 Video é uma ferramenta de geração de vídeo por inteligência artificial criada pela Black Forest Labs, mesma empresa associada à família de modelos FLUX para criação de imagens. Na prática, o sistema permite transformar instruções em vídeo, continuar cenas já existentes, preservar personagens entre tomadas e criar sequências com múltiplos planos.
A diferença central está no áudio nativo. Em vez de gerar apenas imagem em movimento e depender de uma etapa separada para som, o modelo cria vídeo e áudio dentro do mesmo processo. Isso pode incluir efeitos sonoros, ambiente, fala e diálogos multilíngues, dependendo do prompt e dos materiais de referência usados.
“Um modelo multimodal para imagem, vídeo, áudio e previsão de ações. As criações são mais fiéis à vida em todos os estilos.”
Black Forest Labs, anúncio oficial do FLUX 3
Como funciona a geração por texto, imagem e clipes do FLUX 3 Video
De acordo com a Black Forest Labs, o FLUX 3 Video aceita diferentes entradas. O usuário pode começar com uma descrição em texto, enviar uma imagem, definir keyframes ou usar um clipe de referência. A partir disso, o modelo interpreta aparência, movimento e som como partes do mesmo evento, não como tarefas isoladas.
- Texto para vídeo com áudio nativo.
- Imagem para vídeo com movimento coerente.
- Keyframes para controlar início e fim.
- Clipes de referência para estilo e ação.
- Continuação de vídeo e áudio existentes.
- Preservação de personagens entre cenas.
Esse desenho técnico busca resolver uma limitação comum em geradores de vídeo com IA: a perda de consistência entre planos. Se o modelo consegue carregar elementos centrais, como um personagem, um objeto ou um cenário, fica mais fácil criar narrativas curtas com continuidade visual e sonora.
Arquitetura multimodal e método Self-Flow
O FLUX 3 foi treinado em uma arquitetura unificada para aprender relações entre imagem, vídeo e áudio. A linguagem funciona como ponte entre percepção e instrução: ela descreve o que deve acontecer, enquanto o modelo tenta alinhar aparência, movimento, som e objetivo da cena.
A empresa afirma que o sistema se apoia no método Self-Flow, usado para alinhar geração e compreensão multimodal. Em termos simples, a abordagem tenta fazer com que o modelo entenda melhor como diferentes mídias representam o mesmo acontecimento. Isso é importante para prompts complexos, diálogos multilíngues e vídeos nos quais som e imagem precisam parecer sincronizados.
Por que o áudio nativo importa?
Áudio nativo reduz a dependência de ferramentas externas e melhora a coerência entre fala, ambiente, ação e movimento. Para criadores, isso pode acelerar protótipos, storyboards, anúncios e cenas conceituais.
FLUX 3 Video: Testes preliminares e comparação com rivais
Nos testes iniciais divulgados, a Black Forest Labs gerou clipes de 10 segundos em 720p com áudio. A empresa diz que o FLUX 3 Video foi preferido em comparações internas contra alguns concorrentes importantes do mercado de geração de vídeo por IA.
| Modelo comparado | Preferência pelo FLUX 3 | Contexto |
| Grok Imagine Video | Até 69% | Comparações preliminares de qualidade |
| Kling v3 Pro | 60% | Avaliação ainda em desenvolvimento |
| Gemini Omni Flash e Seedance 2.0 | 52% | Resultados próximos entre sistemas |
| Runway Gen-4.5 | 77% | Teste interno com clipes curtos |
| Luma Ray 3.2 | 93% | Maior diferença relatada pela empresa |
Apesar dos números chamarem atenção, eles devem ser lidos com cautela. A própria Black Forest Labs informa que tanto o modelo quanto o sistema de avaliação ainda estão em desenvolvimento. Portanto, os resultados não equivalem a um benchmark independente, auditado ou definitivo.
O acesso antecipado ao FLUX 3 Video não significa lançamento público amplo: por enquanto, a entrada depende de solicitação e aprovação.
FLUX 3 Image, APIs e pesos privados
Além do vídeo, o FLUX 3 também deve chegar à geração e edição de imagens. A Black Forest Labs afirma que o FLUX 3 Image terá suporte a estilos variados, múltiplas proporções, diferentes resoluções, textos multilíngues e prompts mais complexos do que versões anteriores durante avaliações intermediárias de treinamento.
O acesso antecipado ao FLUX 3 Image está previsto para as próximas semanas. No futuro, a empresa planeja oferecer o ecossistema por APIs e pesos privados. Também há previsão de uma base FLUX 3 Dev com pesos abertos para imagem, vídeo, áudio e previsão de ações, o que pode atrair desenvolvedores, pesquisadores e estúdios interessados em adaptar o modelo.
IA generativa, robótica e previsão de ações
A ambição da Black Forest Labs vai além de criar vídeos realistas. A empresa posiciona o FLUX 3 como um passo rumo a modelos capazes de perceber, prever e agir em ambientes físicos e digitais. Essa direção conecta geração multimodal com robótica, automação e simulação de tarefas.
O trabalho de ação segue dois caminhos. O primeiro é a previsão de ações diretamente dentro do FLUX 3. O segundo envolve modelos especializados ajustados a partir do backbone de vídeo com menos dados específicos por tarefa. Um dos primeiros projetos parceiros é o FLUX-mimic, criado com a mimic robotics e testado em tarefas de produção na Audi.
Se essa estratégia funcionar, modelos de vídeo poderão deixar de ser apenas ferramentas criativas e passar a servir como base para treinamento de agentes, simulações industriais e sistemas que relacionam linguagem, percepção e ação. Ainda assim, há desafios relevantes: custo computacional, segurança, direitos autorais, controle de estilo, avaliação independente e risco de uso indevido em deepfakes.
Como solicitar acesso antecipado
Interessados podem solicitar acesso por meio do formulário divulgado pela Black Forest Labs. Como se trata de uma fase inicial, a disponibilidade tende a ser limitada e direcionada a criadores, empresas, pesquisadores e parceiros capazes de testar o FLUX 3 Video em cenários reais.
Considerações finais
O FLUX 3 Video chega como uma das apostas mais ambiciosas da Black Forest Labs na disputa por modelos multimodais. A geração de vídeos de até 20 segundos com áudio nativo, continuidade de cenas e suporte a texto, imagem, keyframes e clipes coloca o sistema em confronto direto com Runway, Kling, Luma, Grok, Gemini e Seedance. O avanço é promissor, mas ainda precisa ser confirmado por testes independentes e uso público em escala.
O que é o FLUX 3 Video?
É um modelo de IA para gerar vídeos com áudio nativo. Ele cria clipes de até 20 segundos a partir de texto, imagens, keyframes ou referências.
O FLUX 3 Video já está disponível para todos?
Não. Ele está em acesso antecipado. A entrada depende de solicitação pelo formulário oficial e aprovação da Black Forest Labs.
O modelo gera áudio automaticamente?
Sim. O FLUX 3 Video foi anunciado com áudio nativo, incluindo som ambiente, fala e diálogos multilíngues conforme o prompt.
Quais rivais foram citados nos testes?
A empresa comparou o modelo com Grok Imagine Video, Kling v3 Pro, Gemini Omni Flash, Seedance 2.0, Runway Gen-4.5 e Luma Ray 3.2.
O FLUX 3 também terá versão para imagem?
Sim. O FLUX 3 Image deve entrar em acesso antecipado nas próximas semanas, com edição, estilos variados e suporte a prompts complexos.
