
Gemini 3.5 Transcribe: IA melhora transcrições
O Google anunciou o Gemini 3.5 Transcribe, modelo de transcrição inteligente que converte fala em texto formatado, reconhece contexto e busca reduzir erros em áudio ao vivo ou gravado. Segundo o comunicado da empresa, publicado em 26 de agosto de 2026, a tecnologia chega em preview público para desenvolvedores e organizações, além de recursos selecionados em Android e macOS. A proposta é ir além do reconhecimento de voz convencional: limpar hesitações, entender correções feitas durante a fala e preservar termos técnicos.
O que muda na prática
O Gemini 3.5 Transcribe foi desenhado para entregar texto mais limpo e utilizável, com baixa latência, vocabulário personalizado e compreensão do contexto da conversa.
Tabela de conteúdos
Como funciona a transcrição em tempo real
O lançamento tem duas modalidades. A primeira é a transcrição em tempo real via Live API, identificada pelo modelo gemini-3.5-transcribe-live. Ela usa streaming bidirecional contínuo e, de acordo com o Google, foi pensada para aplicativos de voz interativos com latência inferior a um segundo. Isso inclui agentes de voz, atendimento automatizado e ferramentas de legendas em tempo real.
A segunda atende áudio pré-gravado, como reuniões, chamadas e entrevistas. Pela Interactions API, o modelo gemini-3.5-transcribe oferece identificação de locutores e carimbos de tempo por palavra. O recurso atribui falas para até três pessoas; o suporte a três ou mais locutores é classificado pela companhia como experimental.
- Remove “hum”, “ah” e outras palavras de preenchimento.
- Corrige autocorreções feitas naturalmente durante a fala.
- Formata o texto para facilitar leitura e reaproveitamento.
- Reconhece jargões e grafias com vocabulário personalizado.
- Detecta mais de 85 idiomas, sotaques e dialetos.
Precisão, WER e avanço sobre o Chirp 3
O Google afirma que o Gemini 3.5 Transcribe supera o Chirp 3 em recursos, latência e precisão. A empresa cita medições da Artificial Analysis: taxa de erro de palavras, ou WER, média de 4,0% no streaming e de 2,6% no processamento sem streaming. Quanto menor o WER, menor a proporção de palavras reconhecidas incorretamente.
“Nossa mais precisa tecnologia de fala para texto até agora”, resume o anúncio do Google sobre o novo modelo.
Google, comunicado sobre Gemini 3.5 Transcribe
No benchmark FLEURS, em um conjunto de idiomas e localidades, o comunicado informa WER de 5,50% para streaming e 5,04% para casos sem streaming. A comparação também aponta melhoria de 70% no tempo até a transcrição final. Os números são divulgados pelo próprio Google e devem ser lidos como métricas de testes específicos, não como garantia idêntica para todos os áudios, microfones ou ambientes.
| Uso | Modelo | Recursos principais |
|---|---|---|
| Áudio ao vivo | gemini-3.5-transcribe-live | Live API e baixa latência |
| Áudio gravado | gemini-3.5-transcribe | Locutores e timestamps |
| Ditado diário | Integrações Gemini | Texto limpo e comandos de voz |
Onde o Gemini 3.5 Transcribe estará disponível
Para desenvolvedores, o modelo entra em preview público na Gemini API pelo Google AI Studio e no Google Antigravity. Empresas podem testá-lo na Gemini Enterprise Agent Platform; a integração com Gemini Enterprise for Customer Experience está prevista para depois. O Google também cita parceiros como Agora, LangChain, LiveKit, Pipecat e Vercel, que ajudam a integrar infraestrutura de mídia e fala em aplicações.
No uso cotidiano, o Gemini 3.5 Transcribe aparece no Rambler do Gboard para Android, em países e idiomas selecionados, e no app Gemini para macOS em inglês. No macOS, a empresa diz que a transcrição pode acionar comandos e funções de outros modelos Gemini, como resumir arquivos locais ou gerar imagens. O recurso de digitar por voz em campos da web também foi anunciado como futuro para o Chrome.
Impacto para voz, atendimento e produtividade
Para equipes de produto, uma transcrição mais contextual pode diminuir a etapa de revisão manual de atas, registros de suporte e legendas. Em cenários de varejo e logística, reconhecer entidades alfanuméricas — como CEPs e IDs de pedido — é particularmente relevante. Ainda assim, empresas devem validar resultados em seu vocabulário, ruído ambiente, idioma e regras de privacidade antes de automatizar decisões com base em transcrições.
O anúncio também reforça a disputa por interfaces orientadas por voz. A diferença prometida pelo Gemini 3.5 Transcribe é combinar reconhecimento de fala, limpeza textual e contexto de uso na mesma experiência. Seu desempenho real dependerá da disponibilidade regional, do preço das APIs e da qualidade do áudio fornecido ao modelo.
O que é o Gemini 3.5 Transcribe?
É o modelo de fala para texto do Google. Ele transcreve áudio ao vivo ou gravado, formata a escrita e lida com contexto, hesitações e vocabulário personalizado.
Qual a diferença entre Live API e Interactions API?
A Live API atende transcrição em tempo real. A Interactions API processa áudio pré-gravado e adiciona identificação de locutores e carimbos de tempo por palavra.
Quantos idiomas o Gemini 3.5 Transcribe suporta?
Segundo o Google, o modelo detecta e transcreve mais de 85 idiomas. A disponibilidade de recursos integrados pode variar por país, idioma e plataforma.
O Gemini 3.5 Transcribe já está disponível?
O Google anunciou preview público no Google AI Studio e na plataforma empresarial. Android e macOS têm disponibilidade limitada, enquanto o Chrome foi citado como futuro.
Considerações finais
O Gemini 3.5 Transcribe amplia a estratégia do Google para experiências de voz, reunindo transcrição em tempo real, áudio pré-gravado, WER competitivo e integrações com a Gemini API. A promessa é transformar fala espontânea em texto mais útil. Para desenvolvedores e empresas, o próximo passo é testar o modelo em casos reais, medir precisão e avaliar os requisitos de dados e segurança.
