NoticiasInteligência ArtificialTecnologia

Gemini 3.5 Transcribe: IA melhora transcrições

O Google anunciou o Gemini 3.5 Transcribe, modelo de transcrição inteligente que converte fala em texto formatado, reconhece contexto e busca reduzir erros em áudio ao vivo ou gravado. Segundo o comunicado da empresa, publicado em 26 de agosto de 2026, a tecnologia chega em preview público para desenvolvedores e organizações, além de recursos selecionados em Android e macOS. A proposta é ir além do reconhecimento de voz convencional: limpar hesitações, entender correções feitas durante a fala e preservar termos técnicos.

O que muda na prática

O Gemini 3.5 Transcribe foi desenhado para entregar texto mais limpo e utilizável, com baixa latência, vocabulário personalizado e compreensão do contexto da conversa.

Como funciona a transcrição em tempo real

O lançamento tem duas modalidades. A primeira é a transcrição em tempo real via Live API, identificada pelo modelo gemini-3.5-transcribe-live. Ela usa streaming bidirecional contínuo e, de acordo com o Google, foi pensada para aplicativos de voz interativos com latência inferior a um segundo. Isso inclui agentes de voz, atendimento automatizado e ferramentas de legendas em tempo real.

PUBLICIDADE

A segunda atende áudio pré-gravado, como reuniões, chamadas e entrevistas. Pela Interactions API, o modelo gemini-3.5-transcribe oferece identificação de locutores e carimbos de tempo por palavra. O recurso atribui falas para até três pessoas; o suporte a três ou mais locutores é classificado pela companhia como experimental.

  • Remove “hum”, “ah” e outras palavras de preenchimento.
  • Corrige autocorreções feitas naturalmente durante a fala.
  • Formata o texto para facilitar leitura e reaproveitamento.
  • Reconhece jargões e grafias com vocabulário personalizado.
  • Detecta mais de 85 idiomas, sotaques e dialetos.

Precisão, WER e avanço sobre o Chirp 3

O Google afirma que o Gemini 3.5 Transcribe supera o Chirp 3 em recursos, latência e precisão. A empresa cita medições da Artificial Analysis: taxa de erro de palavras, ou WER, média de 4,0% no streaming e de 2,6% no processamento sem streaming. Quanto menor o WER, menor a proporção de palavras reconhecidas incorretamente.

“Nossa mais precisa tecnologia de fala para texto até agora”, resume o anúncio do Google sobre o novo modelo.

Google, comunicado sobre Gemini 3.5 Transcribe

No benchmark FLEURS, em um conjunto de idiomas e localidades, o comunicado informa WER de 5,50% para streaming e 5,04% para casos sem streaming. A comparação também aponta melhoria de 70% no tempo até a transcrição final. Os números são divulgados pelo próprio Google e devem ser lidos como métricas de testes específicos, não como garantia idêntica para todos os áudios, microfones ou ambientes.

UsoModeloRecursos principais
Áudio ao vivogemini-3.5-transcribe-liveLive API e baixa latência
Áudio gravadogemini-3.5-transcribeLocutores e timestamps
Ditado diárioIntegrações GeminiTexto limpo e comandos de voz

Onde o Gemini 3.5 Transcribe estará disponível

Para desenvolvedores, o modelo entra em preview público na Gemini API pelo Google AI Studio e no Google Antigravity. Empresas podem testá-lo na Gemini Enterprise Agent Platform; a integração com Gemini Enterprise for Customer Experience está prevista para depois. O Google também cita parceiros como Agora, LangChain, LiveKit, Pipecat e Vercel, que ajudam a integrar infraestrutura de mídia e fala em aplicações.

No uso cotidiano, o Gemini 3.5 Transcribe aparece no Rambler do Gboard para Android, em países e idiomas selecionados, e no app Gemini para macOS em inglês. No macOS, a empresa diz que a transcrição pode acionar comandos e funções de outros modelos Gemini, como resumir arquivos locais ou gerar imagens. O recurso de digitar por voz em campos da web também foi anunciado como futuro para o Chrome.

Impacto para voz, atendimento e produtividade

Para equipes de produto, uma transcrição mais contextual pode diminuir a etapa de revisão manual de atas, registros de suporte e legendas. Em cenários de varejo e logística, reconhecer entidades alfanuméricas — como CEPs e IDs de pedido — é particularmente relevante. Ainda assim, empresas devem validar resultados em seu vocabulário, ruído ambiente, idioma e regras de privacidade antes de automatizar decisões com base em transcrições.

O anúncio também reforça a disputa por interfaces orientadas por voz. A diferença prometida pelo Gemini 3.5 Transcribe é combinar reconhecimento de fala, limpeza textual e contexto de uso na mesma experiência. Seu desempenho real dependerá da disponibilidade regional, do preço das APIs e da qualidade do áudio fornecido ao modelo.

  1. O que é o Gemini 3.5 Transcribe?

    É o modelo de fala para texto do Google. Ele transcreve áudio ao vivo ou gravado, formata a escrita e lida com contexto, hesitações e vocabulário personalizado.

  2. Qual a diferença entre Live API e Interactions API?

    A Live API atende transcrição em tempo real. A Interactions API processa áudio pré-gravado e adiciona identificação de locutores e carimbos de tempo por palavra.

  3. Quantos idiomas o Gemini 3.5 Transcribe suporta?

    Segundo o Google, o modelo detecta e transcreve mais de 85 idiomas. A disponibilidade de recursos integrados pode variar por país, idioma e plataforma.

  4. O Gemini 3.5 Transcribe já está disponível?

    O Google anunciou preview público no Google AI Studio e na plataforma empresarial. Android e macOS têm disponibilidade limitada, enquanto o Chrome foi citado como futuro.

Considerações finais

O Gemini 3.5 Transcribe amplia a estratégia do Google para experiências de voz, reunindo transcrição em tempo real, áudio pré-gravado, WER competitivo e integrações com a Gemini API. A promessa é transformar fala espontânea em texto mais útil. Para desenvolvedores e empresas, o próximo passo é testar o modelo em casos reais, medir precisão e avaliar os requisitos de dados e segurança.

PUBLICIDADE

Diogo Fernando

Apaixonado por tecnologia e cultura pop, programo para resolver problemas e transformar vidas. Empreendedor e geek, busco novas ideias e desafios. Acredito na tecnologia como superpoder do século XXI.