MAI-Transcribe-2-Streaming chega com baixa latência
O MAI-Transcribe-2-Streaming é o novo modelo de fala para texto da Microsoft AI para transcrição em tempo real. Segundo anúncio publicado em 2 de outubro de 2026, a ferramenta atende 60 idiomas, identifica trocas de língua continuamente e começa a exibir hipóteses parciais pouco depois de 100 milissegundos de áudio.
O lançamento vem acompanhado do MAI-Voice-2.1 e do MAI-Voice-2.1-Flash, formando uma pilha para agentes de voz que precisam ouvir, processar informações, usar ferramentas e responder sem pausas longas.
Na prática, o MAI-Transcribe-2-Streaming permite que aplicativos iniciem o raciocínio antes de o usuário terminar a frase, com potencial para ditado, legendas ao vivo e atendimento conversacional mais ágil.
Tabela de conteúdos
O que muda na transcrição em streaming
Diferentemente de sistemas que esperam o fim da fala para devolver uma frase completa, o MAI-Transcribe-2-Streaming entrega transcrições parciais, revisa o texto à medida que recebe mais contexto e consolida trechos estáveis rapidamente. Esse fluxo reduz a latência percebida: legendas podem surgir enquanto a pessoa fala e um agente pode preparar uma busca, uma resposta ou uma chamada de ferramenta antes do encerramento da pergunta.
“Accurate streaming transcription. Natural speech and less waiting between turns.”
Microsoft AI, anúncio dos três modelos em 1º de outubro de 2026
A Microsoft afirma que o modelo lidera o ranking da Artificial Analysis para precisão de transcrições finais e parciais. A declaração é da empresa e deve ser lida junto com a metodologia e a data de atualização do benchmark, pois resultados podem mudar conforme conjuntos de testes, idiomas, ruído e condições de uso. Em seus testes internos, a companhia também diz que palavras aparecem até duas vezes mais rápido do que no concorrente mais próximo para ditado e legendagem em tempo real.
Idiomas, preço e casos de uso
O MAI-Transcribe-2-Streaming cobre 60 idiomas com detecção automática e contínua de idioma. O recurso é relevante para reuniões internacionais, suporte multilíngue, educação e assistentes que recebem mensagens em mais de uma língua. O preço promocional informado é de US$ 0,54 por hora de áudio até o fim do ano, sem que o anúncio detalhado especifique eventuais condições posteriores.
- Legendas ao vivo: texto aparece durante a fala.
- Ditado: revisão gradual melhora a resposta imediata.
- Atendimento: agentes de voz antecipam a próxima ação.
- Tutoria: a conversa pode alternar idiomas naturalmente.
- Ferramentas: o agente consulta sistemas durante a fala.
MAI-Voice-2.1 e Flash completam a resposta falada
Enquanto o MAI-Transcribe-2-Streaming escuta e converte voz em texto, o MAI-Voice-2.1 transforma texto em fala. A versão padrão atende 23 idiomas e 26 localidades, preservando uma identidade de voz entre línguas, com sotaque e formulações locais. Para uma plataforma de ensino, por exemplo, isso pode permitir a troca de idioma sem trocar a voz do professor virtual. O valor divulgado é de US$ 22 por milhão de caracteres.
| Modelo | Função | Dado anunciado | Preço informado |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Fala para texto | 60 idiomas; pouco mais de 100 ms | US$ 0,54/hora* |
| MAI-Voice-2.1 | Texto para fala | 23 idiomas e 26 localidades | US$ 22/milhão |
| MAI-Voice-2.1-Flash | Texto para fala veloz | 45 s de áudio em 150 ms | US$ 15/milhão |
O MAI-Voice-2.1-Flash é a opção voltada a grande volume e baixa latência. A Microsoft declara inferência 55% mais rápida e custo cerca de 60% menor que modelos comparáveis. Os dois modelos de voz podem clonar uma voz a partir de poucos segundos de referência para idiomas suportados. A empresa informa a presença de guardrails de consentimento; ainda assim, organizações devem obter autorização explícita, definir retenção de áudio e testar controles contra imitação indevida antes de colocar esse recurso em produção.

Baixa latência é mais do que velocidade
Em agentes conversacionais, cada espera entre ouvir, raciocinar e falar quebra o ritmo. Transcrições parciais confiáveis reduzem esse intervalo, mas exigem tratamento de correções para evitar respostas baseadas em texto ainda instável.
Como desenvolvedores podem acessar os modelos
Segundo a Microsoft, os modelos de voz estão disponíveis via OpenRouter, enquanto os três modelos podem ser acessados no Microsoft Foundry, MAI Playground, Vercel e Azure Voice Live. A integração com LiveKit foi anunciada como futura. A documentação do MAI-Transcribe-2-Streaming identifica o Foundry como prévia pública e descreve acesso por WebSocket compatível com OpenAI Realtime ou pelo Azure Speech SDK.
Antes de migrar um produto, vale medir qualidade por idioma, taxa de correções parciais, tempo de resposta ponta a ponta, custo por sessão e desempenho com sotaques, ruído e conexões móveis. A demonstração Chatter, no MAI Playground, reúne os componentes e pode servir como referência inicial, mas não substitui testes com o áudio e as regras de privacidade de cada operação.
Perguntas frequentes
O que é o MAI-Transcribe-2-Streaming?
É o modelo de fala para texto em streaming da Microsoft AI. Ele gera transcrições parciais em pouco mais de 100 ms e consolida o texto com a chegada de contexto.
Quantos idiomas o modelo de transcrição suporta?
A Microsoft informa suporte a 60 idiomas com detecção automática contínua. O desempenho prático deve ser validado por idioma, sotaque, ruído e cenário de uso.
Qual é o preço do MAI-Transcribe-2-Streaming?
O preço introdutório divulgado é de US$ 0,54 por hora de áudio até o fim de 2026. Empresas devem confirmar valores e disponibilidade na plataforma escolhida.
Onde usar a API de transcrição em streaming?
A documentação cita Microsoft Foundry em prévia pública, WebSocket compatível com OpenAI Realtime e Azure Speech SDK. Há também acesso pelos canais anunciados pela Microsoft.
Considerações finais
O MAI-Transcribe-2-Streaming reforça a aposta da Microsoft AI em uma cadeia completa de voz: transcrever, interpretar e responder no tempo de uma conversa. Seus números de latência, idiomas e preço são promissores para agentes de voz, mas a decisão de adoção deve combinar testes independentes, avaliação de privacidade e comparação de custo total. Para equipes que já usam Microsoft Foundry ou Azure Voice Live, a compatibilidade anunciada pode encurtar o caminho de experimentação.
Fontes: anúncio da Microsoft AI

