Fontes acompanhadas em tempo real
compartilhei. Inteligência Artificial

Microsoft lança modelos próprios de IA MAI-Transcribe-2-Streaming e MAI-Voice-2.1 para voz

A Microsoft lançou três novos modelos próprios de inteligência artificial focados em fala e áudio: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e MAI-Voice-2.1-Flash. O modelo de transcrição em tempo real suporta 60 idiomas, atinge 2,5% de taxa de erro de palavras e tem preço promocional de US$ 0,54 por hora de áudio. Os modelos de voz cobrem 23 idiomas mantendo a identidade vocal nativa entre línguas, com preços de US$ 15 a US$ 22 por milhão de caracteres e suporte a clonagem de voz.

Confirmado Quando: 2 de outubro de 2026 Detectado em 2 de outubro de 2026 2 fontes

Ler a matéria completa →

O que se sabe

  • A Microsoft lançou três modelos proprietários de IA voltados para áudio: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e MAI-Voice-2.1-Flash.12
  • O MAI-Transcribe-2-Streaming é o primeiro modelo de transcrição em tempo real (streaming) desenvolvido pela Microsoft.21
  • O MAI-Transcribe-2-Streaming oferece suporte a 60 idiomas e detecção contínua e automática de troca de idiomas durante o diálogo.21
  • O MAI-Transcribe-2-Streaming estreou em primeiro lugar no benchmark da Artificial Analysis (AA-WER Streaming), registrando taxa de erro de palavra de 2,5%.21
  • O preço introdutório do MAI-Transcribe-2-Streaming é de US$ 0,54 por hora de áudio até o final do ano.21
  • O MAI-Voice-2.1 suporta 23 idiomas e 26 localidades, permitindo que uma mesma voz fale diferentes idiomas com sotaque nativo local.12
  • O MAI-Voice-2.1-Flash é otimizado para alta velocidade e volume, gerando 45 segundos de áudio com latência ponta a ponta de 150 milissegundos ao custo de US$ 15 por 1 milhão de caracteres.21
  • Os modelos foram disponibilizados por meio do Vercel AI Gateway e apresentados na demonstração Chatter dentro do MAI Playground.12
  • O modelo MAI-Transcribe-2-Streaming gera suas primeiras hipóteses de transcrição parcial em pouco mais de 100 milissegundos após receber o áudio.1
  • O MAI-Voice-2.1 tem custo fixado em US$ 22 por 1 milhão de caracteres.1
  • Ambos os modelos de voz oferecem suporte a clonagem vocal a partir de poucos segundos de áudio de referência e contam com salvaguardas de consentimento integradas.1
  • O lançamento visa fornecer tecnologia interna para desenvolvedores criarem agentes conversacionais e diminuir a dependência da Microsoft de fornecedores externos de IA.2

Cronologia

  1. Microsoft anuncia e disponibiliza os modelos MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e MAI-Voice-2.1-Flash

Quem está envolvido

M MAI-Transcribe-2-Streamingmodelo de transcrição lançado
M MAI-Voice-2.1modelo de voz lançado
M MAI-Voice-2.1-Flashmodelo de voz leve lançado
M Microsoftdesenvolvedora e lançadora dos modelos
VA Vercel AI Gatewayplataforma de distribuição

Fontes

  1. 1Our first streaming transcription model debuts at no. 1 on Artificial Analysis | Microsoft AI Microsoft (oficial) · 02 out 2026
  2. 2Microsoft: Novos modelos MAI reforçam IA desenvolvida internamente conectado.pt · 02 out 2026