A Microsoft anunciou, em 1º de outubro, três novos modelos para desenvolver agentes de IA por voz: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e MAI-Voice-2.1-Flash. As ferramentas atuam em duas etapas da conversa: transformar a fala do usuário em texto e converter respostas escritas em áudio.
A proposta atende a um desafio do atendimento automatizado: reduzir a espera entre uma pergunta e sua resposta. Para isso, a empresa combina transcrição contínua com geração de voz, oferecendo componentes que desenvolvedores podem integrar aos próprios sistemas.
Além de centrais de atendimento, as novidades abrem possibilidades para assistentes multilíngues, aplicativos educacionais e interfaces que recebem comandos falados. Entretanto, cada modelo cumpre uma função específica, e a aplicação precisa conectar essas etapas para oferecer uma experiência completa.
Como funciona a transcrição em tempo real da Microsoft?
O MAI-Transcribe-2-Streaming transforma áudio em texto enquanto a pessoa fala. Segundo a Microsoft, o modelo reconhece 60 idiomas e identifica automaticamente a língua da conversa.
Em vez de aguardar o fim da fala, ele entrega versões parciais da transcrição. Depois, revisa essas hipóteses conforme recebe mais contexto e confirma os segmentos do texto.
A Microsoft informa que o modelo alcançou a primeira posição em precisão de transcrições parciais e finais no ranking da Artificial Analysis. Além disso, afirma que ele começa a produzir hipóteses pouco mais de 100 milissegundos após receber áudio. Esses números descrevem avaliações específicas, e não o tempo total de resposta de um atendimento.
Na prática, essa abordagem permite que uma aplicação acompanhe o pedido progressivamente. Contudo, como os resultados iniciais podem mudar, o desenvolvedor precisa distinguir uma hipótese provisória de uma informação já confirmada.
O que muda com o MAI-Voice-2.1 e a versão Flash?
Enquanto o modelo de transcrição recebe áudio e entrega texto, os modelos MAI-Voice fazem o caminho inverso. Eles transformam respostas escritas em fala.
O MAI-Voice-2.1 prioriza expressividade e qualidade, com aplicações como narração e produção de conteúdo. Já o MAI-Voice-2.1-Flash concentra sua proposta em situações que exigem respostas rápidas, como assistentes e centrais de atendimento.
Ambos oferecem suporte a 23 idiomas. A página oficial também inclui o português do Brasil entre as opções disponíveis, um ponto relevante para empresas que pretendem desenvolver experiências para o público brasileiro.
Além disso, a documentação apresenta controles de estilo e emoção da fala. Assim, desenvolvedores podem ajustar a apresentação da resposta ao contexto da aplicação, em vez de utilizar sempre a mesma entonação.
Para conteúdos extensos, a Microsoft destaca a consistência da voz ao longo da geração. Já em experiências interativas, a versão Flash busca diminuir a demora na produção do áudio.
Como os agentes de IA por voz se conectam a APIs?
A transcrição e a geração de áudio representam partes de uma aplicação maior. Entre ouvir o usuário e responder, o sistema ainda precisa interpretar o pedido, consultar informações e decidir o próximo passo.
A documentação da Microsoft apresenta duas formas de integrar o MAI-Transcribe-2-Streaming: uma API em tempo real, com conexão WebSocket, e o Azure Speech SDK. A primeira permite trocar dados continuamente; a segunda oferece uma biblioteca que auxilia no gerenciamento da conexão e do envio de áudio.
Para ilustrar uma possível aplicação, imagine um assistente que informa o andamento de pedidos. A transcrição transforma a pergunta em texto. Em seguida, a aplicação consulta o sistema de vendas por uma API e organiza a resposta. Por fim, o modelo de voz converte essa resposta em áudio.
Nesse exemplo, a integração com o sistema de vendas é uma etapa que a equipe precisa desenvolver. Os modelos de áudio, isoladamente, não fornecem acesso automático ao histórico de compras ou ao cadastro do cliente.
Portanto, o resultado depende tanto da qualidade da voz quanto da conexão com informações corretas e atualizadas.
Quais aplicações podem aproveitar os novos modelos?
A Microsoft cita usos como atendimento ao cliente, assistentes multilíngues, experiências educacionais e legendas ao vivo. Nessas situações, acompanhar a fala continuamente pode ajudar a reduzir pausas e apresentar informações com mais agilidade.
Em uma aplicação educacional, por exemplo, a equipe pode combinar exercícios falados com respostas em áudio. Já em reuniões, a transcrição pode apoiar a exibição de legendas enquanto os participantes conversam.
No entanto, cada cenário exige uma avaliação própria. Um serviço de atendimento precisa testar nomes de produtos e termos do negócio. Da mesma forma, uma ferramenta educacional deve verificar se a pronúncia e o reconhecimento atendem ao conteúdo das aulas.
Esses testes ajudam a entender o desempenho no uso pretendido, além dos resultados que o fornecedor apresenta em avaliações gerais.
Quanto custam os modelos e como começar?
No anúncio, a Microsoft informou um preço introdutório de US$ 0,54 por hora de áudio para o MAI-Transcribe-2-Streaming até o fim de 2026. Para geração de voz, os valores divulgados são US$ 22 por milhão de caracteres no MAI-Voice-2.1 e US$ 15 por milhão de caracteres na versão Flash.
A empresa disponibiliza os modelos no Microsoft Foundry, com acesso por Azure Speech e APIs.
Entretanto, a documentação classifica a transcrição em streaming como prévia pública, sem acordo de nível de serviço, e não recomenda seu uso em cargas de produção nessa fase. Portanto, a disponibilidade para testes não equivale a uma garantia de operação para um atendimento crítico.
O que avaliar antes de adotar agentes de IA por voz?
Para empresas interessadas, o próximo passo é testar a experiência completa: reconhecimento da fala, consulta aos sistemas e reprodução da resposta. Além disso, convém medir o custo por interação e definir quando o atendimento deve passar para uma pessoa.
Os novos modelos ampliam as opções para construir essas aplicações. Ainda assim, uma conversa eficiente depende da combinação entre áudio, integração e regras claras para executar cada tarefa.
![]()









