IA

Uma equipe de 10 pessoas na Microsoft criou um modelo de voz mais barato e rápido do que OpenAI e Google

Adrian Kessler

O modelo se chama MAI-Transcribe-2. A Microsoft AI, divisão liderada por Mustafa Suleyman, o lançou em 3 de setembro a US$ 0,10 por hora de áudio — valor válido até o fim de 2026. A versão anterior, MAI-Transcribe-1.5, custava US$ 0,36 por hora. Essa redução de 72% no preço não é um arredondamento de marketing. Um contact center que processa 100 mil horas de áudio por ano pagava US$ 36 mil pelo modelo anterior; a mesma carga de trabalho agora custa US$ 10 mil.

O desempenho nos benchmarks é o que torna o preço incomum. Na avaliação multilíngue FLEURS, o MAI-Transcribe-2 ocupa o primeiro lugar entre 60 idiomas, com uma taxa média de erro de palavras de 5,2% — melhor que o GPT-Transcribe da OpenAI, o Gemini 3.5 Transcribe do Google, o ElevenLabs Scribe v2 e o Whisper V3-Large da Meta. No ranking do Artificial Analysis, que acompanha precisão e latência juntas, o modelo fica em segundo lugar geral e define o que os pesquisadores chamam de fronteira de Pareto — o limite além do qual não é possível melhorar uma métrica sem degradar a outra. O modelo foi treinado para ficar na borda eficiente dessa fronteira, não para perseguir o topo de qualquer tabela de métrica única.

Velocidade é a segunda alegação que vale examinar. A Microsoft afirma que o MAI-Transcribe-2 processa áudio 10 vezes mais rápido que o GPT-Transcribe, 7 vezes mais rápido que o ElevenLabs Scribe v2 e 5 vezes mais rápido que o Gemini 3.5 Transcribe. Para áudio de formato longo — transcrição de podcasts, depoimentos jurídicos, notas clínicas — essa diferença determina se um fluxo de trabalho leva segundos ou minutos. O modelo também faz diarização de falantes (identificar quem falou quando), timestamps em nível de palavra, ajuste de palavras-chave para terminologia de domínio e suporte a code-switching para idiomas que se misturam no meio da frase, citando especificamente hinglish e spanglish como exemplos testados.

A equipe que o construiu é notável na proporção do que construiu. A Microsoft descreve o grupo central como 10 pessoas, operando com burocracia interna mínima e apoiadas por equipes maiores que cuidam da aquisição de dados e do gerenciamento de fornecedores. A alegação resultante de eficiência de GPU é específica: o MAI-Transcribe-2 roda com metade do custo de GPU dos modelos concorrentes de última geração. Se isso se mantém sob carga empresarial em escala não é verificável a partir do anúncio, mas a alegação de arquitetura é precisa o suficiente para ser testada.

O modelo já está disponível no Microsoft Foundry, no MAI Playground e no Open Router — o que significa que o acesso não exige um contrato Azure ou um relacionamento empresarial com a Microsoft. Essa amplitude de distribuição é deliberada. O avanço da Microsoft AI em APIs diretas para desenvolvedores faz parte de um reposicionamento mais amplo após a reestruturação da parceria com a OpenAI. Emendas em outubro de 2025 e abril de 2026 eliminaram os acordos de exclusividade e divisão de receita que definiam a relação desde 2019. A Microsoft agora tem um incentivo direto para competir na camada de modelos, em vez de apenas distribuir o resultado da OpenAI.

O preço de US$ 0,10 é marcado como válido até o fim de 2026. O preço padrão após essa data não foi divulgado. Compradores que avaliam o MAI-Transcribe-2 para cargas de trabalho de produção estão precificando um produto cujo custo não conhecem para o ano-calendário de 2027. Esse é um risco que vale nomear claramente, mesmo que a taxa atual torne o modelo atraente contra todas as alternativas visíveis.

Tags: , , , , ,

Discussão

Há 0 comentários.