IA

A IA de voz da OpenAI não espera mais a sua vez — custa $0,05 por minuto

Susan Hill

Toda IA de voz no mercado hoje te diz para esperar antes de falar. A GPT-Live-1, da OpenAI, não. O modelo, disponível via API da OpenAI, ouve e fala simultaneamente — lidando com interrupções, pausas e fala sobreposta do jeito que uma pessoa faz numa ligação.

O preço é de US$ 0,05 por minuto para a camada de voz — US$ 1,50 para uma conversa de 30 minutos, ou US$ 50 para cada 1.000 minutos de conversa. Desenvolvedores pagam separadamente por um backend de raciocínio: a própria GPT-6 Astra da OpenAI ou qualquer modelo compatível que cuide de chamadas de ferramentas e lógica de negócio. A camada de voz gerencia a mecânica da conversa; a camada de raciocínio decide o que a IA realmente diz e faz.

O que essa separação significa na prática: um bot de atendimento pode ouvir “espera, na verdade quero a outra opção” no meio da frase e responder a isso, em vez de seguir com uma resposta pronta. Um tutor de idiomas pode perceber um aluno tropeçando numa palavra sem esperar que ele termine. Um sistema de reservas pode lidar com aquele tipo de chamada real onde as pessoas se repetem, mudam de ideia e falam umas por cima das outras.

No Full Duplex Bench — a avaliação criada especificamente para testar o manuseio de voz em direção simultânea — a GPT-Live-1 marca 30 pontos percentuais a mais que sua antecessora, a GPT-Realtime-2.1. Quando emparelhada com a GPT-6 Astra como backend de raciocínio, ela supera o Tau3, o benchmark de atendimento que testa consultas complexas e de múltiplas etapas sem pausas na conversa.

A arquitetura de duas camadas reflete uma escolha de design deliberada. O timing da fala e o raciocínio são cobrados separadamente porque escalam de forma diferente: uma startup construindo um aplicativo leve de tutoria paga menos em ambas as camadas do que uma empresa operando milhares de chamadas de atendimento simultâneas na GPT-6 Astra. O piso é de US$ 0,05 por minuto para voz, independentemente do que roda por trás.

O que a GPT-Live-1 não muda é a qualidade das respostas. A camada de voz lida com quando e como a IA fala — não com o que ela sabe. Uma resposta ruim no timing certo continua sendo uma resposta ruim. Desenvolvedores criando aplicações de atendimento precisarão avaliar ambas as camadas separadamente, e o backend de raciocínio pode adicionar mais à conta do que a própria camada de voz. A OpenAI também não publicou dados sobre como a arquitetura full-duplex se comporta em ambientes de baixa largura de banda ou em linhas telefônicas ruidosas, onde a entrada contínua de áudio é mais difícil de sustentar.

A GPT-Live-1 já está disponível na API da OpenAI. A empresa não anunciou um produto voltado ao consumidor construído sobre o modelo, embora tenha indicado que versões futuras do modo de voz do ChatGPT podem se basear na mesma arquitetura subjacente. A tarifa de US$ 0,05 por minuto se aplica no lançamento; a OpenAI não publicou um cronograma para mudanças de preço nem uma lista de modelos de raciocínio de terceiros aprovados para uso com a camada de voz.

Tags: , , , , ,

Discussão

Há 0 comentários.