IA

ElevenLabs v4 clona sua voz com 10 segundos de áudio e faz ela falar 90 idiomas

Susan Hill
Adicione-nos no Google

A ElevenLabs lançou o Eleven v4, um modelo de conversão de texto em fala que lê textos em voz alta com uma risada, um suspiro ou um sotaque francês irritado, sempre que o autor pedir. A clonagem instantânea de voz precisa de uma gravação mais curta que uma mensagem de voz, e a voz clonada pode então falar dezenas de idiomas sem perder o timbre original. Qualquer pessoa com uma conta gratuita na ElevenLabs pode usar o modelo.

Para quem trabalha com áudio, isso elimina dias inteiros de trabalho. Um podcaster pode dublar um episódio em japonês com a própria voz; um desenvolvedor de jogos independentes pode dar uma interpretação diferente a cada personagem secundário sem precisar reservar um estúdio; e um narrador de audiolivros pode inserir uma pausa ou uma risada diretamente no roteiro. O outro lado da moeda é igualmente concreto: uma mensagem de voz, um trecho de uma videochamada ou alguns segundos de uma publicação pública agora bastam para criar uma cópia convincente de alguém.

A principal mudança está no controle, e a clonagem em si leva apenas 10 segundos de áudio. Os modelos anteriores da ElevenLabs liam os textos com clareza, mas precisavam adivinhar o estado de espírito. A versão 4 aceita instruções de interpretação inseridas entre colchetes no texto, como [laughs] ou [said angrily in French accent], e até indicações de som ambiente, como [light rain] ou [phone buzzing]. A empresa afirma que o modelo também identifica o tom e o ritmo pelo contexto ao redor, de modo que uma fala em uma cena tensa soe tensa mesmo sem uma indicação explícita. Em cenas com vários interlocutores, cada voz se mantém consistente ao longo de trechos extensos — um ponto fraco da narração sintética, em que as vozes costumavam mudar no decorrer de um capítulo.

A cobertura de idiomas passa de 70 na versão anterior para mais de 90, e a ElevenLabs destacou o japonês, o português brasileiro, o mandarim e o cantonês como os idiomas em que houve os maiores avanços de qualidade, segundo o TechCrunch. A voz clonada mantém sua identidade ao mudar de idioma: uma cópia da voz de um falante de espanhol que leia um texto em alemão ainda soa como essa pessoa, mas com sotaque alemão nativo. Um segundo modelo, o v4 Turbo, foi desenvolvido para assistentes de voz e atendentes de centrais de atendimento. Ele começa a falar em cerca de 150 milissegundos — aproximadamente o intervalo entre a vez de uma pessoa e a de outra em uma conversa — e pode começar a responder antes que o chatbot por trás dele termine de escrever a resposta.

A ElevenLabs não está sozinha nesse mercado. Google, OpenAI, Cartesia, Deepgram e Fish Audio também vendem vozes sintéticas aos mesmos desenvolvedores. Poucas horas após o lançamento, a empresa independente de benchmarking Artificial Analysis colocou o v4 no primeiro lugar de seu ranking de vozes, no qual ouvintes avaliam amostras anônimas lado a lado. A ElevenLabs também afirma que cerca de três em cada quatro ouvintes preferiram o v4 em comparações cegas com concorrentes — um resultado de testes próprios.

As ressalvas começam com essa marca de 10 segundos. A ElevenLabs afirma que a clonagem exige o consentimento da pessoa cuja voz é enviada, mantém um classificador público capaz de sinalizar áudios feitos com suas ferramentas e bloqueia de imediato a clonagem de algumas figuras políticas. Essas medidas impedem usos indevidos mais casuais, mas dependem de o usuário dizer a verdade; para aplicar um golpe, basta conseguir uma amostra curta da voz de um familiar e encenar uma ligação de emergência falsa. O plano gratuito também é limitado: cerca de 10 minutos de áudio gerado por mês, segundo o detalhamento dos planos publicado pelo Unite.AI, enquanto os planos pagos começam em US$ 6 mensais.

O Eleven v4 e o v4 Turbo foram disponibilizados em 28 de setembro no aplicativo para criadores da ElevenLabs, em sua plataforma de agentes e em sua API para desenvolvedores. A empresa, sediada em Londres, recebeu US$ 500 milhões da Sequoia em fevereiro, com avaliação de US$ 11 bilhões, e o TechCrunch informa que sua receita anualizada já ultrapassou US$ 600 milhões. O presidente-executivo Mati Staniszewski disse ao TechCrunch que a empresa pretende abrir o capital nos próximos anos, mas não se comprometeu com uma data.

Para os criadores, uma voz que ri na hora certa em 90 idiomas é um estúdio de gravação numa aba do navegador. Para todo o resto, é mais um motivo para desligar e ligar de volta quando uma voz conhecida ao telefone pedir dinheiro.

Tags: , , , , ,

Adicione-nos no Google

Discussão

Há 0 comentários.