IA

Gemini 3.8 Live substitui o rosto em branco do atendimento por IA

Adrian Kessler
Adicione-nos no Google

O sistema é o Gemini 3.8 Live com Live Avatar. Ele combina o modelo de conversão de fala em fala do Google com uma camada de vídeo em tempo real que gera movimentos labiais e expressões faciais, enquanto executa chamadas de ferramentas em segundo plano sem interromper a conversa. A detecção de idioma é automática — o avatar alterna entre os idiomas falados no meio da chamada, sem transferência, recarregamento do sistema ou pausa perceptível.

O que diferencia essa tecnologia das técnicas de sobreposição de vídeo é que a geração de áudio e vídeo ocorre no mesmo fluxo de inferência ao vivo, em vez de acontecer em etapas sequenciais. Essa integração mantém a latência baixa o bastante para preservar o ritmo natural de uma conversa. O Google incorpora marcas-d’água SynthID de forma imperceptível tanto à saída de áudio quanto à de vídeo — cada segundo contém uma identificação legível por máquina que informa que o conteúdo foi gerado por IA, mesmo que a transmissão seja gravada e reproduzida mais tarde. A marca-d’água resiste à recompactação, permitindo verificar a procedência de clipes exportados.

A Equal AI, que gerencia implantações empresariais em toda a Índia, oferece a indicação mais clara do que essa tecnologia permite em escala operacional: nove idiomas indianos ativos simultaneamente, mais de um milhão de chamadas ao vivo por dia e um total de 97 idiomas compatíveis. Atingir esse volume seria economicamente inviável com agentes humanos disponíveis e escalas de trabalho equivalentes. A premissa por trás da implantação não é uma prova de conceito — é o volume operacional.

O que o lançamento não informa é o preço. O Google não divulgou os custos e direciona as consultas à sua equipe de vendas empresariais. A criação de avatares personalizados — quando organizações criam um rosto com base em suas próprias imagens de referência — exige inclusão em uma lista de permissões para empresas, por meio de um processo separado de verificação, e não está disponível em autoatendimento. Os recursos de Extended Thinking para o modelo Live continuam em prévia privada, limitando a profundidade de raciocínio em comparação com outras ofertas Gemini do Google. Os limites de sessões simultâneas não foram divulgados. O perfil restrito do lançamento é compatível com o padrão do Google de lançamentos empresariais em etapas, nos quais preços e capacidade são negociados, e não publicados.

O Gemini 3.8 Live com Live Avatar já está disponível no console do Gemini Enterprise e pela Live API, com endpoints nos Estados Unidos e na União Europeia. O Extended Thinking para o modelo Live não tem cronograma divulgado para uma liberação mais ampla além do atual grupo com acesso à prévia privada.

As empresas que adotarem a tecnologia responderão a uma pergunta que ela não consegue responder: eliminar o sinal visual que identifica uma interação automatizada melhora a experiência dos usuários ou apaga o último indicador honesto de que ela está acontecendo?

Tags: , , , , ,

Adicione-nos no Google

Discussão

Há 0 comentários.