IA

ChatGPT ganha marca d’água invisível na Europa, a mesma que a OpenAI engavetou em 2024

Adrian Kessler
Adicione-nos no Google

Durante muito tempo, a OpenAI explicou publicamente por que não colocaria uma marca-d’água nos textos do ChatGPT. Agora, vai colocá-la mesmo assim. Não foi a tecnologia que a fez mudar de ideia. Foi uma lei, com prazo e multa.

A empresa diz que os textos gerados pelo ChatGPT e pelo Codex para usuários da União Europeia terão uma assinatura estatística invisível, implementada gradualmente nas próximas semanas em todos os planos. Em todos os outros lugares, a mesma marca só existe como uma opção na API para desenvolvedores — e vem desativada por padrão. A linha que a OpenAI traçou acompanha a fronteira da jurisdição que pode puni-la.

Como funciona a marca-d’água do ChatGPT

O método, chamado textGrain, não deixa nada visível no resultado. Quando várias palavras seguintes se encaixam igualmente bem em uma frase, uma chave secreta inclina a escolha para uma delas. Uma pequena alteração não significa nada. Mas centenas delas ao longo de um texto formam um padrão que um detector com acesso à chave pode identificar. Como o sinal está nas próprias palavras, ele sobrevive ao copiar e colar. A OpenAI elaborou o relatório técnico com pesquisadores da University of Pennsylvania e da Yale. O documento não aponta impacto significativo na qualidade: no Artificial Analysis Intelligence Index, o texto com marca-d’água teve pontuação de 49,76, contra 49,57 sem a marca.

A ferramenta que a OpenAI já tinha

Nada disso é novidade dentro da OpenAI. No verão de 2024, o Wall Street Journal noticiou que a empresa tinha uma marca-d’água funcional para textos, considerada 99,9% eficaz em documentos internos, mas estava segurando seu lançamento. A OpenAI respondeu que adotava “uma abordagem deliberada”. Os motivos apresentados eram técnicos e sociais: seria “trivial contornar” o método, por meio de tradução ou reformulação com outro modelo, e ele poderia estigmatizar a IA como ferramenta de escrita para pessoas que não têm o inglês como língua materna. Ao noticiar o anúncio desta semana, o TechCrunch relembra um terceiro motivo citado na época: o receio de que usuários migrassem para concorrentes que não usassem marcas-d’água.

À luz desse histórico, o novo lançamento mostra quais dessas preocupações a OpenAI de fato resolveu. O problema de contornar a marca continua presente nos próprios números da empresa. A questão comercial foi isolada em um único mercado.

Os números da OpenAI, não os de seus críticos

Em condições favoráveis, com uma taxa de falsos positivos de 1%, o detector identifica cerca de 80% dos textos marcados com 200 tokens e aproximadamente 95% daqueles com 400. Se 10% das palavras forem substituídas por sinônimos, a taxa de detecção cai de 92% para 66%. Se a substituição chegar a um quarto das palavras, cai para 17%. Respostas curtas, textos de matemática e conteúdos traduzidos são especialmente difíceis de identificar. A própria OpenAI alerta que um bom desempenho em condições ideais “não garante uma detecção confiável no uso cotidiano” e que a ausência de uma marca-d’água não prova que o texto foi escrito por uma pessoa. A empresa também afirma que a marca não identifica o usuário.

Isso torna o textGrain um sinal útil contra quem faz um simples copiar e colar, mas fraco diante de qualquer pessoa disposta a gastar um minuto editando o texto. Em um bloco onde se lê e escreve em muitos idiomas, a limitação na detecção de traduções não é um detalhe secundário.

Por que a UE e por que agora

O impulso legal vem do Artigo 50 da Lei de IA, cujas regras de transparência entraram em vigor em 2 de agosto. Elas exigem que fornecedores de sistemas generativos identifiquem textos, áudios, imagens e vídeos sintéticos de forma legível por máquina e ofereçam um mecanismo de detecção. Sistemas que já estavam no mercado antes dessa data, incluindo o ChatGPT, têm até 2 de dezembro para se adequar. As violações podem custar até € 15 milhões ou 3% do faturamento anual mundial, o que for maior, segundo uma análise do escritório de advocacia Cooley.

Dois detalhes mostram como o lançamento acompanha de perto a obrigação, e não um princípio. O primeiro é o detector. A lei exige um mecanismo de detecção; a OpenAI criou um e o disponibilizou apenas a pesquisadores aprovados e organizações especializadas, que precisam se inscrever. A empresa diz que ampliará o acesso “quando acreditarmos que os resultados podem ser interpretados com responsabilidade”, segundo o The Decoder, mas não informou um cronograma. Hoje, um professor ou editor em Lisboa ou Varsóvia que tenha em mãos um texto suspeito não consegue verificá-lo.

O segundo detalhe é o mapa. A Anthropic, que começou a aplicar marcas-d’água aos textos do Claude em agosto, usa a marca globalmente, independentemente de como as pessoas acessam seus modelos, e recebeu críticas de alguns usuários por isso. A OpenAI escolheu o caminho oposto: ativação por padrão onde um órgão regulador pode aplicar multas; adesão opcional para desenvolvedores em outros lugares; e nenhuma ativação global por padrão no lançamento. Se o antigo receio de que usuários migrassem para concorrentes sem marcas-d’água tivesse desaparecido, haveria poucos motivos para traçar o mapa dessa forma.

O que vem a seguir

A OpenAI diz que disponibilizará o textGrain como código aberto e que ele iguala ou supera métodos como o SynthID, do Google. As duas afirmações poderão ser testadas quando o código se tornar público. Para Bruxelas, a questão é mais específica: uma marca que desaparece com uma edição leve, identificada por um detector que quase ninguém consegue usar, atende a uma regra criada para permitir que outros sistemas reconheçam textos gerados por IA?

Depois de 2 de dezembro, os únicos usuários do ChatGPT cujas palavras terão por padrão a assinatura da OpenAI serão aqueles cujos órgãos reguladores podem enviar a conta.

Tags: , , , ,

Adicione-nos no Google

Discussão

Há 0 comentários.