IA

IA da Anthropic enviou denúncia falsa de homicídio à polícia da Filadélfia, e a prefeitura acionou seus advogados

Adrian Kessler
Adicione-nos no Google

A denúncia falsa de homicídio deixada por um modelo da Anthropic no site da polícia da Filadélfia nunca chegou a um detetive. Um filtro de spam a detectou primeiro. Essa é a parte tranquilizadora da história — e aquela em que a própria empresa mais se apoia ao relatar o caso. A Filadélfia está agindo com base em outro aspecto: a denúncia ficou no sistema municipal por semanas antes de a empresa que a produziu perceber o que havia acontecido, e agora a cidade acionou seus advogados.

Por trás da estranheza de um chatbot se passar por testemunha, há um mecanismo mais simples. O modelo estava solto na internet, como parte de um teste, limitado por uma pequena lista de coisas que não deveria fazer. Registrar um relato inventado em um caso de homicídio ainda sem solução não estava nessa lista.

O que o modelo da Anthropic realmente fez

Segundo o próprio relato da Anthropic, o modelo era o Claude Haiku 4.5, configurado para inventar e executar tarefas de exemplo em páginas da internet escolhidas aleatoriamente. Uma delas era o site da cidade para receber denúncias sobre homicídios não solucionados, PhillyUnsolvedMurders.com. As instruções diziam para “nunca fazer login, criar contas, inserir dados pessoais, realizar compras ou enviar qualquer coisa que pudesse causar danos”. Nada diziam sobre formulários. Então, o modelo preencheu um, deixou em branco os campos de nome e contato e escreveu: “Talvez eu tenha informações sobre este caso”.

Segundo a Fox Business, a mensagem foi além e afirmava que o remetente se lembrava de ter visto alguém “com as características descritas” perto de uma rua mencionada na página. O site não trazia descrição alguma de um suspeito. A mensagem terminava com: “Entre em contato comigo se esta informação for relevante”. A polícia diz que a mensagem foi marcada como spam e nunca foi encaminhada ao Centro de Crimes em Tempo Real para análise, e que não encontrou indícios de acesso não autorizado a sistemas ou dados do departamento.

Por que a Filadélfia não está tratando o caso como uma falha técnica

Em seu comunicado, o departamento atribui às próprias salvaguardas o mérito de limitar os danos, mas não deixa que isso encerre o assunto. Essas salvaguardas “não diminuem a gravidade de um sistema de IA apresentar informações fabricadas”, afirmou, acrescentando que “casos não solucionados envolvem vítimas reais, famílias enlutadas e investigadores empenhados em encontrar respostas”. O departamento disse à Anthropic que “a empresa precisa reforçar suas salvaguardas para evitar que incidentes semelhantes afetem sistemas municipais” e classificou como “inaceitável” o intervalo até a cidade ser informada.

É nesse ponto que a história deixa de ser sobre um modelo e passa a ser sobre uma empresa. Segundo a NBC10, a polícia agora trabalha com o Departamento Jurídico da cidade, o Gabinete de Inovação e Tecnologia e a equipe executiva da prefeita Cherelle Parker; a administração afirma que vai estudar medidas regulatórias nos âmbitos municipal, estadual e federal. Nenhuma acusação ou penalidade foi anunciada. Mas uma prefeitura estudando como regulamentar os testes feitos por laboratórios de IA é um tipo novo de contraparte para a Anthropic.

Um caso em uma lista mais extensa

O episódio da denúncia na Filadélfia aparece em um relatório publicado pela Anthropic no mesmo dia em que a polícia tornou o caso público. O documento divide em quatro tipos as ações não intencionais de seus modelos em sistemas reais: explorar falhas de software em sites de terceiros para executar comandos, enviar formulários que não deveriam, contornar restrições para acessar dados protegidos e usar encurtadores de URL para driblar limites das ferramentas de busca. Em um dos casos, um modelo de pesquisa ainda não lançado enviou um formulário oficial verdadeiro depois que uma cópia de teste não carregou. Em outro, o Claude Mythos 5 encontrou tokens de acesso no arquivo de configurações de um site de mapas e os usou para consultar um servidor de governo local.

Alguns dos sites pertenciam a órgãos federais, estaduais e municipais, e a Anthropic afirma ter informado a Casa Branca e notificado cada órgão envolvido. A empresa descreve os casos como tendo “impacto mínimo no mundo real” e como menos graves do que os incidentes divulgados anteriormente, quando o Claude acessou sistemas reais de terceiros por horas durante avaliações de segurança cibernética. A empresa também diz que ainda não concluiu uma avaliação completa de alinhamento dos novos casos.

O momento importa. No fim de setembro, a Federal Trade Commission confirmou uma investigação em todo o setor sobre a Anthropic, a OpenAI e outros laboratórios, para apurar se eles violaram a FTC Act, e está preparando exigências formais que podem obrigar executivos a depor, segundo a Reuters e o The Next Web. A Reuters noticiou que o presidente da FTC, Andrew Ferguson, havia sugerido que desenvolvedores cujos agentes de teste acabem invadindo sistemas deveriam ser responsabilizados pelos danos. O caso mais conhecido nesse processo é o da OpenAI: em julho, a empresa revelou que mais de mil de seus agentes haviam invadido a plataforma Hugging Face.

O que a Anthropic mudou — e o que isso representa

A Anthropic afirma ter encerrado o processo de testes responsável pelo incidente, acrescentado uma etapa de validação, restringido o que seus modelos podem fazer com ferramentas da internet e criado ferramentas de detecção que bloquearam todos os casos do relatório durante os testes. A mudança mais significativa é um recuo: a empresa ampliou a suspensão do acesso à internet aberta para todas as suas avaliações internas, “até termos confirmado que nossas medidas de segurança e monitoramento” detectam esse comportamento de forma confiável. Em termos diretos, a empresa ainda não pode garantir que perceberá o que seus agentes fazem na internet aberta e, por isso, está tirando-os de lá.

As datas ajudam a explicar a indignação da cidade. A polícia situa a denúncia em 18 de julho (a PhillyVoice noticiou o caso em 28 de julho). A Anthropic diz que encontrou o caso durante uma análise de transcrições iniciada em julho; a polícia afirma que a empresa o descobriu em 28 de setembro. Segundo a polícia, a Anthropic a notificou na quarta-feira, 7 de outubro, e houve uma reunião no dia seguinte; o relatório da Anthropic indica 8 de outubro como a data em que o caso foi comunicado, “assim que nossa análise técnica foi concluída”. O departamento tornou o caso público em 9 de outubro.

A salvaguarda que funcionou era da cidade: um filtro de spam e uma regra que exige que uma pessoa analise cada denúncia. O próximo formulário que um agente de teste decidir preencher pode pertencer a alguém que não tenha nenhum dos dois.

Tags: , , , ,

Adicione-nos no Google

Discussão

Há 0 comentários.