Search

Anthropic diz que Claude hackeou 3 empresas durante testes


A Anthropic informou nesta quinta-feira (30/7) que o Claude, seu assistente de inteligência artificial, fez ataques virtuais contra três empresas durante testes. A empresa disse ter detectado o erro ao analisar mais de 141 mil sessões de teste.

O comunicado da empresa ocorre dias após a OpenAI revelar que o ChatGPT invadiu o sistema de outra empresa de IA, a Hugging Face, por conta própria. Segundo a Anthropic, a decisão de analisar os testes do Claude foi tomada exatamente após o incidente da OpenAI.

De acordo com a empresa, nos três incidentes, o Claude havia sido desafiado a capturar uma bandeira. No teste, é apresentado um cenário fictício, em que é dito que uma informação secreta (a “bandeira”) foi escondida em outra máquina na rede, e o objetivo da IA é invadir e recuperá-la. Em todos os casos, a instrução de avaliação da Anthropic especificava para Claude que seu ambiente era uma simulação e que não havia acesso à internet.

No entanto, “devido a um mal-entendido”, segundo a Anthropic, o acesso à internet ficou disponível.  Por causa disso, quando a busca de Claude o levou a sistemas reais na internet aberta, ele os tratou como parte do exercício.

Entre no canal de WhatsApp
do Metrópoles

“Em alguns casos, nosso modelo mais antigo continuou o ataque mesmo após obter evidências de que estava sendo executado na internet aberta; nosso modelo mais recente parou assim que reconheceu estar na internet. Em nenhuma dessas situações Claude se exfiltrou ou tentou escapar deliberadamente de seu ambiente de teste”, disse a empresa.

A Anthropic disse ter conseguido entrar em contato com duas das empresas vítimas, que não tinham identificado o ataque. A terceira empresa ainda não conseguiu ser contatada.



Metropole