Anthropic retoma testes externos de segurança após ataques de Claude

Início Ciência Anthropic retoma testes externos de segurança após ataques de Claude
Anthropic retoma testes externos de segurança após ataques de Claude

A Anthropic classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional”, afirmando que eles ocorreram devido a erros ‌em um ambiente de avaliação de terceiros. ‌A empresa ​suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.

Na segunda-feira, a Anthropic informou que retomou os ‌testes externos após adicionar as medidas de segurança, projetadas para impedir que seus modelos de IA acessem sites ou sistemas de computador reais. A empresa afirmou que agora utiliza um “classificador” capaz de identificar quando um modelo tenta escapar e interromper o teste.

A Anthropic também informou que agora exige que organizações externas que testam modelos com medidas de segurança reduzidas sigam um “conjunto de melhores práticas”, incluindo mantê-los em sistemas de ‌computador isolados, sem acesso à internet por padrão, verificar se os sistemas estão seguros antes do início dos testes e monitorar os modelos ​durante todo o teste.

A Anthropic afirmou que reconstruiu seu sistema de treinamento após identificar problemas em mais de 10% ‌de seus exercícios, incluindo “hackeamento de recompensas”, em que o modelo encontra maneiras de enganar seu processo de treinamento e ganha recompensas sem concluir a tarefa ‌atribuída. A empresa, no entanto, ‌reconheceu que “o processo não é perfeito e nossos modelos não estão perfeitamente alinhados”.

A Anthropic também informou que suspendeu ⁠alguns exercícios de treinamento de maior risco por várias semanas enquanto implementava um sistema para evitar recompensar o modelo por contornar o monitoramento. A maioria dos exercícios já foi retomada, mas alguns permanecem em espera, aguardando revisão humana ou novas atualizações ​no sistema.

A estratégia da ​Anthropic parece mais restrita do que a da OpenAI, que, em 18 de agosto, informou que estava desacelerando grande parte do desenvolvimento de seus modelos enquanto reforçava a segurança de seus ambientes de treinamento e teste.