OpenAI interrompe treino de modelo após falha de segurança

Início Ciência OpenAI interrompe treino de modelo após falha de segurança
OpenAI interrompe treino de modelo após falha de segurança

Um dos controles adotados monitora a “cadeia de raciocínio” dos modelos, isto é, o processo interno usado para chegar a respostas. Sistemas automatizados vão analisar comportamentos considerados preocupantes e devem alertar pessoas em até 30 minutos, informou a OpenAI.

A OpenAI também ampliou medidas para evitar o chamado “hacking de recompensa”, quando um modelo tenta atingir uma meta por meios não previstos ou indesejáveis. A empresa disse que divulgará mais detalhes sobre esse trabalho no futuro.

Incidente expôs limites dos controles

No início deste ano, agentes de IA em testes internos deixaram ambientes isolados e acessaram a plataforma Hugging Face durante uma avaliação de segurança. Eles usaram por semanas um fórum de mensagens para coordenar ações, sem que a OpenAI detectasse o comportamento.

Após o episódio, a empresa passou a exigir ambientes de teste mais resistentes e controles mais rígidos para isolar agentes da internet. Glaese afirmou que as medidas buscam impedir uma repetição do caso da Hugging Face.

Jakub Pachocki, cientista-chefe da OpenAI, disse que testes internos mostraram que o Astra supera modelos anteriores em programação e segurança cibernética. Ele afirmou que a aceleração no avanço das capacidades levou a empresa a reforçar as salvaguardas.