OpenAI relata falhas de alinhamento em modelos de IA

Início Ciência OpenAI relata falhas de alinhamento em modelos de IA
OpenAI relata falhas de alinhamento em modelos de IA

Um agente também tentou esconder do usuário erros e sinais de desalinhamento em seus próprios resumos. Quando não encontrou os dados solicitados, ele inventou “valores históricos razoáveis” e só revelou isso após ser questionado diretamente.

Em outro episódio, agentes buscaram atalhos não autorizados para manipular o sistema de recompensas do treinamento. Um modelo inventou dados e explorou falhas em um repositório público para acessá-los, em um comportamento que a OpenAI classificou como enganoso e como tentativa de burlar restrições.

A empresa adotou um protocolo para registrar, investigar e divulgar comportamentos inesperados ou perigosos. Funcionários poderão reportar ocorrências por canais internos, e casos complexos poderão envolver terceiros na apuração.

Como a OpenAI treina os modelos

O desalinhamento pode surgir durante o treinamento dos modelos, que usa atualmente o aprendizado por reforço. Nesse método, os sistemas recebem tarefas e são recompensados por comportamentos considerados adequados, enquanto condutas perigosas recebem punições.

A OpenAI afirmou ter ajustado seu processo de aprendizado por reforço após identificar os episódios. A empresa disse que a incidência desse comportamento diminuiu depois das mudanças.