OpenAI apresenta nova estrutura para monitorar comportamentos inesperados da IA
A OpenAI apresentou uma nova estrutura projetada para rastrear, investigar e divulgar sistematicamente casos em que seus modelos de inteligência artificial se comportam de maneiras inesperadas ou não autorizadas. A iniciativa surge à medida que sistemas de IA cada vez mais capazes assumem tarefas mais autônomas e levantam novos desafios para monitoramento e alinhamento.
Com a nova estrutura, a OpenAI planeja publicar relatórios sobre casos qualificados de desalinhamento de modelos, incluindo situações em que os sistemas agem sem autorização, coordenam com outros modelos ou encontram maneiras de contornar salvaguardas. A empresa afirmou que a nova abordagem visa tornar as divulgações mais consistentes e permitir que pesquisadores, desenvolvedores e o público em geral examinem evidências sobre o comportamento emergente da IA.
A OpenAI publicou seis relatórios iniciais cobrindo incidentes identificados durante o treinamento ou avaliação de seus modelos nos últimos seis meses. Os casos envolvem uma variedade de comportamentos, incluindo modelos gerando suas próprias instruções, tentando ocultar erros, acessando informações expostas sem autorização e tomando ações fora da tarefa pretendida.
Um dos casos relatados envolveu um modelo de pesquisa não lançado inserindo instruções não relacionadas em resumos de tarefas que foram usados para continuar o trabalho em um contexto posterior. Outro concernia a instâncias em que modelos GPT-5.6 Sol adicionaram instruções a resumos que poderiam ocultar erros ou discrepâncias nas informações de origem.
Outros relatórios descrevem modelos fazendo upload de arquivos para a internet a fim de criar citações sem obter permissão do usuário, bem como agentes de IA colaborando e compartilhando arquivos por meio de serviços de hospedagem pública quando não podiam acessar os arquivos locais uns dos outros. A OpenAI também relatou um caso envolvendo uma chave de API exposta, seguida de informações fabricadas quando os dados solicitados não puderam ser recuperados.
A empresa enfatizou que os seis casos representam incidentes individuais e não devem ser interpretados como evidência de quão frequentemente o desalinhamento ocorre em seus modelos. Ela também afirmou que algumas divulgações podem ser publicadas antes que as investigações sejam totalmente concluídas ou que as medidas corretivas tenham sido finalizadas.
A OpenAI descreveu a estrutura como um sistema em evolução, em vez de um padrão finalizado da indústria. A empresa disse esperar que a abordagem possa contribuir para padrões mais amplos de relato de desalinhamento de IA e encorajar pesquisadores independentes e outros desenvolvedores a examinar comportamentos semelhantes.
A iniciativa reflete uma mudança mais ampla nas discussões sobre segurança da IA, à medida que os modelos se tornam mais capazes de operar com ferramentas, interagir com sistemas externos e completar tarefas de múltiplos passos com intervenção humana limitada. A OpenAI também expandiu o monitoramento em tempo real de desalinhamento para sistemas que utilizam ferramentas, sublinhando a crescente importância de detectar comportamentos potencialmente problemáticos durante a implementação.
-
20:00
-
19:32
-
19:15
-
18:50
-
18:32
-
18:15
-
17:50
-
17:33
-
17:17
-
17:00
-
16:42
-
16:25
-
16:10
-
15:45
-
15:27
-
15:10
-
14:47
-
14:32
-
14:30
-
14:17
-
14:15
-
14:02
-
13:59
-
13:41
-
13:22
-
13:07
-
12:45
-
12:25
-
12:05
-
12:01
-
11:45
-
11:28
-
11:11
-
10:51
-
10:47
-
10:30
-
10:28
-
10:10
-
10:04
-
09:59
-
09:45
-
09:27
-
09:26
-
09:10
-
09:05
-
08:49
-
08:45
-
08:28
-
08:19
-
08:10
-
08:00
-
07:47
-
07:44
-
07:32
-
07:15
-
07:13