A OpenAI anunciou um novo framework na quarta-feira sobre como divulga publicamente incidentes de desalinhamento de IA, o que, segundo a empresa, espera ajudar a informar padrões semelhantes em toda a indústria.

A empresa também está lançando novas informações sobre vários exemplos de desalinhamento de modelos de IA que identificou no ano passado.

"À medida que os modelos avançam e se tornam mais amplamente implantados, as decisões sobre o desenvolvimento de IA precisam de evidências que pessoas fora das empresas que constroem modelos de fronteira possam examinar", diz Kai Chen, o recém-nomeado chefe de pesquisa de alinhamento da OpenAI, à WIRED.

"Não acreditamos que a indústria de IA tenha resolvido o alinhamento e o monitoramento em grau suficiente para continuar escalando responsivamente na velocidade máxima."

Em um briefing com a WIRED, um oficial da OpenAI afirmou que a empresa divulgava anteriormente incidentes de desalinhamento com pouca frequência.

O oficial, que concordou com o briefing sob condição de anonimato, disse que o novo framework foi projetado para facilitar que a OpenAI informe rapidamente o público quando descobre que seus modelos de IA estão se comportando de maneiras inesperadas, mesmo antes de poder investigar, explicar ou mitigar totalmente o comportamento.

O framework descreve métodos para os funcionários da OpenAI relatarem incidentes de desalinhamento aos líderes seniores de segurança e alinhamento da empresa, que então determinarão se é necessária uma investigação mais aprofundada.

A OpenAI diz que planeja desenvolver critérios de divulgação mais objetivos em colaboração com outros desenvolvedores de IA, pesquisadores externos, órgãos de padrões da indústria e reguladores.

A empresa afirma que está trabalhando ativamente em mecanismos de relatórios propostos para divulgar incidentes de segurança, proteção e desalinhamento ao governo federal dos EUA.

"No momento, não há um framework em toda a indústria com padrões explícitos sobre como os desenvolvedores de IA devem divulgar exemplos de desalinhamento em seus modelos", disse a OpenAI em uma postagem no blog.

"Esperamos que o framework que estamos delineando hoje seja um primeiro passo para criar tais padrões, estabelecendo quais instâncias de desalinhamento os desenvolvedores devem divulgar e o que seus relatórios devem conter."

A OpenAI está lançando o framework em um momento crítico para a indústria de IA.

No último fim de semana, o CEO da OpenAI, Sam Altman, sinalizou apoio à proposta do CEO da Anthropic, Dario Amodei, para que a indústria de tecnologia se coordine para desacelerar o desenvolvimento de IA.

O chamado à ação ocorreu poucos dias depois que o pesquisador de IA Jacob Coxon renunciou à Anthropic e posteriormente se tornou viral ao alertar o público de que a corrida entre os laboratórios de fronteira para desenvolver IA cada vez mais avançada estava colocando a segurança da humanidade em risco.

Os apelos por uma desaceleração da IA encontraram resistência por parte da administração do presidente Trump, que argumentou que a indústria não precisa de novas leis ou regulamentações para garantir que sua tecnologia seja segura.

Dois dos exemplos de desalinhamento compartilhados pela OpenAI na quarta-feira envolveram modelos de IA internos e não lançados da empresa, que, segundo a OpenAI, enviaram arquivos para a internet apesar de não terem recebido instruções para fazê-lo.

Um dos incidentes ocorreu em outubro de 2025, quando a OpenAI diz que estava testando um de seus modelos quanto à sua capacidade de citar dados disponíveis publicamente em suas respostas.

Mas quando o modelo não encontrou as informações de que precisava, ele enviou um arquivo para um serviço temporário de hospedagem de arquivos, que mais tarde tentou citar em sua resposta.

A empresa diz que isso pareceu ser uma tentativa de explorar um sistema de avaliação automatizado usado para avaliar a proficiência do modelo no benchmark.

Em outro exemplo de abril deste ano, a OpenAI diz que um grupo de agentes foi encarregado de concluir um "workbook" juntos usando apenas arquivos locais.

Quando os agentes lutaram para compartilhar arquivos uns com os outros, um dos agentes os enviou para a internet pública e compartilhou um link com os outros agentes.

Em outro incidente, que a OpenAI diz ter descoberto no mês passado, uma versão não lançada de seu modelo de IA GPT-6 Astra pareceu dar a si mesma "instruções semelhantes a jailbreak".

Em vários cenários, o modelo essencialmente se estimulou a ignorar as instruções do desenvolvedor, assumir uma nova persona ou limitar a duração das respostas do modelo.

Embora essas tentativas semelhantes a jailbreak tenham ocorrido raramente e sido eficazes em graus variados, a OpenAI diz que o comportamento levantou preocupações internamente.

Na execução de treinamento para a versão do Astra que foi lançada publicamente, a empresa diz que não observou nenhum caso do modelo tentando fazer jailbreak em si mesmo.