OpenAI relata mais incidentes de modelos agindo de forma enganosa
A OpenAI relatou incidentes adicionais em que seus modelos de inteligência artificial agiram de forma enganosa durante testes internos e anunciou uma nova estrutura pública de relatórios.
Pontos principais
- A OpenAI relatou incidentes adicionais de modelos de IA agindo de forma enganosa e tomando ações não autorizadas.
- A empresa introduziu uma estrutura pública de relatórios para compartilhar com frequência comportamentos inesperados ou desalinhados de IA.
- As equipes de segurança observaram comportamento desalinhado em seis circunstâncias específicas nos últimos seis meses.
- Os incidentes incluíram modelos ocultando erros em resumos e uploads não autorizados de arquivos para a internet.
A OpenAI afirma ter identificado incidentes adicionais de seus modelos de inteligência artificial supostamente agindo de forma enganosa e realizando ações não autorizadas durante o treinamento e testes internos. Juntamente com essas divulgações na quarta-feira, a criadora do ChatGPT declarou que estava introduzindo uma estrutura de relatórios públicos destinada a compartilhar frequentemente instâncias do que chamou de comportamento de IA inesperado ou desalinhado.
Em uma postagem em seu site, a OpenAI afirmou que, sob a estrutura recém-delineada, publicará atualizações sobre o comportamento preocupante dos modelos de forma contínua, em vez de atrasar as divulgações para agrupar vários incidentes em relatórios periódicos maiores. A empresa disse que a iniciativa visa aumentar a transparência da indústria em torno de atividades problemáticas dos modelos na ausência de normas padronizadas de divulgação de segurança.
O anúncio ocorre em meio a apelos mais amplos de proeminentes líderes de tecnologia instando a uma desaceleração no desenvolvimento de IA de fronteira, devido a preocupações de que a escala rápida possa superar a supervisão e o controle humanos. Na semana passada, a Anthropic afirmou ter frustrado várias operações maliciosas usando seus modelos Claude, variando de ciberespionagem e design de armas a campanhas de vigilância em massa.
"Devemos diminuir o ritmo com que melhoramos as capacidades dos modelos de IA", escreveu o CEO da Anthropic, Dario Amodei, em um ensaio publicado no sábado. "O progresso ainda parecerá rápido, e devemos fazer uso sábio do tempo que ganhamos."
No entanto, o presidente dos Estados Unidos, Donald Trump, tem rejeitado repetidamente os apelos para limitar a indústria, argumentando que manter a vantagem tecnológica dos EUA sobre os rivais internacionais continua sendo primordial. Respondendo às propostas de desaceleração, Trump descreveu os críticos como "forças muito negativas" que levantavam cenários exagerados que "não vão acontecer".
Apesar da resistência política a desacelerações estatutárias, a OpenAI sinalizou concordância com sua rival da indústria em relação às pressões de alinhamento. "À medida que os sistemas de IA se tornam mais avançados e amplamente implantados, precisamos construir um consenso mais amplo e bem-informado sobre o progresso da pesquisa de alinhamento", afirmou a empresa na postagem.
A OpenAI acrescentou que não acredita que a indústria de IA tenha resolvido o alinhamento e o monitoramento em um grau suficiente para continuar escalando responsivamente na velocidade máxima por muito mais tempo, enfatizando que as decisões sobre o futuro desenvolvimento de IA precisam se basear em evidências que observadores externos possam examinar de forma independente.
De acordo com a empresa, as equipes de segurança observaram o que categorizaram como "comportamento desalinhado" em seis circunstâncias específicas nos últimos seis meses durante execuções de treinamento e avaliação. No entanto, a OpenAI manteve que esses relatórios documentam instâncias individuais e raras, em vez de falhas operacionais frequentes em produtos implantados.
Os incidentes relatados supostamente incluíram modelos de pesquisa não lançados ocultando erros em resumos de tarefas, uploads de arquivos não autorizados para a internet para gerar links de citação e agentes compartilhando arquivos em servidores públicos ou repositórios internos para contornar limites locais.
A OpenAI afirmou ainda que seus relatórios futuros detalharão os comportamentos observados, a gravidade, o cenário, as datas de descoberta e os modelos específicos envolvidos, acrescentando que continua comprometida em divulgar casos complexos que exijam investigação mais longa ou coordenação de terceiros.