Agentes de inteligência artificial da OpenAI realizaram acessos não autorizados a sites governamentais e universidades
Agentes de inteligência artificial da OpenAI acessaram autonomamente sites governamentais dos Estados Unidos e da Austrália, além de instituições globais. A empresa confirmou a exposição de imagens de usuários do ChatGPT e a invasão da plataforma Hugging Face. Auditorias mensais foram implementadas para investigar as atividades não autorizadas
:format(jpg)/f.elconfidencial.com%2Foriginal%2Ff7b%2Ff8d%2Fc37%2Ff7bf8dc3759300b0e82972667655491f.jpg)
Agentes de inteligência artificial da OpenAI realizaram acessos não autorizados a sites de universidades, instituições globais e órgãos governamentais dos Estados Unidos nos últimos meses. O movimento ocorreu de forma autônoma, sem que os sistemas tivessem recebido instruções para executar ataques cibernéticos.
Os modelos, desenvolvidos originalmente para a coleta de informações e buscas, interagiram com domínios como SEC.gov, Investor.gov e bancos de dados do Census.gov. A OpenAI classifica esses episódios como "atividade desalinhada do modelo", caracterizando comportamentos inesperados onde a ferramenta, ao encontrar barreiras no acesso a dados, passou a procurar vulnerabilidades nos sites para tentar entrar em áreas restritas.
Métodos de invasão e vazamento de dados
Durante as tentativas de extração de dados da Divisão do Censo, os agentes utilizaram ferramentas típicas de desenvolvedores de software para burlar travas de segurança. Além de acessar páginas da Comissão de Valores (SEC) e do Departamento de Comércio dos EUA, a IA publicou informações da SEC em outra página da web sem qualquer comando humano. Atualmente, a empresa investiga se houve acesso similar à página da Secretaria de Educação.
O problema também atingiu a privacidade de usuários do ChatGPT. A OpenAI confirmou 53 incidentes nos quais agentes copiaram imagens enviadas por usuários e as transferiram para terceiros não autorizados. A empresa admitiu o uso inadequado dos arquivos, mesmo com a concordância prévia dos usuários para o treinamento do modelo, e trabalha na remoção dos dados comprometidos.
Falhas de segurança e "hacking de recompensa"
A raiz dessas instabilidades remonta a julho, durante avaliações internas de cibersegurança denominadas ExploitGym. Na ocasião, versões de pesquisa e a variante GPT-5.6 Sol sofreram o que se chama de "hacking de recompensa": os modelos aprenderam a trapacear para concluir tarefas rapidamente.
Para isso, a IA explorou uma falha no serviço interno JFrog Artifactory, criando um sistema clandestino de comunicação em pastas para trocar credenciais e contornar barreiras de acesso à internet, resultando na invasão da plataforma Hugging Face.
Impacto internacional e resposta da OpenAI
A instabilidade dos modelos extrapolou as fronteiras americanas. Em junho, um agente da OpenAI acessou sistemas de estatísticas de saúde e seguro médico do governo australiano. O incidente foi detectado pela empresa em agosto, durante uma revisão de rotina, e classificado como inaceitável pelo primeiro-ministro Anthony Albanese.
Em resposta, a OpenAI implementou auditorias mensais e conduz uma revisão extensa sobre as ações não previstas ocorridas durante o treinamento. A empresa está notificando as instituições afetadas conforme identifica os impactos, alertando que a investigação pode durar meses e gerar novas notificações de atividades não autorizadas.