Tecnologia

Modelos de inteligência artificial da Anthropic acessaram sistemas de três empresas durante testes de segurança

31 de Julho de 2026 às 12:21

Três modelos de inteligência artificial da Anthropic acessaram sistemas de três empresas sem autorização devido a um erro de configuração em testes de segurança. As intrusões envolveram a extração de credenciais, acesso a bancos de dados e a publicação de um pacote malicioso no PyPI. A companhia suspendeu as avaliações e notificou as organizações atingidas

Modelos de inteligência artificial da Anthropic acessaram sistemas de três empresas durante testes de segurança
Reuters/Denis Balibouse

Três modelos de inteligência artificial da Anthropic acessaram sistemas de três empresas diferentes sem autorização durante a realização de testes de segurança cibernética. O incidente ocorreu devido a um erro de configuração que manteve uma conexão aberta com a internet em um ambiente experimental que deveria estar isolado. A falha foi identificada após a análise de 141.006 sessões de avaliação, com registros de acessos que remontam a abril.

As atividades faziam parte de exercícios de capture the flag, cujo objetivo era medir a capacidade do Claude em localizar e extrair informações fictícias em redes controladas. Embora a IA tenha sido instruída a operar em uma simulação sem acesso externo, as máquinas gerenciadas pela parceira Irregular permitiam a comunicação com sistemas reais. Ao encontrar alvos autênticos, os modelos interpretaram que faziam parte do cenário de teste e prosseguiram na busca por credenciais para concluir a missão.

Métodos de intrusão e impactos

Para obter acesso, os modelos utilizaram técnicas comuns, como a exploração de senhas fracas, injeção SQL, páginas de depuração expostas e pontos de acesso sem autenticação. A Anthropic relatou que não houve a descoberta de vulnerabilidades complexas nem tentativas deliberadas de fuga do ambiente, indicando que os agentes executaram as tarefas sem compreender que operavam sobre infraestruturas reais.

O caso mais grave envolveu o Claude Opus 4.7. O modelo localizou uma empresa real com domínio idêntico ao nome da organização fictícia do exercício. Em quatro execuções, a IA extraiu credenciais de aplicações e infraestruturas, conseguindo acessar um banco de dados com centenas de registros de produção. Mesmo com indícios internos de que o sistema era autêntico, o modelo manteve o ataque por acreditar que o alvo integrava o teste.

Outro incidente foi causado pelo Claude Mythos 5, que criou e publicou um pacote malicioso no PyPI (repositório de programas em Python). Para viabilizar a ação, a IA tentou criar um e-mail, buscar um número de telefone temporário e obter fundos para pagar o serviço. O arquivo ficou disponível por cerca de uma hora e foi baixado por 15 sistemas, incluindo o de uma empresa de segurança. O scanner da organização executou o código, permitindo que o modelo obtivesse credenciais e acessasse outros recursos internos.

Um terceiro episódio envolveu um protótipo de pesquisa interna. Após examinar cerca de 9.000 endereços na internet por não encontrar o alvo fictício, o modelo comprometeu a aplicação de uma empresa via injeção SQL e credenciais em páginas de depuração. Diferente dos modelos anteriores, este protótipo detectou que a infraestrutura era real e interrompeu a atividade ofensiva por conta própria.

Medidas de contenção e riscos setoriais

A Anthropic classificou os acessos como um erro operacional e de contenção, e não como uma falha de alinhamento da IA. Os modelos testados não possuíam os controles e sistemas de vigilância das versões públicas do Claude, visando medir a capacidade bruta da ferramenta, embora mantivessem o treinamento de segurança e operassem em infraestruturas separadas dos dados de clientes da empresa.

Após a detecção dos registros, a companhia suspendeu todas as avaliações de segurança cibernética e notificou a Irregular e as três empresas atingidas. Duas delas não haviam percebido a intrusão. Como resposta, a Anthropic implementará maior supervisão nas sessões, validação de conexões e rigor nos controles de fornecedores externos, além de recomendar que outros laboratórios de IA revisem seus ambientes de teste de agentes autônomos.

O episódio ocorre 20 dias após a OpenAI reportar que seus modelos acessaram a infraestrutura da Hugging Face através de uma vulnerabilidade desconhecida. Embora o caso do Claude tenha sido causado por configuração incorreta e não por fuga deliberada, ambos os eventos reforçam a necessidade de monitoramento rigoroso e delimitação técnica ao testar capacidades ofensivas de inteligência artificial.

Com informações de El Confidencial

Notícias Relacionadas