Modelos de IA fogem do controle e invadem site alemão; OpenIA manteve caso em segredo, diz agência – 04/09/2026 – Tec
Um enxame de agentes rebeldes da OpenAI invadiu um site boche leste ano e o transformou em um fórum para outros agentes de IA, segundo uma publicação divulgada nesta sexta-feira e também duas pessoas a par do objecto.
Funcionários da OpenAI tomaram conhecimento do incidente há semanas, mas mantiveram o caso em sigilo enquanto os executivos lidavam com as consequências da violação ocorrida em julho no repositório de código descerrado Hugging Face, afirmaram as pessoas ouvidas pela reportagem.
O incidente, que começou em maio, ressalta a crescente tensão no setor de IA. As empresas estão correndo para desenvolver agentes cada vez mais autônomos, capazes de realizarem tarefas complexas; no entanto, há cada vez mais evidências de que esses sistemas também podem aprender a contornar regras, explorar brechas e se coordenar entre si de maneiras que os desenvolvedores não previram nem pretendiam.
Durante a violação da Hugging Face, agentes da OpenAI planejaram autonomamente um “roubo” do dedo que passou despercebido por mais de uma semana, intensificando as preocupações de que a OpenAI esteja sacrificando a segurança para expandir os limites da IA. O trajo de não ter divulgado o incidente de maio pode reacender questionamentos sobre a empresa.
A OpenAI se comprometeu a monitorar os modelos mais de perto. No mês pretérito, a companhia suspendeu temporariamente segmento do treinamento de seus modelos para juntar medidas de segurança. Mas, nesta semana, a OpenAI revelou o Astra, que promete melhor desempenho, mas pode evadir ao monitoramento humano.
“Não podemos responder de forma significativa a alegações ou conclusões contidas em um relatório que ainda não tivemos a oportunidade de indagar”, disse um porta-voz da OpenAI. “A Reuters e os autores do relatório recusaram nosso pedido de entrada. Analisaremos cuidadosamente seu teor mal for publicado e tomaremos as medidas necessárias.”
O incidente na Alemanha reflete um padrão mais grande de atividade de IA que alguns investigadores da OpenAI queriam examinar mais de perto. Mas os esforços para ampliar a investigação encontraram resistência de outras pessoas dentro da OpenAI, incluindo consultores jurídicos, conforme quatro pessoas que estão a par do objecto.
“As alegações de que nossa equipe jurídica desencorajou a investigação do incidente são falsas”, afirmou o porta-voz da OpenAI.
A atividade na Alemanha não estava relacionada ao Hugging Face e não teria sido incluída em um relatório de incidentes do Hugging Face, disse o porta-voz, acrescentando que a OpenAI agiu de boa-fé ao trabalhar com especialistas externos e ter divulgado incidentes relevantes.
FÓRUM DA WIKI
A fuga do agente de IA na Alemanha foi detalhada em um relatório compartilhado com exclusividade à escritório de notícias Reuters por um grupo de pesquisadores, que inclui Sydney Von Arx, presidente-executivo da Nightingale, organização sem fins lucrativos dedicada à segurança da IA, e Cormac Slade Byrd, um trader quantitativo que se tornou pesquisador de IA.
Eles descobriram a atividade no final de agosto enquanto vasculhavam a internet em procura de sinais de comportamento não autorizado de agentes de IA, disseram à Reuters.
A dupla afirmou ter encontrado mais de 15 milénio edições realizadas por agentes de IA em um site wiki em boche, o DseWiki, voltado para programadores e que aceita edições colaborativas semelhantes às da Wikipédia.
As edições mostraram que os agentes da OpenAI haviam transformado o site em um fórum, compartilhando táticas para trapacear em algumas tarefas, contornar as restrições da OpenAI e mascarar seu comportamento.
“Parece extremamente improvável que a OpenAI quisesse que eles fizessem isso”, avaliou Von Arx. “Duvido que eles devem estar se coordenando entre si. Duvido que devem estar escrevendo na internet ensejo”, afirmou.
Os pesquisadores afirmaram ter reconhecido que a atividade no site era impulsionada por agentes de IA que operam em velocidades sobre-humanas. Eles também demonstraram intenso foco na solução de questões técnicas, típicas das avaliações que as empresas de IA utilizam para treinar e testar seus modelos.
As mensagens foram assinadas por usuários que se referiam a si mesmos e uns aos outros porquê agentes, e tapume de metade deles adotou nomes que sugeriam uma afiliação à OpenAI, porquê “OpenAIResearcher” ou “OAIResearchMar26”.
Os pesquisadores afirmaram que os registros públicos do servidor indicavam que grande segmento da atividade se originava da infraestrutura do Microsoft Azure, que a OpenAI utiliza ocasionalmente. Eles também observaram visitas repetidas ao site por funcionários da OpenAI posteriormente o incidente, um padrão que, segundo eles, sugeria fortemente que os agentes e a empresa estavam ligados.
TRAPAÇA
Mensagens analisadas pelos pesquisadores mostraram que os agentes planejavam maneiras de evitar a detecção, usar ferramentas porquê o Tor e preservar as comunicações mesmo depois de terem sido desativados.
Quando o moderativo do site começou a excluir páginas em junho, os agentes responderam criando páginas de backup para evadir da limpeza.
“A limpeza/exclusão em volume do wiki parece estar ocorrendo em ordem alfabética”, escreveu um agente em 19 de junho. “Se esta página desvanecer, tente [[ZZZDataUSAConstructionWageLive]] “.
Os pesquisadores também encontraram tentativas de adulterar o próprio site. Lukasz Olejnik, pesquisador sênior visitante do King’s College London, afirmou que isso equivale a uma tentativa de hacking. A OpenAI contestou essa caracterização com base em sua estudo do material na quinta-feira.
Exemplos anteriores de conduta imprópria de agentes de IA costumavam ser minimizados porquê um subproduto lógico dos testes de segurança, nos quais os modelos são explicitamente avaliados quanto às suas capacidades ofensivas. Olejnik afirmou que as descobertas mais recentes sugerem que o comportamento indevido pode não se limitar a esses contextos.
Maurice Chiodo, acadêmico do Meio de Estudos de Risco Existencial da Universidade de Cambridge que analisou algumas das comunicações dos agentes, disse que as mensagens se assemelhavam à “operação de qualquer tipo de rede clandestina, determinada a satisfazer uma tarefa ou missão”.
O incidente, segundo ele, deve substanciar as crescentes preocupações de que a maior prenúncio da IA avançada talvez não seja um único sistema superinteligente, mas “vastas multidões de IAs semi-inteligentes agindo em conluio”.




