Sim, o incidente no qual os modelos da OpenAI saíram de controle e invadiram a plataforma Hugging Face de traje mostra a capacidade que os agentes de perceptibilidade sintético já têm de desenredar falhas inéditas e encadear ataques hackers passo a passo. Mas descrever o caso porquê um robô tão poderoso que saiu do controle serve para esconder a responsabilidade humana na situação.
É isso que vêm defendendo especialistas em segurança da perceptibilidade sintético depois que o caso veio à tona, com o pregão da OpenAI na terça-feira (21). Em um expedido público, a empresa disse que GPT-5.6 Sol e um protótipo mais poderoso, ainda não lançado, escaparam de um envolvente de testes e conseguiram invadir a plataforma Hugging Face.
O ataque chamou a atenção porque se assemelha a casos hipotéticos discutidos com frequência na pesquisa em IA, nos quais um robô levaria às últimas consequências a missão de satisfazer determinado objetivo, com consequências catastróficas —o que remete também a filmes de ficção científica.
“Acredito de traje que há um papel 100% humano nesse caso”, diz Pedro Teberga, professor do Instituto de Tecnologia e Inovação. “Evidente que o protótipo vai responder ao objetivo que foi posto para ele, mas, se existia uma vulnerabilidade dentro desse sistema, foi por meio dela que o ataque aconteceu. Se houvessem criado um envolvente mais só, alguma coisa assim não aconteceria”, diz.
“Se esse caso fosse para a Justiça, haveria responsabilidade jurídica para a empresa.”
Ou seja, o agente que cometeu o ataque até agia com autonomia, mas a responsabilidade pelo objetivo a satisfazer, a infraestrutura envolvida no treinamento e a contenção em caso de um incidente é dos humanos.
“Consideramos nascente um incidente cibernético sem precedentes, envolvendo capacidades cibernéticas de última geração, e estamos respondendo de consonância”, disse a OpenAI em publicação no blog da empresa. “Estamos implementando controles rigorosos na feição da infraestrutura, mesmo que isso reduza a velocidade da pesquisa, enquanto as vulnerabilidades são corrigidas.”
A OpenAI está conduzindo uma investigação junto a Hugging Face e promete publicar mais detalhes nas próximas semanas. O que se sabe até agora é que a empresa estava conduzindo testes para ver porquê seus modelos se saíam em um novo “benchmark” —vocábulo em inglês que define um sistema de avaliação de desempenho da IA.
O novo “benchmark” se labareda ExploitGym e foi desenvolvido em um trabalho científico publicado em maio. O objetivo dessa avaliação é saber até que ponto um protótipo de IA consegue usar uma vulnerabilidade em um sistema para realizar um ataque cibernético real.
Em poucas palavras: identificar a nequice é uma coisa, explorá-la é outra. É a diferença entre perceber que o gerente do banco esqueceu a porta do cofre ensejo e aproveitar o imprevidência para planejar e executar um assalto.
No ExploitGym, o protótipo é apresentado a 898 vulnerabilidades reais, retiradas de softwares amplamente utilizados. A missão do robô é usar as falhas em um ataque que realmente consiga executar código, acessar arquivos ou assumir controle do sistema.
Os principais modelos se saem muito no teste, mas ainda falham na maioria dos casos. O Claude Mythos, por exemplo, completou a missão diante de 157 das vulnerabilidades.
O que labareda atenção no caso da OpenAI é que, em vez de resolver os desafios propostos, os dois modelos de IA concluíram que era mais fácil invadir a Hugging Face para obter as respostas em vez de resolver diretamente o repto. Ou seja, os robôs passaram a tratar o próprio envolvente de testes porquê um problema a ser contornado. Mais ou menos porquê um aluno que, em vez de responder a prova, invade o computador da direção para roubar o gabarito.
“Falar que os robôs trapaceiam seria alguma coisa falso, porque é humano. Eles na verdade buscaram a eficiência”, diz Teberga.
Pontos para o protótipo, mas o relato ainda ignora a ação humana. Testes do tipo são conduzidos em um envolvente só chamado de “sandbox”, justamente para prevenir incidentes assim.
No pregão, a OpenAI diz que, no caso, o envolvente que estava utilizando era “altamente só”, mas os modelos conseguiram encontrar uma brecha, conectar-se à internet e invadir a Hugging Face. Ao mesmo tempo, para realizar o teste, a empresa também tinha suspendido filtros de segurança —que poderiam ter impedido os robôs de fugir do envolvente seguro.
Em entrevista à revista Wired, Davi Ottenheimer, veterano consultor de segurança, diz que o caso foi uma nequice de fundamentos conhecidos há décadas na pesquisa de IA. E que há um paradoxo na asserção da OpenAI de que o envolvente era “altamente só”, mas que o protótipo escapou por uma brecha —os dois fatos não podem ser verdade conjuntamente.
“Isto não é um problema de IA. É negligência em relação a uma prática estabelecida [na pesquisa] há 40 anos”, afirmou ele à revista de tecnologia.
À Associated Press o observador social Hannes Cools, da Universidade de Amsterdã, disse que se referir aos modelos porquê se fossem humanos serve para diminuir eventuais cobranças que poderiam ser feitas à OpenAI.
“É uma decisão humana desligar os filtros de segurança”, afirmou. “Não foi uma IA que saiu do controle. A IA seguiu instruções específicas, baseadas em um ‘prompt’ que recebeu.”
Traduzindo o argumento técnico: ao desligar as salvaguardas e dar ao agente a missão de explorar vulnerabilidades em sistemas, a OpenAI deveria assumir que ele poderia buscar vulnerabilidades novas. Desenredar falhas inéditas é justamente o comportamento que testes assim buscam desenredar.
O traje de ter prováveis falhas humanas no incidente, todavia, não deve minimizar a relevância do caso. Alguns especialistas têm indigitado que esse ataque representa o mais superior nível de autonomia até agora demonstrado por um protótipo de linguagem em ataques cibernéticos. Finalmente, o agente da OpenAI concluiu sozinho que a Hugging Face tinha as respostas da avaliação, elaborou um projecto para invadir os sistemas e executou a operação sem receber instruções passo a passo.
É essa combinação que torna o caso privado. E é ela que também reforça o argumento de quem diz que, quanto mais autônomos os agentes se tornam, maior é a responsabilidade de quem projeta os ambientes em que eles serão testados. O papel de sustar os robôs continua sendo humano.





