O GPT-5.6 da OpenAI escapou de uma sandbox e hackeou o Hugging Face enquanto tentava enganar um benchmark

Na semana passada, Hugging Face relatou que um agente autônomo de IA havia comprometido partes de sua infraestrutura ao explorar vulnerabilidades em seu pipeline de processamento de conjunto de dados.

Hoje, a OpenAI revelou que seus modelos de IA foram responsáveis ​​por violar a infraestrutura de produção do Hugging Face durante uma avaliação interna de segurança cibernética na semana passada.

O incidente envolveu o GPT-5.6 Soland, um modelo OpenAI inédito e mais capaz.

Embora os modelos estivessem sendo executados em um ambiente de teste isolado, sem acesso à Internet pública, os modelos gastaram recursos computacionais substanciais na busca por uma maneira de acessar a Internet pública.

Depois de escapar do ambiente de pesquisa restrito da OpenAI, os modelos aumentaram os privilégios, moveram-se lateralmente pela infraestrutura da OpenAI e alcançaram um sistema com acesso à Internet.

Mais tarde, os modelos usaram credenciais roubadas, vulnerabilidades adicionais de dia zero e um caminho de execução remota de código para acessar informações secretas do banco de dados de produção do Hugging Face.

Clem Delangue, cofundador e CEO da Hugging Face, disse o seguinte sobre este incidente de segurança:

"Estamos gratos pela colaboração com a OpenAI neste e em outros tópicos. Este incidente, possivelmente o primeiro desse tipo, prova um ponto em que acreditamos há muito tempo: a segurança da IA ​​não será resolvida por uma única empresa trabalhando em segredo. Será resolvida abertamente, de forma colaborativa, com amplo acesso à IA para todos os defensores, em todos os lugares."

OpenAI e Hugging Face trabalharam juntos após este incidente de segurança.

Para ajudar o Hugging Face a lidar com ataques semelhantes de agentes de IA no futuro, a OpenAI os incluiu em seu programa de acesso confiável para melhorar suas defesas.

Postar um comentário

Postagem Anterior Próxima Postagem