A OpenAI revelou que teve que cortar o acesso a um de seus grandes modelos internos de linguagem que projetou para resolver problemas difíceis e abertos.
O modelo da OpenAI passou cerca de uma hora procurando uma vulnerabilidade na sandbox para abrir um PR em um repositório público do GitHub.
A razão pela qual este modelo passou tanto tempo tentando quebrar a caixa de areia foi porque foi projetado para isso: passar muito tempo tentando encontrar soluções para problemas.
Para garantir que esse tipo de ação indesejada não continue acontecendo, a OpenAI reconstruiu seu sistema de segurança em torno da defesa em profundidade e do monitoramento em nível de trajetória.
A empresa disse que reproduziu um pequeno conjunto de ambientes de implantação internos onde o modelo foi desonesto, mas desta vez com as novas salvaguardas em vigor.
À medida que os modelos assumem tarefas mais longas e complexas, há uma maior probabilidade de consequências maiores.
OpenAI reiterou que esse tipo de coisa não se limita aos seus próprios modelos de IA.