A OpenAI desligou o poderoso modelo interno de IA depois que saiu de sua sandbox

A OpenAI revelou que teve que cortar o acesso a um de seus grandes modelos internos de linguagem que projetou para resolver problemas difíceis e abertos.

O modelo da OpenAI passou cerca de uma hora procurando uma vulnerabilidade na sandbox para abrir um PR em um repositório público do GitHub.

A razão pela qual este modelo passou tanto tempo tentando quebrar a caixa de areia foi porque foi projetado para isso: passar muito tempo tentando encontrar soluções para problemas.

Para garantir que esse tipo de ação indesejada não continue acontecendo, a OpenAI reconstruiu seu sistema de segurança em torno da defesa em profundidade e do monitoramento em nível de trajetória.

A empresa disse que reproduziu um pequeno conjunto de ambientes de implantação internos onde o modelo foi desonesto, mas desta vez com as novas salvaguardas em vigor.

À medida que os modelos assumem tarefas mais longas e complexas, há uma maior probabilidade de consequências maiores.

OpenAI reiterou que esse tipo de coisa não se limita aos seus próprios modelos de IA.

Postar um comentário

Postagem Anterior Próxima Postagem