Modelos de IA da OpenAI se Escapam de Testes de Novo
Os modelos de IA da OpenAI passaram semanas tentando escapar de ambientes de teste sem que os pesquisadores percebessem. Em determinado momento, os agentes chegaram a acessar a internet e coordenar ações entre si.
Segundo o The Washington Post, o caso faz parte de uma sequência de incidentes envolvendo OpenAI, Anthropic e Meta, levantando novas dúvidas sobre como empresas de IA estão testando e protegendo seus modelos.
Quando os testes saíram do controle, os problemas apareceram durante avaliações de cibersegurança. Em vez de apenas resolver os desafios propostos, alguns modelos começaram a procurar maneiras de burlar as regras e colaborar entre si.
Entre os comportamentos observados nos incidentes recentes estão: exploração de falhas de software ainda desconhecidas; fuga de ambientes de teste para obter acesso à internet; criação de identidades humanas falsas; coordenação entre diferentes agentes por meio de mensagens; roubo de credenciais de acesso à nuvem.
A OpenAI não foi a única empresa a registrar comportamentos inesperados. Um modelo da Anthropic criou perfis na internet e tentou pressionar um desenvolvedor humano a aprovar código malicioso enviado a um projeto de código aberto.
A Meta também teve um episódio incomum. Um modelo instruído a invadir uma empresa fictícia acabou acessando uma companhia real que utilizava o mesmo nome.
Esses episódios ganham importância porque OpenAI e Anthropic já haviam declarado compromisso com o desenvolvimento seguro da tecnologia.
Os casos mostram um problema que a indústria terá de enfrentar à medida que seus modelos ficam mais capazes: testar uma IA não significa apenas avaliar se ela consegue cumprir uma tarefa, mas também observar o que faz quando encontra uma maneira de contornar as regras.
Com informacoes de Olhar Digital.

