OpenAI Desenvolve IA para Atacar e Fortalecer Segurança de Modelos de Linguagem
A OpenAI revelou recentemente o GPT-Red, um novo modelo de IA criado com o objetivo de atacar e encontrar vulnerabilidades nos próprios sistemas da empresa. A ferramenta simplifica os testes de segurança para blindar as novas gerações de modelos de linguagem contra ameaças antes de chegarem ao mercado.
O foco principal do GPT-Red é combater a injeção de comandos, que são textos criados para “enganar” uma IA, forçando o sistema a contornar suas regras de segurança. Com a integração cada vez maior dos assistentes a arquivos locais, navegadores e aplicativos de terceiros, uma instrução perigosa pode ser camuflada no meio de um e-mail comum ou em uma página da web, agindo em segundo plano, sem que o usuário perceba.
O modelo atua como se fosse um hacker humano, enviando um comando inicial para a inteligência artificial que está sendo testada, avaliando a resposta gerada e ajustando as mensagens seguintes sozinho. Esse ciclo se repete até a ferramenta atingir um objetivo pré-determinado, como forçar o vazamento de dados confidenciais para um servidor externo.
Para ficar mais experiente, a OpenAI utiliza o método de aprendizado por reforço, onde o sistema aprende a tomar decisões por tentativa e erro, recebendo “recompensas” ao acertar um ataque e “penalidades” ao falhar, até descobrir a estratégia invasiva mais eficiente. Isso cria um ecossistema de evolução contínua, onde as IAs de defesa ficam mais robustas, e o GPT-Red é obrigado a inventar mecanismos de invasão mais complexos e criativos.
Os testes internos mostram a eficiência da abordagem automatizada, com o GPT-Red obtendo sucesso em 84% dos cenários propostos, enquanto especialistas humanos superaram os bloqueios em apenas 13% das tentativas. A OpenAI também testou o GPT-Red contra aplicações usadas no mercado, incluindo um software de uma máquina de venda automática gerenciada por inteligência artificial, onde o modelo cumpriu todos os objetivos do teste.
Devido ao alto poder de manipulação, a OpenAI confirmou que o GPT-Red não será liberado para clientes e desenvolvedores independentes, como uma precaução para evitar que agentes mal-intencionados tenham acesso às capacidades do programa e automatizem ataques cibernéticos contra outras plataformas. O plano da companhia é manter a nova inteligência artificial operando exclusivamente nos bastidores para proteger sua própria infraestrutura.
Com informacoes de Tecnoblog.

