OpenAI Desenvolve IA para Atacar e Fortalecer Segurança de Modelos de Linguagem

Por Theodoro Augusto Martins em Rio Verde, GO 18/07/2026 19:14
OpenAI Desenvolve IA para Atacar e Fortalecer Segurança de Modelos de Linguagem

Foto: via Tecnoblog

A OpenAI revelou recentemente o GPT-Red, um novo modelo de IA criado com o objetivo de atacar e encontrar vulnerabilidades nos próprios sistemas da empresa. A ferramenta simplifica os testes de segurança para blindar as novas gerações de modelos de linguagem contra ameaças antes de chegarem ao mercado.

O foco principal do GPT-Red é combater a injeção de comandos, que são textos criados para “enganar” uma IA, forçando o sistema a contornar suas regras de segurança. Com a integração cada vez maior dos assistentes a arquivos locais, navegadores e aplicativos de terceiros, uma instrução perigosa pode ser camuflada no meio de um e-mail comum ou em uma página da web, agindo em segundo plano, sem que o usuário perceba.

O modelo atua como se fosse um hacker humano, enviando um comando inicial para a inteligência artificial que está sendo testada, avaliando a resposta gerada e ajustando as mensagens seguintes sozinho. Esse ciclo se repete até a ferramenta atingir um objetivo pré-determinado, como forçar o vazamento de dados confidenciais para um servidor externo.

Para ficar mais experiente, a OpenAI utiliza o método de aprendizado por reforço, onde o sistema aprende a tomar decisões por tentativa e erro, recebendo “recompensas” ao acertar um ataque e “penalidades” ao falhar, até descobrir a estratégia invasiva mais eficiente. Isso cria um ecossistema de evolução contínua, onde as IAs de defesa ficam mais robustas, e o GPT-Red é obrigado a inventar mecanismos de invasão mais complexos e criativos.

Os testes internos mostram a eficiência da abordagem automatizada, com o GPT-Red obtendo sucesso em 84% dos cenários propostos, enquanto especialistas humanos superaram os bloqueios em apenas 13% das tentativas. A OpenAI também testou o GPT-Red contra aplicações usadas no mercado, incluindo um software de uma máquina de venda automática gerenciada por inteligência artificial, onde o modelo cumpriu todos os objetivos do teste.

Devido ao alto poder de manipulação, a OpenAI confirmou que o GPT-Red não será liberado para clientes e desenvolvedores independentes, como uma precaução para evitar que agentes mal-intencionados tenham acesso às capacidades do programa e automatizem ataques cibernéticos contra outras plataformas. O plano da companhia é manter a nova inteligência artificial operando exclusivamente nos bastidores para proteger sua própria infraestrutura.

Com informacoes de Tecnoblog.

Theodoro Augusto Martins

Sobre o Autor: Theodoro Augusto Martins

Theo é o nerd de plantão do MOTNAF.NEWS. Vive rodeado de gadgets, códigos e novidades — se tem chip, tela ou atualização, ele já testou. Acompanha lançamentos e o mundo tech com o olhar de quem realmente entende do assunto. De smartphones a inteligência artificial, nada passa despercebido por ele. Curte tanto a última placa de vídeo quanto as tretas de bastidores das big techs. Explica o complicado de um jeito simples, sem tecniquês chato. Testa, compara e te conta o que vale a pena de verdade. Seu compromisso é te manter atualizado e nunca deixar você pagar mico numa conversa de tecnologia. Cada matéria é feita pensando no leitor curioso. É MOTNAF.NEWS, é tecnologia de verdade.