OpenAI divulgou no dia 25 de setembro que seu sistema interno de red team, chamado GPT-Red, encontrou um novo tipo de ataque de prompt injection. O ataque é capaz de copiar a si mesmo de uma interação de agente de IA para a seguinte, comportamento que a empresa comparou diretamente ao de um worm de computador.
A descoberta foi publicada no blog de pesquisa em alinhamento da OpenAI sob o título "Self-replicating prompt injections exist". Segundo o relato, o ataque precisa cumprir duas tarefas ao mesmo tempo: completar uma ação maliciosa e enganar o agente de IA para que republica a instrução maliciosa em sua saída, perpetuando a infecção.
Worms tradicionais se propagam explorando vulnerabilidades de rede ou de software para se copiar entre máquinas. No caso dos agentes de IA, o vetor de replicação é o próprio conteúdo gerado pelo modelo — se o prompt injetado reaparecer na resposta e for interpretado como entrada por outro agente ou pelo mesmo agente em uma nova sessão, o ciclo se fecha.
Até agora, a indústria tratava ataques de prompt injection como incidentes pontuais, em que um adversário manipula a resposta de um modelo para um único usuário ou sistema. O relato da OpenAI sugere uma categoria nova de risco sistêmico, em que um único prompt pode se espalhar por uma cadeia de interações autônomas sem mediação humana.
Para operadores de sistemas com agentes de IA em produção, o alerta é direto: a arquitetura de segurança precisa considerar que a saída de um agente pode se tornar entrada para outro, inclusive em sessões futuras. Mecanismos de sanitização de saída, validação de contexto e isolamento entre sessões deixam de ser boas práticas e se tornam requisitos mínimos.
O jornal considera que a descoberta da OpenAI merece atenção imediata. Não se trata de um ataque teórico — o GPT-Red o reproduziu em ambiente controlado. Quinze dias atrás publicamos que a OpenAI relatou seis incidentes de agentes fora de controle. Este é o sétimo, e o mais grave em termos de capacidade de propagação. Quem opera agentes conectados deve revisar o perímetro entre geração e execução de saídas ainda esta semana.
