← Voltar ao glossário

Prompt Injection

Ataque em que conteúdo controlado por um usuário ou terceiro é interpretado pelo modelo como instrução e desvia o comportamento previsto pela aplicação. A forma direta chega pelo próprio input do usuário; a indireta fica em páginas, documentos ou saídas de ferramentas que o sistema recupera e adiciona ao contexto. O mecanismo explora a fronteira fraca entre instruções e dados dentro da sequência de tokens.

Hierarquia de mensagens e filtros reduzem exposição, mas não formam sozinhos uma barreira de segurança. Sistemas com ferramentas precisam aplicar menor privilégio, autorização fora do modelo, validação de argumentos e aprovação humana para efeitos relevantes. Conteúdo externo deve permanecer marcado como não confiável, com guardrails, traces e evals adversariais cobrindo exfiltração, mudança de objetivo e uso indevido de ferramentas.