SEGURANÇA DIGITAL

O que é "injeção de prompt"?

O que é "injeção de prompt"?

Por Leo Caparroz

Injeção de prompt é uma forma de enganar grandes modelos de linguagem (LLMs) só na lábia. É a principal brecha de segurança dos modelos de IA – e é impossível corrigi-la por completo.

Nesse tipo de ataque, os hackers dão instruções maliciosas para um modelo de IA, a fim de vazar dados confidenciais, disseminar desinformação ou simplesmente enganar o usuário do modelo.

Os desenvolvedores de um LLM escrevem prompts ocultos que informam o modelo como lidar com os comandos do usuário.

Para entender a injeção, vamos ao funcionamento dos chatbots.

Quando você escreve seu próprio prompt, ele é adicionada ao prompt oculto do sistema, e vai tudo para o LLM como um único comando.

O modelo não vê diferença entre as instruções do desenvolvedor e os comandos do usuário. Ele processa tudo como uma única coisa.

Se um invasor cria um comando que parece o suficiente com as instruções dos desenvolvedores, o modelo pode ignorar os comandos originais e obedecer ao hacker.

Da mesma forma que os LLMs entendem prompts com instruções em linguagem natural, eles podem ser hackeados com português simples, sem código.

A injeção de prompt explora a obediência dos LLMs como uma vulnerabilidade inerente. Por isso, alguns consideram que é uma forma de "engenharia social" com máquinas.

Uma injeção pode ser direta, quando o hacker esconde instruções na própria conversa com o chatbot, ou indireta, quando planta prompts em páginas da web ou outros conteúdos que a IA pode ler.

Veja exemplos na matéria completa:

Veja exemplos na matéria completa: