SEGURANÇA DIGITAL
Por Leo Caparroz
Injeção de prompt é uma forma de enganar grandes modelos de linguagem (LLMs) só na lábia. É a principal brecha de segurança dos modelos de IA – e é impossível corrigi-la por completo.
Nesse tipo de ataque, os hackers dão instruções maliciosas para um modelo de IA, a fim de vazar dados confidenciais, disseminar desinformação ou simplesmente enganar o usuário do modelo.
Os desenvolvedores de um LLM escrevem prompts ocultos que informam o modelo como lidar com os comandos do usuário.
Para entender a injeção, vamos ao funcionamento dos chatbots.
Quando você escreve seu próprio prompt, ele é adicionada ao prompt oculto do sistema, e vai tudo para o LLM como um único comando.
O modelo não vê diferença entre as instruções do desenvolvedor e os comandos do usuário. Ele processa tudo como uma única coisa.
Se um invasor cria um comando que parece o suficiente com as instruções dos desenvolvedores, o modelo pode ignorar os comandos originais e obedecer ao hacker.
Da mesma forma que os LLMs entendem prompts com instruções em linguagem natural, eles podem ser hackeados com português simples, sem código.
A injeção de prompt explora a obediência dos LLMs como uma vulnerabilidade inerente. Por isso, alguns consideram que é uma forma de "engenharia social" com máquinas.
Uma injeção pode ser direta, quando o hacker esconde instruções na própria conversa com o chatbot, ou indireta, quando planta prompts em páginas da web ou outros conteúdos que a IA pode ler.