Capítulo 4.5 — Memory poisoning e vector poisoning¶
🎯 Objetivo¶
Tratar memory poisoning e vector poisoning como riscos operacionais com mitigação possível, mas exigindo disciplina de ingestão, provenance e ciclo de vida.
🧠 Conceito¶
- Memory poisoning. Dado incorreto, malicioso ou ambíguo é persistido na memória do agente (preferência, fato, perfil) e reusado em interações futuras. Pode vir de input do usuário, de output do próprio modelo (auto-poisoning), de tool output ou de documento recuperado.
- Vector poisoning. Documento malicioso ou ruidoso entra no índice RAG. Em recuperações futuras, o trecho contaminado vira contexto e influencia respostas - inclusive disparando indirect prompt injection.
- Data poisoning em treino. Variante mais conhecida em ML tradicional: dataset de treino é contaminado para induzir comportamento específico no modelo. Fora do escopo direto deste capítulo (ver Cap. 4.9 - supply chain).
🛡️ Mitigações¶
Princípios comuns aos dois vetores:
- Pipeline de ingestão com validação. Schema, conteúdo, classificação de sensibilidade.
- Sanitização de payload conhecido. Remoção de markup hostil, caracteres de controle, instruções imperativas explícitas.
- Provenance. Cada documento/memória carrega origem, autor, timestamp, hash. Memória sem provenance não é confiável.
- Aprovação para fontes novas. Adicionar uma nova fonte de ingestão exige revisão, não só configuração.
- Isolamento por tenant. Memória e índices isolados; cross-tenant é classe inteira de risco eliminada por design.
- Evals adversariais. Conjunto de "documentos hostis" no eval set de retrieval e de agente.
- TTL e exclusão. Memória não é eterna; preferências expiram.
- Right to be forgotten implementado. Não apenas conceitualmente.
Específico de memória:
- Classificar tipo: fato confirmado, inferência, palpite do modelo. Persistir só o primeiro.
- Exigir confirmação para preferências persistentes (UX explícita).
- Permitir edição e exclusão pelo usuário.
Específico de vector store:
- Reindexação rápida quando um documento é considerado contaminado.
- Quarentena. Documentos suspeitos saem do índice de produção antes de investigação.
🧰 Exemplos práticos relacionados (planejados)¶
EX-SEC-04- simulação de vector poisoning com sanitização + reindex.
📚 Referências¶
- OWASP LLM Top 10 - LLM03 Training Data Poisoning: https://owasp.org/www-project-top-10-for-large-language-model-applications/
- MemGPT (memória estruturada): https://arxiv.org/abs/2310.08560