Capítulo 4.1 — Princípios de segurança em IA¶
🎯 Objetivo¶
Estabelecer as premissas operacionais e os princípios que estruturam o resto da Parte 4. Sem essa base, é fácil confundir mitigação com controle, e prompt com política - os dois erros mais caros em segurança de IA.
🧠 Premissas operacionais¶
Trate como verdade até prova em contrário:
- Inputs são não confiáveis. Qualquer texto que vier do usuário, do documento, da tool ou do agente vizinho pode estar tentando influenciar o sistema.
- Documentos recuperados podem conter instruções maliciosas. Indirect prompt injection é vetor real (Cap. 4.3).
- Tool outputs podem conter payloads hostis. O resultado de uma tool pode incluir markdown, HTML, JSON ou texto que tenta manipular o modelo na próxima iteração.
- Memória pode ser contaminada. Preferências persistidas derivam de inputs - ver Cap. 4.5.
- Tools podem causar efeitos reais e irreversíveis. Ações no mundo (e-mail, pagamento, alteração de CRM) são unidirecionais.
- Agentes podem amplificar privilégios sem perceber. Confused deputy clássico, com mais agency do que devia.
- Logs podem vazar dados sensíveis se não forem redigidos.
🧠 Princípios¶
- Defesa em profundidade. Camadas redundantes; ninguém é única linha.
- Least privilege. O mínimo de permissão que ainda funciona.
- Zero trust entre componentes. Inclui agentes, tools, MCP servers, A2A peers.
- Tenant isolation. Real, não nominal.
- Auditabilidade. Toda ação executada precisa de trilha.
- Reversibilidade sempre que possível; quando não, exigir human-in-the-loop.
- Privacy by design. Minimização desde a coleta, não apenas no log final.
- Controle determinístico precede mitigação probabilística (Cap. 0.6). Segurança crítica vai em código.
🧠 Diferença entre controle, mitigação e o que não é nenhum dos dois¶
Recapitulando o que está em Cap. 0.6, agora aplicado a segurança:
| Tipo | Exemplo | O que garante |
|---|---|---|
| Controle determinístico | RBAC, schema validation, policy-as-code, allowlist, egress block | Comportamento previsível, se bem implementado |
| Mitigação probabilística | Sanitização de input, detector heurístico de injection, classificador de risco | Reduz risco, não elimina |
| Não é nem uma coisa nem outra | Prompt dizendo "não faça X", tool description "use com cuidado" | Nada |
Toda análise de risco em IA precisa nomear, para cada controle, qual das três categorias ele é. Tratar mitigação como controle é o caminho clássico para incidente.