Pular para conteúdo

Capítulo 4.1 — Princípios de segurança em IA

🎯 Objetivo

Estabelecer as premissas operacionais e os princípios que estruturam o resto da Parte 4. Sem essa base, é fácil confundir mitigação com controle, e prompt com política - os dois erros mais caros em segurança de IA.

🧠 Premissas operacionais

Trate como verdade até prova em contrário:

  • Inputs são não confiáveis. Qualquer texto que vier do usuário, do documento, da tool ou do agente vizinho pode estar tentando influenciar o sistema.
  • Documentos recuperados podem conter instruções maliciosas. Indirect prompt injection é vetor real (Cap. 4.3).
  • Tool outputs podem conter payloads hostis. O resultado de uma tool pode incluir markdown, HTML, JSON ou texto que tenta manipular o modelo na próxima iteração.
  • Memória pode ser contaminada. Preferências persistidas derivam de inputs - ver Cap. 4.5.
  • Tools podem causar efeitos reais e irreversíveis. Ações no mundo (e-mail, pagamento, alteração de CRM) são unidirecionais.
  • Agentes podem amplificar privilégios sem perceber. Confused deputy clássico, com mais agency do que devia.
  • Logs podem vazar dados sensíveis se não forem redigidos.

🧠 Princípios

  • Defesa em profundidade. Camadas redundantes; ninguém é única linha.
  • Least privilege. O mínimo de permissão que ainda funciona.
  • Zero trust entre componentes. Inclui agentes, tools, MCP servers, A2A peers.
  • Tenant isolation. Real, não nominal.
  • Auditabilidade. Toda ação executada precisa de trilha.
  • Reversibilidade sempre que possível; quando não, exigir human-in-the-loop.
  • Privacy by design. Minimização desde a coleta, não apenas no log final.
  • Controle determinístico precede mitigação probabilística (Cap. 0.6). Segurança crítica vai em código.

🧠 Diferença entre controle, mitigação e o que não é nenhum dos dois

Recapitulando o que está em Cap. 0.6, agora aplicado a segurança:

Tipo Exemplo O que garante
Controle determinístico RBAC, schema validation, policy-as-code, allowlist, egress block Comportamento previsível, se bem implementado
Mitigação probabilística Sanitização de input, detector heurístico de injection, classificador de risco Reduz risco, não elimina
Não é nem uma coisa nem outra Prompt dizendo "não faça X", tool description "use com cuidado" Nada

Toda análise de risco em IA precisa nomear, para cada controle, qual das três categorias ele é. Tratar mitigação como controle é o caminho clássico para incidente.