Pular para conteúdo

Capítulo 5.5 — Dashboards, alertas e SLOs

🎯 Objetivo

Definir dashboards e alertas mínimos para que a operação de IA seja vista cedo, antes de virar incidente que aparece em ticket de suporte.

📊 Dashboards mínimos

  1. Qualidade. Task success por intent/tenant/idioma; groundedness; regressões detectadas em eval; concordância humana em amostra.
  2. Custo. Custo por tarefa, por sucesso, por tenant, por agente; tokens por etapa; custo de retries; custo de eval.
  3. Latência. p50/p95/p99 por modelo, por tool, por retriever; TTFT/TPOT em self-host; latência fim a fim por intent.
  4. RAG. top-k, precision, recall, citation coverage; indexing lag; freshness mediana e p95; no-answer rate; truncation rate.
  5. Tools. Chamadas por tool, taxa de erro, timeouts, tentativas sem autorização, uso de tools deprecated.
  6. Segurança. Prompt injection detections; policy violations; DLP triggers; secret scanning hits; tentativas cross-tenant.
  7. Operação. Fallback rate, escalation rate, incidentes abertos, error budget, queima de SLO.

🚨 Alertas mínimos

  • Aumento súbito de custo por tarefa (>X% em janela).
  • p95/p99 acima do SLO por janela definida.
  • Aumento de tool errors.
  • Aumento de policy violations.
  • Queda de groundedness ou de task success por intent.
  • Aumento de no-answer rate ou de fallback.
  • Alta taxa de retry.
  • Uso de tool deprecated.
  • Tentativa de acesso cross-tenant.
  • Prompt injection detectada por classificador.
  • Schema validation errors em alta.
  • Indexing lag de RAG > SLA.

🧠 SLOs em IA

SLOs tradicionais (disponibilidade, latência) continuam valendo, mas em IA aparecem SLOs de qualidade:

  • p95 de task success > X.
  • Groundedness mediana > Y por intent crítico.
  • Custo por sucesso ≤ Z para tarefa A.
  • p95 de citation coverage ≥ W em respostas com RAG.

Como qualidade é difícil de medir em tempo real, os SLOs de qualidade vivem em janela móvel sobre eval contínuo, não em métrica instantânea de produção.