Capítulo 5.5 — Dashboards, alertas e SLOs¶
🎯 Objetivo¶
Definir dashboards e alertas mínimos para que a operação de IA seja vista cedo, antes de virar incidente que aparece em ticket de suporte.
📊 Dashboards mínimos¶
- Qualidade. Task success por intent/tenant/idioma; groundedness; regressões detectadas em eval; concordância humana em amostra.
- Custo. Custo por tarefa, por sucesso, por tenant, por agente; tokens por etapa; custo de retries; custo de eval.
- Latência. p50/p95/p99 por modelo, por tool, por retriever; TTFT/TPOT em self-host; latência fim a fim por intent.
- RAG. top-k, precision, recall, citation coverage; indexing lag; freshness mediana e p95; no-answer rate; truncation rate.
- Tools. Chamadas por tool, taxa de erro, timeouts, tentativas sem autorização, uso de tools deprecated.
- Segurança. Prompt injection detections; policy violations; DLP triggers; secret scanning hits; tentativas cross-tenant.
- Operação. Fallback rate, escalation rate, incidentes abertos, error budget, queima de SLO.
🚨 Alertas mínimos¶
- Aumento súbito de custo por tarefa (>X% em janela).
- p95/p99 acima do SLO por janela definida.
- Aumento de tool errors.
- Aumento de policy violations.
- Queda de groundedness ou de task success por intent.
- Aumento de no-answer rate ou de fallback.
- Alta taxa de retry.
- Uso de tool
deprecated. - Tentativa de acesso cross-tenant.
- Prompt injection detectada por classificador.
- Schema validation errors em alta.
- Indexing lag de RAG > SLA.
🧠 SLOs em IA¶
SLOs tradicionais (disponibilidade, latência) continuam valendo, mas em IA aparecem SLOs de qualidade:
- p95 de task success > X.
- Groundedness mediana > Y por intent crítico.
- Custo por sucesso ≤ Z para tarefa A.
- p95 de citation coverage ≥ W em respostas com RAG.
Como qualidade é difícil de medir em tempo real, os SLOs de qualidade vivem em janela móvel sobre eval contínuo, não em métrica instantânea de produção.