Pular para conteúdo

Capítulo 1.11 — Explainability, interpretabilidade e fairness

🎯 Objetivo

Cobrir SHAP, LIME, PDP e limites dessas técnicas - bem como fairness.

🧠 Conceitos

  • Interpretabilidade global - explicações que valem para todo o modelo.
  • Interpretabilidade local - explicações para uma predição específica.
  • SHAP - valores Shapley aproximados, baseados em teoria dos jogos.
  • LIME - modelo local linear aproximando o comportamento ao redor de uma instância.
  • PDP (Partial Dependence Plot) - efeito médio de uma feature.

⚠️ Limites

  • SHAP e LIME são aproximações - não são "a verdade" do modelo.
  • Podem ser instáveis (mesmo modelo, explicações diferentes).
  • Não substituem auditoria humana em decisões críticas.

🧠 Fairness

Métricas comuns:

  • Demographic parity - taxa positiva igual entre grupos.
  • Equalized odds - TPR e FPR iguais entre grupos.
  • Calibration parity - calibração igual entre grupos.

Trade-off: nem todas as métricas podem ser satisfeitas simultaneamente. A escolha é normativa, não técnica.

📌 Checklist

  • [ ] Métricas por segmento são reportadas?
  • [ ] Há documentação de fairness no model card?
  • [ ] Há revisão humana para decisões críticas?

📚 Referências