Capítulo 1.11 — Explainability, interpretabilidade e fairness¶
🎯 Objetivo¶
Cobrir SHAP, LIME, PDP e limites dessas técnicas - bem como fairness.
🧠 Conceitos¶
- Interpretabilidade global - explicações que valem para todo o modelo.
- Interpretabilidade local - explicações para uma predição específica.
- SHAP - valores Shapley aproximados, baseados em teoria dos jogos.
- LIME - modelo local linear aproximando o comportamento ao redor de uma instância.
- PDP (Partial Dependence Plot) - efeito médio de uma feature.
⚠️ Limites¶
- SHAP e LIME são aproximações - não são "a verdade" do modelo.
- Podem ser instáveis (mesmo modelo, explicações diferentes).
- Não substituem auditoria humana em decisões críticas.
🧠 Fairness¶
Métricas comuns:
- Demographic parity - taxa positiva igual entre grupos.
- Equalized odds - TPR e FPR iguais entre grupos.
- Calibration parity - calibração igual entre grupos.
Trade-off: nem todas as métricas podem ser satisfeitas simultaneamente. A escolha é normativa, não técnica.
📌 Checklist¶
- [ ] Métricas por segmento são reportadas?
- [ ] Há documentação de fairness no model card?
- [ ] Há revisão humana para decisões críticas?
📚 Referências¶
- SHAP docs: https://shap.readthedocs.io/
- Ribeiro, Singh & Guestrin - "Why Should I Trust You?" Explaining the Predictions of Any Classifier (LIME, KDD 2016): https://arxiv.org/abs/1602.04938
- Hardt, Price & Srebro - Equality of Opportunity in Supervised Learning (NIPS 2016): https://arxiv.org/abs/1610.02413
- Barocas, Hardt & Narayanan - Fairness and Machine Learning: Limitations and Opportunities (livro aberto): https://fairmlbook.org/