Capítulo 1.3 — Estatística prática para ML
🎯 Objetivo
Cobrir o mínimo estatístico operacional: bias, variance, overfitting/underfitting, calibração, ECE, intervalos de confiança e significância.
🧠 Conceitos centrais
- Bias - erro sistemático por simplificação excessiva. Leva a underfitting.
- Variance - sensibilidade excessiva ao dataset. Leva a overfitting.
- Underfitting - erro alto em treino e teste. Modelo não captura padrão.
- Overfitting - erro baixo em treino, alto em teste. Modelo memoriza ruído.
- Calibração - correspondência entre probabilidade prevista e frequência real observada.
- ECE (Expected Calibration Error) - diferença média ponderada entre confiança e acurácia em bins.
- Intervalo de confiança - faixa de incerteza para uma métrica.
- Significância estatística - t-test, bootstrap; permitem dizer se uma diferença é real ou ruído.
📏 Métricas de classificação
| Métrica |
Fórmula |
Quando usar |
| Accuracy |
(TP+TN)/total |
Classes balanceadas |
| Precision |
TP/(TP+FP) |
Custo de falso positivo alto |
| Recall |
TP/(TP+FN) |
Custo de falso negativo alto |
| F1 |
2·P·R/(P+R) |
Classes desbalanceadas |
| ROC-AUC |
Área sob ROC |
Comparação threshold-independente |
| PR-AUC |
Área sob PR |
Classes muito desbalanceadas |
| Brier score |
Erro quadrático de probabilidade |
Calibração |
| Log loss |
-log(p verdade) |
Calibração e ranking |
| ECE |
Diferença confiança vs acurácia |
Calibração |
📐 Métricas de regressão
| Métrica |
Quando usar |
| MAE |
Robusto a outliers |
| RMSE |
Penaliza outliers |
| MAPE |
Erro percentual |
| R² |
Variância explicada |
| Quantile loss |
Predição de quantis |
📊 Métricas de ranking e recomendação
| Métrica |
Quando usar |
| NDCG@k |
Ranking com relevância ordinal |
| MAP@k |
Múltiplos itens relevantes |
| MRR |
Posição do primeiro relevante |
| Hit rate@k |
Cobertura básica |
| Coverage |
Diversidade de itens recomendados |
| Diversity / serendipity |
Recomendação não trivial |
🚨 Modos de falha
- Acurácia alta com classe rara ignorada.
- Threshold padrão (0,5) tratado como sagrado.
- Modelo descalibrado usado em decisão financeira.
- Diferença estatística não testada antes de declarar "modelo melhor".
🛡️ Mitigações
- Avaliar com múltiplas métricas.
- Reportar intervalos de confiança via bootstrap.
- Aplicar calibração isotonic ou Platt scaling quando necessário.
- Usar testes pareados (bootstrap, McNemar) antes de declarar vitória.
📚 Referências