Pular para conteúdo

Capítulo 1.3 — Estatística prática para ML

🎯 Objetivo

Cobrir o mínimo estatístico operacional: bias, variance, overfitting/underfitting, calibração, ECE, intervalos de confiança e significância.

🧠 Conceitos centrais

  • Bias - erro sistemático por simplificação excessiva. Leva a underfitting.
  • Variance - sensibilidade excessiva ao dataset. Leva a overfitting.
  • Underfitting - erro alto em treino e teste. Modelo não captura padrão.
  • Overfitting - erro baixo em treino, alto em teste. Modelo memoriza ruído.
  • Calibração - correspondência entre probabilidade prevista e frequência real observada.
  • ECE (Expected Calibration Error) - diferença média ponderada entre confiança e acurácia em bins.
  • Intervalo de confiança - faixa de incerteza para uma métrica.
  • Significância estatística - t-test, bootstrap; permitem dizer se uma diferença é real ou ruído.

📏 Métricas de classificação

Métrica Fórmula Quando usar
Accuracy (TP+TN)/total Classes balanceadas
Precision TP/(TP+FP) Custo de falso positivo alto
Recall TP/(TP+FN) Custo de falso negativo alto
F1 2·P·R/(P+R) Classes desbalanceadas
ROC-AUC Área sob ROC Comparação threshold-independente
PR-AUC Área sob PR Classes muito desbalanceadas
Brier score Erro quadrático de probabilidade Calibração
Log loss -log(p verdade) Calibração e ranking
ECE Diferença confiança vs acurácia Calibração

📐 Métricas de regressão

Métrica Quando usar
MAE Robusto a outliers
RMSE Penaliza outliers
MAPE Erro percentual
Variância explicada
Quantile loss Predição de quantis

📊 Métricas de ranking e recomendação

Métrica Quando usar
NDCG@k Ranking com relevância ordinal
MAP@k Múltiplos itens relevantes
MRR Posição do primeiro relevante
Hit rate@k Cobertura básica
Coverage Diversidade de itens recomendados
Diversity / serendipity Recomendação não trivial

🚨 Modos de falha

  • Acurácia alta com classe rara ignorada.
  • Threshold padrão (0,5) tratado como sagrado.
  • Modelo descalibrado usado em decisão financeira.
  • Diferença estatística não testada antes de declarar "modelo melhor".

🛡️ Mitigações

  • Avaliar com múltiplas métricas.
  • Reportar intervalos de confiança via bootstrap.
  • Aplicar calibração isotonic ou Platt scaling quando necessário.
  • Usar testes pareados (bootstrap, McNemar) antes de declarar vitória.

📚 Referências