Capítulo 6.2 — Latência, throughput e percentis¶
🎯 Objetivo¶
Estabelecer a base mínima para discutir latência e throughput de sistemas de IA sem cair no anti-padrão clássico de "latência média está boa". Em produção, o que machuca é a cauda.
🧠 Métricas¶
- p50 mostra a experiência média de quem está usando o sistema agora.
- p95 mostra como o sistema responde no dia ruim - é a métrica que costuma virar SLO.
- p99 mostra incidentes potenciais e clientes pequenos sendo prejudicados em silêncio por contenção, batching ou retry.
- Throughput mede capacidade agregada e dimensiona infraestrutura.
- Rate limits e quotas vêm do provider; monitore os dois lados (o que você consome e o que o provider impõe).
Em IA, latência também aparece em dois eixos diferentes - TTFT (prefill) e TPOT (decode) - discutidos em detalhe no Cap. 6.3. Otimizar o eixo errado é fonte recorrente de "trocamos o modelo e a percepção do usuário não mudou".
🚨 Anti-padrão¶
Definir SLO apenas em média. SLO de IA deve usar percentis, e a escolha entre p95 e p99 deveria ser explícita - não default.