Pular para conteúdo

Capítulo 6.2 — Latência, throughput e percentis

🎯 Objetivo

Estabelecer a base mínima para discutir latência e throughput de sistemas de IA sem cair no anti-padrão clássico de "latência média está boa". Em produção, o que machuca é a cauda.

🧠 Métricas

  • p50 mostra a experiência média de quem está usando o sistema agora.
  • p95 mostra como o sistema responde no dia ruim - é a métrica que costuma virar SLO.
  • p99 mostra incidentes potenciais e clientes pequenos sendo prejudicados em silêncio por contenção, batching ou retry.
  • Throughput mede capacidade agregada e dimensiona infraestrutura.
  • Rate limits e quotas vêm do provider; monitore os dois lados (o que você consome e o que o provider impõe).

Em IA, latência também aparece em dois eixos diferentes - TTFT (prefill) e TPOT (decode) - discutidos em detalhe no Cap. 6.3. Otimizar o eixo errado é fonte recorrente de "trocamos o modelo e a percepção do usuário não mudou".

🚨 Anti-padrão

Definir SLO apenas em média. SLO de IA deve usar percentis, e a escolha entre p95 e p99 deveria ser explícita - não default.