Pular para conteúdo

Capítulo 6.4 — Caching, model routing e otimizações

🧠 Técnicas

Técnica Benefício Trade-off
Prompt caching Reduz custo e latência de prefixos Exige prefixo estável
Semantic cache Evita recomputar respostas similares Risco de resposta stale
Model routing Usa modelo menor quando possível Roteamento pode errar
Reranking seletivo Melhora qualidade onde importa Custo adicional
Streaming Melhora percepção de latência Não reduz custo total
Batch Reduz custo em assíncrono Aumenta latência
Compactação de contexto Reduz tokens Pode perder evidência
Tool result compression Reduz contexto Pode esconder detalhes
Early exit Encerra com confiança alta Pode parar cedo demais

📚 Referências