| Prompt caching |
Reduz custo e latência de prefixos |
Exige prefixo estável |
| Semantic cache |
Evita recomputar respostas similares |
Risco de resposta stale |
| Model routing |
Usa modelo menor quando possível |
Roteamento pode errar |
| Reranking seletivo |
Melhora qualidade onde importa |
Custo adicional |
| Streaming |
Melhora percepção de latência |
Não reduz custo total |
| Batch |
Reduz custo em assíncrono |
Aumenta latência |
| Compactação de contexto |
Reduz tokens |
Pode perder evidência |
| Tool result compression |
Reduz contexto |
Pode esconder detalhes |
| Early exit |
Encerra com confiança alta |
Pode parar cedo demais |