Prompt Caching
Reusing the processed form of a repeated prompt prefix so you do not pay full price for it again.
Quando muitas requisições compartilham um prefixo longo e estável — um system prompt, um documento, um conjunto de exemplos —, o cache permite que o provedor pule o reprocessamento. A economia é grande e praticamente de graça: coloque o conteúdo estável no começo e o conteúdo variável no fim.
Na prática: Um manual de 20,000 tokens colocado em cache uma vez e depois consultado mil vezes por um custo baixo.
Where this comes up
- ChatGPT 5.6: Release Date, Models, Pricing & Access
- ChatGPT Context Window: What It Is and What Actually Fits
- Claude Context Window: Size, What Counts Toward It, and How to Manage It
- Claude Fable 5 vs Opus 4.8: Benchmarks, Pricing & When to Switch
- Claude Fable 5 vs Opus 5: A Detailed Comparison
- Claude Fable 5: Price, API, Access, Safeguards & Use Cases