Inference Cost
Also called: token cost
What it costs to run a model in production, billed per token in and per token out.
Les tokens d’entrée et de sortie sont généralement tarifés différemment, la sortie étant le côté cher. Les coûts augmentent avec la longueur de la conversation, puisque l’historique est renvoyé à chaque tour, ce qui explique pourquoi les applications de chat naïves deviennent vite ruineuses. Le cache, un contexte plus court et le routage vers des modèles plus petits sont les leviers habituels.
En pratique : Renvoyer un document de 50 pages à chaque question de suivi, et le payer à chaque fois.
Where this comes up
- DeepSeek V4.1 Flash Replaces V4 Pro: Pricing, Benchmarks, and What Changed Since V4 Flash
- GPT-6 Sol Benchmarks: How to Read the Scores and Run Your Own Evaluation
- GPT-6 Sol vs GPT-6 Astra: A Workload-Based Comparison
- GPT-Live-1 in the API: Pricing, Full-Duplex Voice, and the Configuration Behind Every Benchmark
- Will AI Replace DevOps Engineers? Reading the Divergence in the Data