Inference Cost
Also called: token cost
What it costs to run a model in production, billed per token in and per token out.
Los tokens de entrada y los de salida suelen tener precios distintos, y la salida es el lado caro. Los costos escalan con la longitud de la conversación porque el historial se reenvía en cada turno, y por eso las apps de chat ingenuas se vuelven caras rápido. El caching, un contexto más corto y enrutar a modelos más pequeños son las palancas estándar.
En la práctica: Reenviar un documento de 50 páginas con cada pregunta de seguimiento, y pagarlo cada vez.
Where this comes up
- DeepSeek V4.1 Flash Replaces V4 Pro: Pricing, Benchmarks, and What Changed Since V4 Flash
- GPT-6 Sol Benchmarks: How to Read the Scores and Run Your Own Evaluation
- GPT-6 Sol vs GPT-6 Astra: A Workload-Based Comparison
- GPT-Live-1 in the API: Pricing, Full-Duplex Voice, and the Configuration Behind Every Benchmark
- Will AI Replace DevOps Engineers? Reading the Divergence in the Data