Quantization
Storing model weights at lower numeric precision to cut memory and cost, with a small quality trade-off.
La cuantización reduce cada peso de, digamos, 16 bits a 8 o 4. El modelo queda mucho más pequeño y más rápido, en general con una degradación modesta, y eso es lo que permite correr modelos capaces en una laptop o un teléfono. Cuánta calidad pierdes depende del método y de qué tan agresivo seas.
En la práctica: Un modelo de 70B comprimido para correr en una sola GPU de consumo.
Where this comes up
- AI Technology Trends 2026: The Complete Guide to What's Next
- An AI Just Designed an AI Chip in Two Weeks: What Redwood Really Proves
- DeepSeek V4.1 Flash Replaces V4 Pro: Pricing, Benchmarks, and What Changed Since V4 Flash
- How to Set Up ChatGPT Locally for Work in 2026
- Top AI Image Generators in 2026: Tools, Pricing & Prompts