Quantization
Storing model weights at lower numeric precision to cut memory and cost, with a small quality trade-off.
A quantização encolhe cada peso de, digamos, 16 bits para 8 ou 4. O modelo fica drasticamente menor e mais rápido, com degradação em geral modesta, e é isso que permite rodar modelos capazes em um notebook ou em um celular. Quanta qualidade você perde depende do método e de quão agressivo você resolve ser.
Na prática: Um modelo de 70B comprimido para rodar em uma única GPU de consumo.
Where this comes up
- AI Technology Trends 2026: The Complete Guide to What's Next
- An AI Just Designed an AI Chip in Two Weeks: What Redwood Really Proves
- DeepSeek V4.1 Flash Replaces V4 Pro: Pricing, Benchmarks, and What Changed Since V4 Flash
- How to Set Up ChatGPT Locally for Work in 2026
- Top AI Image Generators in 2026: Tools, Pricing & Prompts