Quantization
Storing model weights at lower numeric precision to cut memory and cost, with a small quality trade-off.
La quantification fait passer chaque poids de, disons, 16 bits à 8 ou 4. Le modèle devient nettement plus petit et plus rapide, avec une dégradation généralement modeste, et c’est ce qui permet à des modèles performants de tourner sur un ordinateur portable ou un téléphone. La qualité perdue dépend de la méthode employée et du degré d’agressivité.
En pratique : Un modèle de 70B compressé pour tourner sur un seul GPU grand public.
Where this comes up
- AI Technology Trends 2026: The Complete Guide to What's Next
- An AI Just Designed an AI Chip in Two Weeks: What Redwood Really Proves
- DeepSeek V4.1 Flash Replaces V4 Pro: Pricing, Benchmarks, and What Changed Since V4 Flash
- How to Set Up ChatGPT Locally for Work in 2026
- Top AI Image Generators in 2026: Tools, Pricing & Prompts