Quantization
Storing model weights at lower numeric precision to cut memory and cost, with a small quality trade-off.
Quantisierung schrumpft jedes Gewicht von zum Beispiel 16 Bit auf 8 oder 4. Das Modell wird dramatisch kleiner und schneller, meist bei überschaubarer Verschlechterung — genau das erlaubt es, leistungsfähige Modelle auf einem Laptop oder einem Smartphone laufen zu lassen. Wie viel Qualität du verlierst, hängt von der Methode ab und davon, wie aggressiv du vorgehst.
In der Praxis: Ein 70B-Modell, so komprimiert, dass es auf einer einzelnen Consumer-GPU läuft.
Where this comes up
- AI Technology Trends 2026: The Complete Guide to What's Next
- An AI Just Designed an AI Chip in Two Weeks: What Redwood Really Proves
- DeepSeek V4.1 Flash Replaces V4 Pro: Pricing, Benchmarks, and What Changed Since V4 Flash
- How to Set Up ChatGPT Locally for Work in 2026
- Top AI Image Generators in 2026: Tools, Pricing & Prompts