# Kvantisering

> Kvantisering innebär att en modells vikter lagras med lägre numerisk precision — 4- eller 8-bitars heltal i stället för 16-bitars flyttal — så att modellen…

Source: https://northerngo.com/sv/ordlista/kvantisering/
Language: sv
Updated: 2026-08-28

---
**Kvantisering innebär att en modells vikter lagras med lägre numerisk precision — 4- eller 8-bitars heltal i stället för 16-bitars flyttal — så att modellen behöver mindre minne och går snabbare. Det är det som gör det möjligt att köra en modell med miljarder parametrar på ett konsumentgrafikkort.**

### Räknestycket som avgör vad som får plats

Minnet för vikter är i grova drag antal parametrar gånger byte per parameter. En modell med åtta miljarder parametrar behöver ungefär 16 GB vid 16-bitars precision, ungefär 8 GB vid 8 bitar och ungefär 4 till 5 GB vid 4 bitar. Det är skillnaden mellan "kräver ett datacenterkort" och "går på en bärbar dator", och det är hela skälet till att kvantisering finns överallt inom [lokal AI](/sv/ordlista/local-ai/).

Hastigheten förbättras också, av ett skäl som är lätt att missa: tokengenerering begränsas av hur snabbt vikter kan läsas från minnet, inte av räkneoperationerna. Att halvera antalet byte halverar i stort sett läsningen.

Du möter kvantisering mest som filändelser. `Q4_K_M` och `Q8_0` är GGUF-varianter som används av llama.cpp och [Ollama](/sv/ordlista/ollama/); `q4f16_1` är MLC-konventionen som webbläsarkörtider på [WebGPU](/sv/ordlista/webgpu/) använder. Det viktiga är bitbredden och om det är ett blandat schema som håller känsliga lager på högre precision — de flesta bra 4-bitsformat gör det.

### Vad du bör se upp med

**Kvantisering gör inte modellen mindre i betydelsen att kunskap tas bort — den gör varje tal mindre exakt.** Antalet parametrar är oförändrat. Skillnaden spelar roll eftersom den förutsäger var skadan syns: inte som glömda fakta utan som något sämre omdöme, mindre pålitlig formatering och mer avdrift i långa svar.

Tre saker värda att känna till:

- **Kvalitetskurvan är inte linjär.** 8 bitar är oftast oskiljbart från full precision. 4 bitar är en mild och ofta acceptabel förlust. Under 4 bitar blir försämringen snabbt uppenbar.
- **En större modell hårdare kvantiserad slår oftast en mindre modell i full precision**, vid samma minnesbudget. Det är standardrådet och det håller förvånansvärt väl.
- **Förlusterna beror på uppgiften.** Chatt och sammanfattning klarar 4 bitar bra. Exakt instruktionsföljande, strukturerad utdata och långa resonemangskedjor drabbas hårdast — precis det som kodgenerering vilar på. Om en kvantiserad modell hela tiden bryter ett givet utdataformat är det en trolig orsak.

Testa på din egen arbetsbelastning i stället för att lita på ett perplexitetstal. Perplexiteten rör sig knappt medan beteendet du bryr dig om försämras.

---

NorthernGo är en AI-driven plattform för att bygga produktionsklara webbappar utan kod. Lokal AI-generering via WebGPU är obegränsad och gratis, och du äger all genererad källkod. https://northerngo.com/
