Kvantisering
Kvantisering innebär att en modells vikter lagras med lägre numerisk precision — 4- eller 8-bitars heltal i stället för 16-bitars flyttal — så att modellen behöver mindre minne och går snabbare. Det är det som gör det möjligt att köra en modell med miljarder parametrar på ett konsumentgrafikkort.
Räknestycket som avgör vad som får plats
Minnet för vikter är i grova drag antal parametrar gånger byte per parameter. En modell med åtta miljarder parametrar behöver ungefär 16 GB vid 16-bitars precision, ungefär 8 GB vid 8 bitar och ungefär 4 till 5 GB vid 4 bitar. Det är skillnaden mellan "kräver ett datacenterkort" och "går på en bärbar dator", och det är hela skälet till att kvantisering finns överallt inom lokal AI.
Hastigheten förbättras också, av ett skäl som är lätt att missa: tokengenerering begränsas av hur snabbt vikter kan läsas från minnet, inte av räkneoperationerna. Att halvera antalet byte halverar i stort sett läsningen.
Du möter kvantisering mest som filändelser. Q4_K_M och Q8_0 är GGUF-varianter som används av llama.cpp och Ollama; q4f16_1 är MLC-konventionen som webbläsarkörtider på WebGPU använder. Det viktiga är bitbredden och om det är ett blandat schema som håller känsliga lager på högre precision — de flesta bra 4-bitsformat gör det.
Vad du bör se upp med
Kvantisering gör inte modellen mindre i betydelsen att kunskap tas bort — den gör varje tal mindre exakt. Antalet parametrar är oförändrat. Skillnaden spelar roll eftersom den förutsäger var skadan syns: inte som glömda fakta utan som något sämre omdöme, mindre pålitlig formatering och mer avdrift i långa svar.
Tre saker värda att känna till:
- Kvalitetskurvan är inte linjär. 8 bitar är oftast oskiljbart från full precision. 4 bitar är en mild och ofta acceptabel förlust. Under 4 bitar blir försämringen snabbt uppenbar.
- En större modell hårdare kvantiserad slår oftast en mindre modell i full precision, vid samma minnesbudget. Det är standardrådet och det håller förvånansvärt väl.
- Förlusterna beror på uppgiften. Chatt och sammanfattning klarar 4 bitar bra. Exakt instruktionsföljande, strukturerad utdata och långa resonemangskedjor drabbas hårdast — precis det som kodgenerering vilar på. Om en kvantiserad modell hela tiden bryter ett givet utdataformat är det en trolig orsak.
Testa på din egen arbetsbelastning i stället för att lita på ett perplexitetstal. Perplexiteten rör sig knappt medan beteendet du bryr dig om försämras.
Vanliga frågor
Vilken kvantiseringsnivå bör jag välja?
Börja på 4 bitar i ett blandat schema som Q4_K_M; det är den vanliga balanspunkten och får plats på det mesta av konsumenthårdvara. Gå upp till 8 bitar om du har minnet och uppgiften kräver exakt formatering eller strukturerad utdata. Under 4 bitar bara när inget annat får plats, och testa innan du litar på det.
Bygg det själv
NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.