Lokal AI
Lokal AI innebär att en modell körs på samma maskin som använder den — din dator, din telefon eller din egen server — i stället för att anropa en leverantör över internet. Prompten och svaret stannar på enheten, och inget kostar per anrop.
Varför folk vill ha det
Tre skäl, oftast i den här ordningen. Sekretess: text som aldrig lämnar maskinen kan inte loggas, sparas eller användas för träning av någon annan. Kostnad: när hårdvaran är betald är generering gratis, så du kan köra samma prompt femtio gånger medan du itererar. Oberoende: inga anropstak, inga avvecklingsbesked, inga prisändringar.
Det finns två vanliga former. Antingen körs modellen i webbläsaren via WebGPU, vilket inte kräver någon installation av användaren, eller så körs den som en egen process på maskinen — Ollama, llama.cpp, LM Studio — som applikationer pratar med över localhost.
Avvägningen är verklig
Lokala modeller är mindre modeller. En kvantiserad modell med sju miljarder parametrar som får plats i 5 GB grafikminne är inte konkurrenskraftig mot en stor molnmodell på svåra resonemang, långa dokument eller smal kunskap. Den är ofta fullt tillräcklig för klassificering, extrahering, sammanfattning, omskrivning och utkast.
De övriga kostnaderna är praktiska: en första nedladdning på flera gigabyte, ett fast och oftast litet kontextfönster, märkbart färre tokens per sekund, och supportfrågor från användare vars hårdvara inte klarar det.
Det folk brukar blanda ihop
Lokalt är inte samma sak som offline, och inte automatiskt privat hela vägen. Två saker är värda att skilja på:
- Var modellen körs kontra om appen behöver nätet. Vikterna laddas ner över internet första gången. En sida som kör en modell lokalt kan fortfarande skicka statistik, telemetri eller din prompt någon annanstans.
- Lokal generering kontra lokalt alltihop. En produkt kan marknadsföra ett lokalt läge och ändå göra ett molnanrop per session för planering, routning eller innehållsfiltrering.
Frågan värd att ställa till en leverantör är inte "stödjer ni lokala modeller" utan "vilka specifika anrop lämnar enheten, och när". NorthernGos svar är att lokal generering körs helt på ditt eget grafikkort i alla planer och inte skickar någon förfrågan från enheten, medan molnläget använder Googles Gemini-modeller och är kvoterat — två olika vägar, inte en väg med en sekretessetikett.
En tredje väg folk blandar in är egen API-nyckel. Det är fortfarande ett molnanrop: prompten lämnar enheten, och bara notan och modellfamiljen ändras. Det är inte lokal AI.
Vanliga frågor
Är lokal AI tillräckligt bra för att ersätta en molnmodell?
För strukturerade, avgränsade uppgifter — klassificering, extrahering, sammanfattning, omskrivning, enkel kod — räcker en liten lokal modell ofta. För långa dokument, svåra flerstegsresonemang eller bred faktakunskap är stora molnmodeller fortfarande klart bättre. De flesta seriösa uppsättningar använder båda och styr per uppgift.
Bygg det själv
NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.