Ollama
Ollama är ett öppet verktyg som kör språkmodeller på din egen dator och exponerar dem via ett lokalt HTTP-API. Det sköter nedladdning, kvantiserade modellfiler och GPU-uppsättning, så att använda en lokal modell blir ett kommando i stället för ett byggprojekt.
Hur det används
Installera, hämta och kör en modell:
ollama pull llama3.1
ollama run llama3.1
En bakgrundstjänst lyssnar på http://localhost:11434. Det är den delen som spelar roll för utvecklare: vilken applikation som helst på maskinen kan anropa den, och Ollama exponerar dessutom en OpenAI-kompatibel endpoint, så de flesta befintliga klientbibliotek fungerar om man byter bas-URL och skickar en attrapp-nyckel.
Modeller distribueras som kvantiserade GGUF-filer, oftast i 4 bitar, och hämtas från ett register efter namn och tagg. En Modelfile låter dig paketera en basmodell tillsammans med en systemprompt och samplingsparametrar under ett eget namn — praktiskt för att låsa en konfiguration som hela teamet använder.
Under huven ligger llama.cpp, och därför fungerar det på Apple Silicon samt NVIDIA- och AMD-kort, med fallback till processorn. Enbart CPU fungerar och är långsamt; räkna med några tokens per sekund på en stor modell.
Var det passar in
Ollama är standardsvaret för lokal AI när modellen ska köras på maskinen men utanför webbläsaren. Jämfört med en webbläsarkörtid på WebGPU får du större modeller, större kontextfönster och bättre hastighet, till priset av att en installation krävs. NorthernGo kan kopplas till en lokal Ollama-instans av precis det skälet: det är alternativet för den som vill ha en garanti att ingenting lämnar maskinen.
Vad du bör se upp med
- En webbsida kan inte anropa localhost utan vidare. Ollamas CORS-policy blockerar webbläsarorigin tills du tillåter dem, typiskt genom att sätta
OLLAMA_ORIGINSinnan tjänsten startas. Det är den enskilt vanligaste orsaken till att en webbläsarintegration tyst misslyckas, och det är ett medvetet skydd snarare än en bugg. - Exponera det inte mot nätet. API:et har ingen autentisering. Att binda det till en publik adress ger vem som helst tillgång till ditt grafikkort, och värre.
- Minnet är begränsningen. En modell som inte får plats i grafikminnet spiller över till systemminnet och blir dramatiskt långsammare, eller kraschar direkt.
- Ett modellnamn är ingen garanti. Standardtaggen är oftast en 4-bitskvantisering av en instruktionsjusterad variant, vilket inte är samma sak som modellen med det namnet i full precision. Kontrollera taggen när du jämför kvalitet mot en molnleverantör.
Vanliga frågor
Är Ollama gratis?
Ja. Verktyget är öppen källkod och det finns ingen kostnad per anrop, eftersom allt körs på din egen hårdvara. Kostnaderna är diskutrymmet för modellfilerna, några gigabyte styck, och el. Enskilda modeller har egna licenser, vilket är värt att kontrollera före kommersiell användning.
Varför når min webbapp inte Ollama på localhost?
Eftersom Ollama avvisar korsande förfrågningar från webbläsare om inte origin är tillåtet. Sätt miljövariabeln OLLAMA_ORIGINS så att den inkluderar din sida och starta om tjänsten. Misslyckas anropet helt utan svar är det orsaken; får du i stället ett HTTP-fel ligger problemet någon annanstans.
Bygg det själv
NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.