# Inferens

> Inferens är att köra en redan tränad modell för att få ett svar, till skillnad från träning som är det som skapar modellen. Varje prompt du skickar är en…

Source: https://northerngo.com/sv/ordlista/inferens/
Language: sv
Updated: 2026-08-28

---
**Inferens är att köra en redan tränad modell för att få ett svar, till skillnad från träning som är det som skapar modellen. Varje prompt du skickar är en inferensförfrågan, och det är där i praktiken hela den löpande kostnaden för att använda AI ligger.**

### Två faser, med olika flaskhalsar

En inferensförfrågan delas i två delar. **Prefill** bearbetar hela din prompt på en gång; den är beräkningstung och parallell, och den avgör hur länge du väntar på första ordet. **Decode** genererar sedan en [token](/sv/ordlista/token/) i taget, där varje steg beror på det föregående, så den kan inte parallelliseras inom ett enskilt svar. Decode begränsas av minnesbandbredd snarare än ren beräkningskraft — vikterna måste läsas för varje token som produceras.

Därför mäter de två tal folk brukar citera olika saker. *Tid till första token* handlar mest om promptens längd och kö. *Tokens per sekund* handlar om bandbredd och modellstorlek. En lång prompt gör det första måttet sämre utan att röra det andra.

För att slippa räkna om attention över hela prompten i varje steg håller körtider en **KV-cache**. Den är snabb och den är stor, och storleken växer med [kontextfönstret](/sv/ordlista/context-window/) — vilket är en stor del av förklaringen till att långa kontexter blir dyra.

### Var det körs

Molninferens innebär ett API-anrop till en leverantör som kör modellen på server-GPU:er. [Lokal inferens](/sv/ordlista/local-ai/) är samma beräkning på din egen hårdvara, oftast med en kvantiserad modell så att den får plats i tillgängligt minne. Matematiken är identisk; det som skiljer är ekonomin och datavägen.

### Vad du bör se upp med

- **Kostnaden skalar med tokens, inte med anrop.** En konversation som skickar med hela sin historik betalar för historiken igen vid varje replik. Långa systemprompter debiteras vid varje enskilt anrop.
- **Latensen beror inte bara på svarslängden.** Att dubbla prompten höjer prefill-tiden; att dubbla svaret höjer decode-tiden. Ta reda på vilken du har innan du optimerar.
- **Batchning hjälper servern, inte dig.** Leverantörer batchar förfrågningar för att höja den totala genomströmningen, vilket kan göra just ditt svar långsammare vid hög belastning.
- **Fasta vikter, varierande svar.** Inferens förändrar inte modellen. Identiska prompter kan ändå ge olika utdata eftersom samplingen är slumpmässig över temperatur noll.

Cachning är den underskattade spaken: återkommande prefix, embeddingar och färdiga svar på vanliga frågor är alla billigare att lagra än att generera igen.

---

NorthernGo är en AI-driven plattform för att bygga produktionsklara webbappar utan kod. Lokal AI-generering via WebGPU är obegränsad och gratis, och du äger all genererad källkod. https://northerngo.com/
