Inferens

Inferens är att köra en redan tränad modell för att få ett svar, till skillnad från träning som är det som skapar modellen. Varje prompt du skickar är en inferensförfrågan, och det är där i praktiken hela den löpande kostnaden för att använda AI ligger.

Två faser, med olika flaskhalsar

En inferensförfrågan delas i två delar. Prefill bearbetar hela din prompt på en gång; den är beräkningstung och parallell, och den avgör hur länge du väntar på första ordet. Decode genererar sedan en token i taget, där varje steg beror på det föregående, så den kan inte parallelliseras inom ett enskilt svar. Decode begränsas av minnesbandbredd snarare än ren beräkningskraft — vikterna måste läsas för varje token som produceras.

Därför mäter de två tal folk brukar citera olika saker. Tid till första token handlar mest om promptens längd och kö. Tokens per sekund handlar om bandbredd och modellstorlek. En lång prompt gör det första måttet sämre utan att röra det andra.

För att slippa räkna om attention över hela prompten i varje steg håller körtider en KV-cache. Den är snabb och den är stor, och storleken växer med kontextfönstret — vilket är en stor del av förklaringen till att långa kontexter blir dyra.

Var det körs

Molninferens innebär ett API-anrop till en leverantör som kör modellen på server-GPU:er. Lokal inferens är samma beräkning på din egen hårdvara, oftast med en kvantiserad modell så att den får plats i tillgängligt minne. Matematiken är identisk; det som skiljer är ekonomin och datavägen.

Vad du bör se upp med

Cachning är den underskattade spaken: återkommande prefix, embeddingar och färdiga svar på vanliga frågor är alla billigare att lagra än att generera igen.

Vanliga frågor

Varför är första svaret långsamt och resten snabbt?

Oftast eftersom modellen måste läsas in i minnet före första förfrågan, vilket kan ta från sekunder till minuter beroende på storlek. På moln-API:er handlar det snarare om kö eller en kall container. Därefter ligger vikterna kvar och bara själva genereringen kostar tid.

Bygg det själv

NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.

Börja bygga gratis