Kontextfönster

Kontextfönstret är det största antal tokens en modell kan ha framför sig samtidigt, och det rymmer systemprompten, konversationen så långt, bifogade dokument och det svar som genereras. Ingenting utanför fönstret existerar för modellen.

Det är en gemensam budget

Fönstret är inte "hur mycket du får skicka" — det är allt på en gång. Ett fönster på 32k som håller en systemprompt på 2k, ett dokument på 20k och 8k konversation har 2k kvar till svaret, och ett längre svar är helt enkelt omöjligt. De flesta API:er låter dig reservera utrymme för utdata uttryckligen, och att glömma det är en vanlig orsak till svar som slutar mitt i en mening.

Eftersom en modell är tillståndslös mellan anrop kommer intrycket av minne från att hela dialogen skickas med varje gång. Därför blir långa chattar successivt dyrare: du betalar för hela historiken igen vid varje meddelande. När dialogen inte längre får plats måste något bort, och strategin — kasta äldst, sammanfatta mitten, hämta bara relevanta delar — är ett designbeslut i din applikation, inte något modellen sköter.

Vad du bör se upp med

Ett större fönster betyder inte bättre resonemang, och det betyder inte att hela fönstret används väl. Det här är det enskilt vanligaste missförståndet. Tre detaljer:

  1. Uppmärksamheten är ojämn. Modeller använder tillförlitligt början och slutet av en lång indata och är mätbart svagare på material i mitten. Att lägga den viktiga instruktionen sist slår oftast att begrava den på sida fyrtio.
  2. Kostnad och latens växer med vad du faktiskt skickar. Att fylla ett fönster på en miljon tokens bara för att det finns är ett dyrt sätt att göra svaren långsammare och ofta sämre.
  3. Angiven längd är inte effektiv längd. Leverantörer anger det arkitektoniska maxvärdet. Träffsäkerheten vid det maxvärdet är en separat mätning, och den är oftast sämre än siffran antyder.

Den praktiska slutsatsen är att ett stort fönster är en bekvämlighet, inte en ersättning för urval. Att skicka de tre relevanta sidorna slår att skicka hela manualen — och det är skälet till att retrieval-augmented generation inte blev överflödigt när fönstren växte.

Små lokala modeller gör det här konkret. Webbläsarmodeller som körs på WebGPU har ofta bara 4k till 8k tokens, och därför brukar verktyg som bygger på dem skicka riktade diffar av en befintlig fil i stället för hela dokumentet.

Vanliga frågor

Varför glömmer modellen vad jag sa tidigare i en lång chatt?

Eftersom de äldsta meddelandena föll ur kontextfönstret. Applikationen skickar med dialogen vid varje replik, och när den inte längre får plats tas tidiga meddelanden bort eller sammanfattas. Ingenting kommer ihåg utanför det som skickas, så det som fortfarande är viktigt bör upprepas.

Bygg det själv

NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.

Börja bygga gratis