Token

En token är den textenhet som en språkmodell faktiskt läser och skriver. Den är oftast en orddel snarare än ett helt ord, så modellen ser aldrig bokstäver eller ord direkt — bara en följd av heltal som står för dessa delar.

Hur text delas upp

En tokenizer byggs genom att gå igenom en stor textmängd och slå samman de vanligaste teckenföljderna till enskilda enheter, oftast med byte-pair encoding. Vanliga ord blir en token; ovanligare ord delas. Blanksteg ingår i token, så the och the är olika poster i vokabulären.

Grov tumregel för engelska: en token är cirka fyra tecken, alltså ungefär 0,75 ord. Genomsnittet döljer stor spridning:

Den praktiska konsekvensen är att samma mening på svenska kostar märkbart fler tokens än på engelska — ofta 1,5 till 2 gånger så många. Den fyller kontextfönstret snabbare och kostar mer per anrop, för identisk innebörd.

Varför det spelar roll

Tokens är enheten för fakturering, för kontextfönstret och för hastighet. Priser sätts per miljon tokens in och ut, där utdata brukar vara flera gånger dyrare. Genomströmning anges i tokens per sekund. Gränser uttrycks i tokens, aldrig i ord eller tecken.

Vad du bör se upp med

En token är inte ett ord, och det får konkreta konsekvenser. De klassiska misslyckandena följer direkt: en modell kan inte tillförlitligt räkna bokstäverna i ett ord, stava baklänges eller räkna på tecken, eftersom den aldrig ser tecknen. Den tittar på ett heltal som representerar jord plus ett som representerar gubbe.

Två fällor till. Ord- och teckengränser i prompter är önskemål — "svara på under 100 ord" är något modellen inte kan kontrollera, medan ett hårt max_tokens klipper svaret mitt i en mening. Och antalet tokens är modellspecifikt: samma text mätt med två olika tokenizers ger två olika tal, så räkna med tokenizern för den modell du faktiskt anropar.

Vanliga frågor

Hur många tokens är en sida text?

En A4-sida vanlig engelsk löptext är ungefär 500 till 700 tokens. Samma sida på svenska ligger ofta på 800 till 1 100, eftersom sammansatta och böjda ord delas i fler bitar. Kod och tabeller ligger högre än så. Räkna med modellens egen tokenizer när siffran spelar roll.

Varför kostar svenska mer än engelska att köra genom en modell?

Eftersom tokenizers tränas på textmängder som domineras av engelska blir engelska ord enskilda tokens medan svenska sammansättningar och böjningar delas i flera. Samma innebörd förbrukar därför fler tokens, vilket ger högre kostnad, mer förbrukat kontextfönster och långsammare generering.

Bygg det själv

NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.

Börja bygga gratis