Stor språkmodell (LLM)

En stor språkmodell är ett neuralt nätverk som tränats på mycket stora mängder text för att förutsäga nästa textbit utifrån det som kommit innan. Allt den gör — svarar, översätter, skriver kod, sammanfattar — är den enda operationen tillämpad om och om igen.

Hur den är byggd

Nästan alla nuvarande modeller använder transformer-arkitekturen. Text delas i tokens, varje token blir en vektor, och attention-lager låter varje position väga in varje annan position i indata innan modellen ger ut en sannolikhetsfördelning över nästa token. En token dras, läggs till indata, och alltihop körs igen.

Träningen sker i steg. Förträning på en mycket stor textmängd ger en modell som fortsätter text. Efterträning — instruktionsjustering och därefter någon form av preferensoptimering — gör den till något som följer önskemål och beter sig som en assistent. Assistentrollen är ett inlärt beteende, inte en egenskap hos själva nätverket.

Vad som följer av den konstruktionen

Flera praktiska konsekvenser faller direkt ur "den förutsäger text":

Vad siffrorna säger och inte säger

Antalet parametrar är ett kapacitetstak, inte ett kvalitetsmått. En väl eftertränad 8B-modell slår en dåligt tränad 70B-modell på de flesta verkliga uppgifter, och en stor modell som får en illa ställd fråga presterar sämre än en liten modell som får en tydlig. Datakvalitet, efterträning och hur mycket modellen får resonera innan den svarar flyttar resultatet mer än storleken.

Benchmarktabeller är värda ännu mindre än de ser ut. Kontaminering är vanligt, uppgifterna liknar sällan dina, och två poängs skillnad på en topplista märker inga användare. Testa i stället kandidatmodellerna på tjugo exempel ur ditt eget arbete.

Vanliga frågor

Lär en språkmodell sig av mina konversationer?

Inte av sig själv. Vikterna är låsta när träningen är klar, så ingenting du skriver förändrar modellen. Vad som kan hända är att leverantören sparar dina konversationer och använder dem i en senare träningsomgång, vilket är en policyfråga om just den leverantören snarare än en egenskap hos tekniken.

Vad är skillnaden mellan en modell och en chatbot?

Modellen är vikterna plus koden som kör dem, och den gör bara text till mer text. En chatbot är en produkt byggd runt en modell: den sparar konversationen, lägger till en systemprompt, kan söka på webben eller anropa verktyg och filtrerar innehåll. Två chatbotar på samma modell kan bete sig mycket olika.

Bygg det själv

NorthernGo förvandlar en beskrivning i ren text till en fungerande webbapp med databas, inloggning och en live-adress. Lokal AI-generering körs på ditt eget grafikkort, är obegränsad och ingår gratis i alla prisplaner.

Börja bygga gratis