Grundbegrepp: parametrar, MoE och kontextfönster
Innan vi tittar på enskilda modeller behöver du fyra begrepp som dyker upp i varenda produktblad och benchmark. De låter tekniska men är enkla när man väl ser vad de faktiskt beskriver.
Parametrar är modellens inlärda "kunskapsrattar" — de siffror som justerats under träningen och som avgör hur modellen svarar. Fler parametrar ger generellt mer kapacitet, men det är inte hela bilden — hur de används spelar minst lika stor roll, vilket för oss till nästa begrepp.
Mixture of Experts (MoE) är en arkitektur där modellen inte är ett enda jättenätverk som behandlar allt likadant, utan många mindre "expert"-nätverk plus en router som skickar varje del av texten (varje "token") till bara några få relevanta experter.
Tänk dig ett stort sjukhus med många specialister och en triage-sköterska (routern) i entrén. En patient behöver inte träffa alla läkare på sjukhuset — sköterskan skickar dem till de 2–3 specialister som faktiskt är relevanta. Sjukhuset kan vara enormt totalt sett, men varje enskilt besök involverar bara en liten del av personalen.
Det är därför en modell kan ha ett svindlande totalt antal parametrar men bara "aktivera" en mycket mindre andel per token — DeepSeek V4-Pro har till exempel 1,6 biljoner parametrar totalt, men aktiverar bara omkring 49 miljarder för varje token den genererar. Resultatet: nästan samma kapacitet som en jätte-modell, men till en bråkdel av beräkningskostnaden.
Kontextfönster är hur mycket text — mätt i tokens, ungefär ordbitar — en modell kan "se" samtidigt, både det du skickar in och det den skriver ut. Många modeller 2026 klarar 1 miljon tokens, vilket räcker till väldigt stora kodbaser eller många långa dokument samtidigt. Men ett stort fönster är inte automatiskt bättre: kostnad skalar med hur mycket text som skickas in, och modeller är olika bra på att faktiskt använda information långt bort i ett långt fönster snarare än att bara "se" den.
Slutligen: öppna vikter kontra stängda modeller. En stängd modell (som Claude eller GPT-5.6) når du bara via företagets servrar — du betalar per token och får aldrig själva modellfilen. En modell med öppna vikter (DeepSeek, GLM, Kimi, med flera) publicerar de tränade parameterfilerna öppet, ofta på Hugging Face, så vem som helst kan ladda ner och köra dem på egen hårdvara — utan att skicka data till originalföretaget. Ett litet men viktigt förbehåll: "öppna vikter" är inte samma sak som "öppen källkod" i strikt mening — vikterna är tillgängliga, men träningsdata och träningskod är ofta fortfarande hemliga.
En sista teknisk term värd att känna till: kvantisering, att krympa en modells minnes- och beräkningsbehov genom att sänka precisionen på talen efter träning (16-bit → 8-bit → 4-bit), mot en liten förlust i noggrannhet. Det är kvantisering som gör det praktiskt möjligt att över huvud taget köra en modell med 2,8 biljoner parametrar, som Kimi K3, på hårdvara som inte är ett helt datacenter.
Anthropics Claude-familj
Anthropic delar upp sin Claude-familj i fyra nivåer, från snabbast/billigast till mest kapabel. Priserna nedan är per miljon tokens, in/ut.
| Modell | Pris (in/ut per 1M) | Roll |
|---|---|---|
| Claude Haiku 4.5 | $1 / $5 | Snabbast och billigast — enkla, högvolymuppgifter |
| Claude Sonnet 5 | $3 / $15 (intro $2/$10) | Bäst balans mellan hastighet och intelligens — vardagsarbetshäst |
| Claude Opus 4.8 | $5 / $25 | Mest kapabel av de allmänt tillgängliga modellerna |
| Claude Fable 5 | $10 / $50 | Flaggskepp — svåraste resonemang och långsiktigt agent-arbete, 1M kontext, upp till 128K utdata |
Sonnet 5 är den modell de flesta möter i praktiken — tillräckligt smart för det mesta, snabb nog för ett samtal i realtid, och prissatt så att den går att använda i volym. Opus 4.8 och Fable 5 finns för uppgifter som verkligen kräver djupare resonemang eller att agenten arbetar självständigt under lång tid — kodrefaktorering över en hel kodbas, forskningsuppgifter i flera steg, den typen av jobb.
Det här landskapet rör sig fort. Fable 5 hade turbulens kring tillgänglighet i juli 2026 — Anthropic förlängde först perioder med inkluderad åtkomst, och gick sedan över till förbetalda krediter den 20 juli. Ingen stor sak i sak, men ett bra exempel på att prissättning och tillgång för de nyaste modellerna kan ändras med kort varsel — bygg inte ett system som är beroende av att en specifik prisnivå gäller för evigt.
OpenAI GPT-5.6 — Sol, Terra och Luna
Här kommer en liten "gotcha" som är lätt att missa: namnen Sol, Terra och Luna låter som de skulle kunna vara ett helt annat labs egen himlakropps-branding. De är det inte — det är OpenAys tre nivåer av en och samma release, GPT-5.6, som kom den 9 juli 2026.
| Nivå | Pris (in/ut per 1M) | Roll |
|---|---|---|
| GPT-5.6 Sol | $5 / $30 | Flaggskepp — driver ChatGPTs tyngsta resonemangslägen |
| GPT-5.6 Terra | $2,50 / $15 | Balanserad mellannivå |
| GPT-5.6 Luna | $1 / $6 | Snabbast och billigast i familjen |
Sol är den modell som driver ChatGPTs tyngre resonemangslägen — bland annat "Max Reasoning Effort" och "Ultra Mode", ett läge där flera parallella sub-agenter arbetar på samma problem samtidigt istället för en enda kedja av tankar.
Den funktion som fått mest uppmärksamhet i den här releasen är dock inte modellen i sig, utan ChatGPT Work — en agentisk arbetsyta som kan utföra flerstegsuppgifter över flera appar och filer, och som kan köra i timmar helt utan tillsyn. Det är samma riktning som resten av branschen rör sig i: från "svara på en fråga" till "utför ett helt jobb".
Om du ser "Sol", "Terra" eller "Luna" nämnas som om de vore separata, konkurrerande modeller från olika företag — det stämmer inte. Det är tre prisnivåer inom GPT-5.6. Samma mönster som Claudes Haiku/Sonnet/Opus/Fable-uppdelning, bara med andra namn.
Öppna vikter: Kimi K3, DeepSeek V4, GLM-5.2
Medan Anthropic och OpenAI håller sina modeller stängda bakom ett API, publicerar flera kinesiska labb sina modellvikter öppet. Sommaren 2026 är det här fältet ovanligt hett.
Kimi K3 (Moonshot AI, släppt 16 juli 2026) är i skrivande stund den största öppna modellen vid lansering — ungefär 2,8 biljoner totala parametrar i en MoE-arkitektur, med 1M tokens kontext och ett agent-först-fokus: kodning, långsiktigt kunskapsarbete, inbyggd bildförståelse. Släppet skedde stegvis — API den 16 juli, fulla öppna vikter den 27 juli. På en ledartavla landade K3 på Elo 1547, precis bakom Claude Fable 5, och toppade "Frontend Code Arena" före både Fable 5, GPT-5.6 Sol och GLM-5.2. Hostad API-prissättning: $3/$15 per miljon tokens.
DeepSeek V4 (släppt 24 april 2026) finns i två varianter: V4-Pro (1,6 biljoner totala parametrar, ~49 miljarder aktiva per token) och den mycket lättare V4-Flash (284 miljarder totalt, ~13 miljarder aktiva). Båda har 1M kontext. Huvudberättelsen kring V4 är inte kapacitet i sig utan kostnadseffektivitet: den rapporteras matcha nivåer som GPT-5.5/Claude Opus 4.7 på agentiska benchmarks till 10–13 gånger lägre kostnad.
| Modell | Totala / aktiva parametrar | Pris (in/ut per 1M) |
|---|---|---|
| DeepSeek V4-Pro | 1,6T / ~49B | $0,435 / $0,87 |
| DeepSeek V4-Flash | 284B / ~13B | $0,14 / $0,28 |
| GLM-5.2 | 744B / ~40B | $1,40 / $4,40 |
| Kimi K3 (hostad) | ~2,8T (MoE) | $3 / $15 |
En ofta citerad jämförelse säger att 10 miljoner utdata-tokens kostar cirka $2,80 via DeepSeek V4-Flash mot cirka $250 via Claude Opus 4.6 — nästan 90 gånger dyrare. Det är en dramatisk, illustrativ leverantörsjämförelse mellan två olika sorters modeller, inte en oberoende granskad, äpplen-mot-äpplen-siffra. Använd den för att förstå storleksordningen på kostnadsskillnaden, inte som exakt sanning.
Värt att notera: NIST:s CAISI (Center for AI Standards and Innovation) genomförde en oberoende utvärdering av DeepSeek V4-Pro i maj 2026 — ett amerikanskt myndighetsorgan som bedömer en kinesisk öppen-vikt-modell, vilket säger något om hur mainstream öppna kinesiska modeller blivit i praktisk användning, oavsett var man står i den geopolitiska diskussionen.
GLM-5.2 (Zhipu AI, numera under varumärket Z.ai, släppt juni 2026) är en MoE-modell med ~744 miljarder totala och ~40 miljarder aktiva parametrar, 1M kontext, och släpps under MIT-licens — inga regionala begränsningar, fritt att självhosta och använda kommersiellt. Den är hårt tränad för mjukvaruutveckling och agentiskt verktygsbruk, och beskrevs som förmodligen den mest kapabla öppna modellen vid sin egen release — till ungefär en sjättedel av GPT-5.5:s kostnad på vissa kodbenchmarks. Kimi K3 gick dock om GLM-5.2 på flera ledartavlor redan i mitten av juli, vilket visar hur snabbt rangordningen ändras.
Jag kör en egen lokal modell på min server (Ornith-35B, som du stötte på i Hermes-kursen) av precis de skäl som gör öppna vikter attraktiva: ingen data lämnar min hårdvara, ingen per-token-kostnad oavsett hur mycket jag använder den, och full kontroll över hur den körs.
Jämförelse: kostnad, hastighet, kvalitet
Zoomar man ut faller modellerna sommaren 2026 ungefär i fem prisband, från ultrabilligt till dyrast — allt per miljon tokens, in/ut.
| Band | Modeller | Ungefärligt prisspann |
|---|---|---|
| Ultrabilligt | DeepSeek V4-Flash | $0,14 / $0,28 |
| Billigt | DeepSeek V4-Pro, GLM-5.2 | $0,44–$1,40 / $0,87–$4,40 |
| Mellan | Kimi K3, GPT-5.6 Luna/Terra, Claude Haiku 4.5, Claude Sonnet 5 | $1–5 / $5–15 |
| Dyrt (flaggskepp) | GPT-5.6 Sol, Claude Opus 4.8 | $5 / $25–30 |
| Dyrast | Claude Fable 5 | $10 / $50 |
Kvalitet följer grovt sett priset, men inte perfekt — det är just det som gör landskapet intressant. Kimi K3 lyckas ligga strax bakom Claude Fable 5 på en generell ledartavla trots att den kostar en bråkdel, och till och med toppa vissa kodbenchmarks. DeepSeek V4-Flash är extremt billig men fortfarande fullt användbar för många vardagsuppgifter.
Elo-poäng, rankningar och "X% bättre än Y på benchmark Z" ändras vecka för vecka i det här landskapet — nya modeller släpps, gamla omvärderas, och olika ledartavlor mäter olika saker. Se siffrorna i den här kursen som en fingervisning för var modellerna ungefär låg i juli 2026, inte som en fast sanning som gäller för alltid. Testa alltid själv på din egen uppgift innan du bygger något viktigt kring en enskild siffra.
Hur du väljer rätt modell
Med så många alternativ blir den viktiga frågan inte "vilken modell är bäst" utan "vilken modell är bäst för det här". Två övergripande vägval styr det mesta.
Välj en stängd API-modell (Claude, GPT-5.6) när du vill ha den enskilt bästa kapaciteten utan egen infrastruktur, har låg-till-måttlig volym där per-token-priset ändå blir litet i absoluta tal, behöver leverantörens supportkedja och säkerhetsverktyg, eller inte har något emot att data lämnar din egen infrastruktur.
Välj en öppen-vikt, självhostad modell (DeepSeek, GLM, Kimi och liknande) när du har sådan volym att kostnaden för att äga eller hyra beräkningskraft blir billigare än att betala per token — DeepSeeks 10–90 gånger lägre kostnad i vissa jämförelser illustrerar hur stor skillnaden kan bli i skala — när data av integritets- eller regelskäl aldrig får lämna dina egna servrar, när du vill finjustera modellen mot din egen data, eller när du redan har kompetensen att drifta inferensinfrastruktur själv.
| Situation | Rekommendation |
|---|---|
| Enstaka svåra resonemangsuppgifter, ingen egen infra | Stängd flaggskeppsmodell (Fable 5, Opus 4.8, GPT-5.6 Sol) |
| Vardagligt chattgränssnitt, hög kvalitet till rimligt pris | Sonnet 5 eller GPT-5.6 Terra |
| Massiv volym, kostnad avgörande | DeepSeek V4-Flash eller GLM-5.2, självhostat |
| Data får aldrig lämna din server | Öppen-vikt-modell, självhostad |
| Kodningsagent med lång kontext | Kimi K3 eller Claude Sonnet 5/Opus 4.8 |
Ett praktiskt sista råd: testa alltid på din egen uppgift innan du bestämmer dig. En modell som toppar en generell ledartavla kan ändå prestera sämre än en billigare konkurrent på exakt det du behöver göra — och det enda sättet att veta är att prova. Det här landskapet ändras för fort för att någon enskild "bästa modell" ska gälla särskilt länge.
Nu när du har en karta över vilka modeller som finns och varför de skiljer sig åt, är nästa steg att se hur de faktiskt används i praktiken — det är precis vad nästa kurs handlar om.