Vad ligger egentligen bakom Kimi K3:s rekordresultat?

Kimi K3 har varit online sedan den 16 juli, och rubrikerna får det att låta som om Kina just har gått om USA. Med 2,8 biljoner parametrar är det den största modellen vars vikter ska göras tillgängliga. Vissa observatörer kallar det redan för nästa DeepSeek-ögonblick.
Den mest intressanta meningen om denna modell finns dock inte i rubrikerna. Den finns i Moonshots egen tekniska blogg. Där skriver tillverkaren att den totala prestandan fortfarande ligger efter de starkaste proprietära modellerna, nämligen Claude Fable 5 och GPT-5.6 Sol. Det är sällsynt att ett företag presenterar sin egen produkt och säger att den inte är den bästa. Och det är just därför som de rekordhöga siffrorna förtjänar en närmare titt.
Vi har redan rapporterat om nyheten att K3 är här och går att prova gratis. Den här artikeln handlar om vad som kommer därefter.
Första platsen, och vad den egentligen mäter
K3 vinner faktiskt en viktig jämförelse. I Frontend Code Arena, där deltagarna ser två resultat bredvid varandra och väljer det bättre utan att veta vilken modell som har genererat det, hamnar K3 i topp. Före både Claude och GPT.
Haken: detta test mäter smak. Användarna betygsätter vilket webbgränssnitt de gillar bäst. Det säger mycket om design och lite om korrekthet. Den som tolkar detta som att ”Kimi slår de amerikanska modellerna” har missat skillnaden mellan en preferensrankning och ett noggrannhetstest.
Varför jämförelsetabeller måste läsas noggrant
Moonshot publicerar sina mätningar, och det intressanta finns i fotnoterna. Beroende på jämförelsetestet kördes varje modell i en annan agentmiljö – ibland KimiCode, ibland Claude Code, ibland Codex. Det är olika utgångsförhållanden, inte ett rent lopp på samma bana.
I ett av kodningstesterna medger Moonshot själva att Claude Fable 5 stötte på fallbacks i 35 procent av uppgifterna, vilket kan ha dragit ner dess poäng. I ett annat test når K3 sitt högsta resultat endast med en teknik som komprimerar kontexten till 300 000 tokens. Utan den kontexthanteringen sjunker siffran.
Hur lätt sådana siffror kan vändas framgår av en utvärdering från det oberoende analysföretaget Artificial Analysis. Där hamnar Kimi K3 på 49 procent i ett mått på hallucinationer. Det låter som ett svagt resultat. Skalan är dock inverterad: den räknar hur ofta modellen inte gör fel. Ju högre siffra, desto bättre, och på samma lista ligger Claude Fable 5 under K3 med 45 procent, medan flera GPT-5.6-varianter hamnar långt efter.
En regel som är värd att komma ihåg: innan du tror på en rubrik om ett jämförelsetest, kontrollera vad som exakt har mätts och åt vilket håll skalan pekar.
Kan du köra K3 själv?
För våra läsare är det den verkliga frågan. Det ärliga svaret: för vanliga användare kommer detta praktiskt taget inte att göra någon skillnad, inte ens när vikterna har publicerats. Anledningen är helt enkelt storleken.
Räkna lite på det. Moonshot tränar K3 från början i ett kompakt talformat som kallas MXFP4, vilket använder cirka fyra bitar per vikt. Vikter, även kallade parametrar, är de inlärda numeriska värden som en AI-modell består av. Med 2,8 biljoner parametrar blir det ungefär 1,4 terabyte bara för modellfilen. Inte gigabyte. Terabyte. För att sätta det i perspektiv: en typisk modell med åtta miljarder parametrar, av den typ som körs på en välutrustad bärbar dator, tar upp cirka fem gigabyte.
Topp 10...
» Topp 10: Bästa bärbara allround/multimediadatorerna
» Topp 10: Bästa bärbara speldatorerna
» Topp 10: Bärbara budget/kontorsdatorer
» Topp 10: Bästa bärbara kontors/premiumdatorerna
» Topp 10: Bärbara arbetsstationer
» Topp 10: De bästa små/kompakta bärbara datorerna
» Topp 10: Bästa ultrabooks
» Topp 10: Bästa hybriddatorerna
» Topp 10: Bästa surfplattorna
» Topp 10: Marknadens bästa smartphones
Moonshot rekommenderar själva att K3 körs på supernodkonfigurationer med 64 eller fler acceleratorer. Det är inte överdriven försiktighet utan den uppenbara konsekvensen av dessa dimensioner. Ett enda professionellt grafikkort med 96 gigabyte minne ligger mer än en faktor tio under kraven.
”Öppna vikter” innebär därför inte att du kommer att köra den här modellen hemma. Det innebär att forskare, företag och molnleverantörer kan ladda ner den, granska den och köra den på sin egen infrastruktur istället för att endast hyra den via Moonshots servrar. Det är värdefullt, men det är något annat än vad många föreställer sig.
Om du faktiskt vill ha AI utan molnet på din egen maskin är de små modellerna som är byggda för det ändamålet det rätta valet. Vi har visat hur det fungerar och vilka hårdvarukrav som gäller i en separat artikel.
En sidokommentar för de tekniskt nyfikna: eftersom K3 tränades med denna låga precision från första början är det kompakta formatet det ursprungliga tillståndet, inte en modell som komprimerats i efterhand. Den vanliga frågan om hur mycket kvalitet som går förlorad vid komprimeringen uppstår inte på samma sätt.
Vad det kostar i praktiken
Faktureringen sker i tokens, små textbitar som vanligtvis består av bara några tecken. Via API:et tar Moonshot ut 3 dollar per miljon ingångstokens och 15 dollar per miljon utgångstokens. Upprepade ingångar faktureras till 30 cent, vilket är betydligt billigare.
Det gör att K3 inte längre är något fynd. Det kostar ungefär tre gånger så mycket som sin egen föregångare, som tog knappt en dollar per inmatning. Jämfört med Claude Fable 5 till 10 och 50 dollar är K3 klart billigare. Claude Sonnet 5 underskrider dock fortfarande priset med sitt nuvarande introduktionspris på 2 respektive 10 dollar och kommer först i september att ligga i nivå med K3. Tiden då kinesiska modeller främst konkurrerade med priset är på väg att ta slut hos Moonshot.
Det finns ytterligare en punkt som är lätt att missa. K3 arbetar för närvarande alltid på sin högsta insatsnivå. Moonshot planerar att lägga till mer resurssnåla lägen senare. Det gör svaren grundliga, men det innebär också att till och med en enkel fråga utlöser det resurskrävande resonemangsarbetet. Oberoende mätningar visar också att modellen producerar cirka 62 utdatatoken per sekund, vilket placerar den i mitten av fältet vad gäller hastighet.
Vad händer med dina inmatningar
För alla som provar K3 i appen eller på webbplatsen är detta det avsnitt som är viktigast. Moonshots integritetspolicy anger tydligt att indata, ljud, bilder, videor och filer behandlas för att tillhandahålla och förbättra tjänsterna, vilket uttryckligen inkluderar träning och optimering av företagets egna modeller.
Det finns ingen särskild knapp för att stänga av träningen på ditt innehåll någonstans i policyn. Den hänvisar till allmänna rättigheter för registrerade, som du kan utöva via dina kontoinställningar eller genom att skicka e-post till kontaktpersonen för integritetsfrågor. ChatGPT och Claude har däremot en knapp för detta direkt i inställningarna.
I policyn anges också att insamlade uppgifter omfattar IP-adress, enhetsidentifierare, sessions- och konversations-ID samt, där enhetsinställningarna tillåter det, data från urklipp. När det gäller lagringsplats anger policyn endast att data kan överföras till servrar utanför ditt bosättningsland. Inget land nämns vid namn. Leverantören är Moonshot AI PTE. LTD., med säte i Singapore, och policyn är daterad den 7 juli 2025.
För en testkörning med ofarliga uppgifter är detta acceptabelt. För företagsinterna uppgifter, kunddata eller privata dokument gäller samma regel som för alla molntjänster, men här med en leverantör vars egna villkor uttryckligen föreskriver träning.
Vem har mest nytta av Kimi K3
Det kostar ingenting att prova. Två grupper har mest att vinna: alla som utvecklar eller designar, och alla som regelbundet arbetar med mycket långa dokument. K3 är stark där kod och grafik möts, i webbgränssnitt, 3D och animation. Kontextfönstret på en miljon token är ett starkt argument för långa texter, och bildbearbetning är inbyggd.
Om du vill ha bästa svarskvalitet eller den smidigaste upplevelsen är de främsta amerikanska modellerna fortfarande det bättre valet. Det säger Moonshot själva. Och den som hoppas kunna installera en banbrytande modell på sin egen dator inom kort bör ha de där 1,4 terabyten i åtanke.
Det anmärkningsvärda med K3 är inte så mycket rankningen som takten. Ett kinesiskt företag levererar en modell i klass med världens bästa och gör modelldata tillgängliga. För två år sedan hade det varit svårt att föreställa sig.









