Notebookcheck Logo

Meta Muse Glimmer körs offline på en GPU, men kräver 24 GB VRAM

Metalogotyp med texten ”Build with Muse” på mörk bakgrund
ⓘ Meta
Muse Glimmer körs helt lokalt, men kräver minst 24 GB grafikkortminne.
Meta har släppt Muse Glimmer, en språkmodell med cirka 30 miljarder parametrar under en Apache 2.0-licens. Den körs helt på din egen dator, utan internetanslutning och utan abonnemang. Haken är att du behöver 24 GB grafikkortminne, alltså ett RTX 5090, ett RTX 4090 eller en Mac med M4 Max. Viktningarna finns gratis på Hugging Face.

Meta släppte Muse Glimmer den 10 augusti, en språkmodell med ungefär 30 miljarder parametrar. Det som sticker ut är inte så mycket modellen i sig som licensen och målmaskinen. Vikterna finns på Hugging Face under Apache 2.0, så du kan ladda ner dem, modifiera dem och använda dem kommersiellt. Och den här modellen är inte byggd för att köras i ett datacenter, utan på ett enda grafikkort under ditt skrivbord.

Modellen kommer från Meta Superintelligence Lab och är en avskalad version av den större Muse Spark, vilket innebär att en stor modell har lärt en liten modell hur man svarar. Den tar emot text och bilder som indata men producerar endast text, hanterar mer än 100 språk och arbetar med ett kontextfönster på över 131 000 token. Dess kunskap sträcker sig fram till den 4 januari 2026. Metas senaste lanseringar var agenten Muse Code och bildgeneratorn Muse Image.

24 GB VRAM är minimikravet

Vid full precision skulle modellen behöva 64 GB videominne. Meta komprimerar det till ungefär 4-bit genom kvantisering, ett grovare sätt att lagra siffror som tar upp betydligt mindre utrymme. Det krymper språkdelen till under 20 GB, vilket lämnar utrymme för bildkodaren och cachen för den pågående konversationen.

Två färdiga varianter medföljer. K-Quant-Dynamic är avsedd för 32 GB och tappar i genomsnitt 0,2 procent i noggrannhet i 15 prestandatester, medan K-Quant-17GB ryms i 24 GB och tappar 1,0 procent. I praktiken innebär det ett GeForce RTX 5090, RTX 4090, RTX 3090 eller en Mac med en M4 Max. Ett mellanklasskort med 12 GB är inte tillräckligt. Om du har mindre minne täcker vår guide mindre modeller för din egen bärbara dator, och till och med iPhone kan nu köra en användbar språkmodell.

En accelerator gör det tre gånger snabbare

För att förhindra att en lokal modell känns trög levererar Meta ett hjälpverktyg som heter DFlash. Det föreslår 16 token samtidigt, och den stora modellen kontrollerar hela blocket i ett enda genomgång och korrigerar endast det som är fel. Enligt Metas egna mätningar stiger genomströmningen på ett RTX 5090 från 74,9 till 233,4 token per sekund, en ökning med en faktor på 3,1. En MacBook med M5 Max går från 26,6 till 50,2 token, M4 Max från 23,7 till 37,8.

AMD publicerade sina egna siffror samma dag. En minidator med en Ryzen AI Max+ 395 klarar upp till 24 tokens per sekund och ett Radeon AI PRO R9700 upp till 53, mätt på Windows med llama.cpp. AMD betecknar siffrorna som preliminära.

Stark på planering, svagare på gränssnittet

Meta jämför Muse Glimmer med Googles Gemma4-31B och Alibabas Qwen3.6-27B. När modellen anropar verktyg och planerar över flera steg ligger den klart i täten. Den får 75,5 på MCP Atlas jämfört med 54,2 och 62,5, och 74,6 på DeepSearch QA jämfört med 61,7 och 71,1.

Qwen vinner på andra områden. När det gäller att styra ett verkligt skrivbordsgränssnitt är poängen 65,9 mot 75,6, och i terminalen 51,7 mot 60,7. Och i säkerhetstestet Siren AgentDojo, som mäter hur lätt en modell kan manipuleras av instruktioner dolda i externa dokument, slår Muse Glimmers attackframgång på 28,4 procent Qwen men ligger efter Gemma4 med 25,6 procent. Det är värt att ha i åtanke innan du riktar modellen mot dina egna filer och e-post.

Så här hämtar du den

Fyra paket finns tillgängliga på Hugging Face: basmodellen med fullständiga BF16-vikter, GGUF-filer för llama.cpp, ExecuTorch-byggnader för Apple-enheter och DFlash-hjälpverktyget. Det enklaste sättet är via LM Studio, där modellen dyker upp i sökresultaten. AMD rekommenderar mer än 32 GB grafikkortminne eller en motsvarande tilldelning av systemminne för detta. Om du har mindre erbjuder leverantörer som Unsloth mindre kvantiseringar, men då måste du flytta en del av modellen till vanligt systemminne, vilket medför en märkbar hastighetsförlust. Communityn reagerade snabbt. Mindre än en dag efter lanseringen fanns det redan 57 ytterligare kvantiseringar och sex finjusteringar tillgängliga. Att testa det i en webbläsare på samma sätt som man kunde med Kimi K3 är inte möjligt här. Utan rätt hårdvara förblir Muse Glimmer utom räckhåll.

Google LogoAdd as a preferred source on Google
Mail Logo
> Bärbara datorer, laptops - tester och nyheter > Nyheter > Nyhetsarkiv > Nyhetsarkiv 2026 08 > Meta Muse Glimmer körs offline på en GPU, men kräver 24 GB VRAM
Steffen Zahn, 2026-08-11 (Update: 2026-08-11)