ComfyUI med MiniMax H3: Bättre än Kling AI, Seedance och andra videogeneratorer i gratisversionen?

AI-videogeneratorer är betydligt svårare att använda gratis än vanliga LLM:er som ChatGPT, och de flesta leverantörer är snåla med gratiskrediter. Att få dem att skapa exakt det du vill ha – samtidigt som utseendet förblir bra och enhetligt – är ännu svårare. Så jag bestämde mig för att testa alternativet: att köra en lokal modell som MiniMax H3.
Min son vill använda AI för att skapa sin egen, ja, byggvideo om ljussablar. Han är just nu fascinerad av ämnet. Men eftersom jag inte ville lägga ut en massa pengar direkt på ett dyrt abonnemang på en AI-videotjänst för hans experiment, försökte han först använda Kling AI och liknande tjänster gratis.
De flesta AI-videogeneratorer lockar med en gratis startkvot för att få dig att skapa ett konto. Men haken blir snabbt uppenbar: om du vill skapa mer än en eller två tre-sekundersvideor per dag på kontinuerlig basis tvingas du snart att teckna ett dyrt abonnemang.
Men även visuellt var de videor som skapats fram till dess inte särskilt tillfredsställande. Det är oftast också svårt att hålla miljöer, objekt och karaktärer konsekventa. Det besvikna barnet fick mig att prova en lokal lösning.
Lokala modeller och lösningar kräver naturligtvis kraftfull hårdvara. Vi kör testet på en Razer Blade 16 (2025) med ett RTX 5090-grafikkort och 24 GB VRAM. Generellt sett blir videogenerering först rimligt intressant när man har 8 GB VRAM, och i det här fallet innebär mer verkligen mer.
Det finns många gränssnitt tillgängliga för modellen – vi valde MiniMax H3. Den kan köras i till exempel Ollama, liksom i Pinokio eller Stability Matrix. Den sistnämnda inkluderar även ComfyUI, ett grafiskt gränssnitt för AI-arbetsflöden som inte är begränsat till videogenerering. Jag stötte dock på problem med den kombinationen, så jag valde istället en fristående version av ComfyUI (ComfyUI.org), som kan laddas ner som ett program för Windows och andra plattformar.

Topp 10...
» Topp 10: Bästa bärbara allround/multimediadatorerna
» Topp 10: Bästa bärbara speldatorerna
» Topp 10: Bärbara budget/kontorsdatorer
» Topp 10: Bästa bärbara kontors/premiumdatorerna
» Topp 10: Bärbara arbetsstationer
» Topp 10: De bästa små/kompakta bärbara datorerna
» Topp 10: Bästa ultrabooks
» Topp 10: Bästa hybriddatorerna
» Topp 10: Bästa surfplattorna
» Topp 10: Marknadens bästa smartphones
ComfyUI kräver lite vana för nybörjare, men det öppnar upp en enorm rad möjligheter för videoproduktion. Du bygger arbetsflöden från enskilda noder, i princip ett modulärt verktygslåda bestående av flera verktyg/noder. Varje nod har en ingång och en utgång och kan kopplas ihop med andra noder.

Alla verktyg är uppdelade i enskilda noder. Det finns till exempel en nod för textprompten, flera bildnoder som kan fungera som referenser eller mellanliggande steg före videogenerering, samt andra verktyg. I teorin skulle man kunna ladda in en separat AI-modell i varje nod – en LLM för textprompten, en bildgenereringsmodell för bildnoderna och så vidare. AI-modellerna tar naturligtvis upp mycket lagringsutrymme. I slutändan matas alla noder in i videogenereringsnoden, som producerar resultatet.
Till en början experimenterade vi med förinställningar för text-till-video, men gick snart över till referens-till-video.

Det som gör detta särskilt användbart är att det också möjliggör konsekventa miljöer, objekt och personer. I vår första video skapade vi till exempel ett krigsfartyg byggt av tegelstenar som flög genom bildrutan. Med en upplösning på 480p tog det cirka 5,5 minuter att generera, medan högre upplösningar är möjliga med lämplig hårdvara. I en av de kommande scenerna ville vi dock använda exakt samma krigsfartyg igen. Så vi tog skärmdumpar av rymdskeppets fram- och baksida, importerade bilderna, länkade dem som referenser med namnen Ship_front och Ship_rear till huvudnoden och instruerade AI:n att använda just detta skepp i en annan scen. Annars skulle AI:n ha genererat ett nytt utseende.
Efter att ha ägnat lite tid åt att bekanta oss med systemet och med lite hjälp från professor YouTube satte vi snabbt ihop ett första arbetsflöde för våra videoscener och genererade videor som vi båda var mycket nöjda med. En LLM – i detta fall ChatGPT – hjälpte oss att skräddarsy textprompterna specifikt för MiniMax H3, vilket gjorde dem precisa och detaljerade.
Mitt arbetsflöde: I ChatGPT beskrev jag det utseende jag hade i åtanke, specificerade att vissa varumärkesnamn inte skulle förekomma även om utseendet fortfarande kunde vara inspirerat av dem, förklarade att det skulle ha en filmisk känsla och angav vilka referenser (som Ship_front) som skulle inkluderas. Först därefter beskrev jag scenen. Jag klistrade in den av ChatGPT skräddarsydda prompten i textnoden i ComfyUI, lade till eventuella referensbilder om det behövdes, och så var jag klar.

Du kan också be ChatGPT att generera en universell prompt baserad på önskat utseende och andra parametrar, som du kan spara för senare bruk. Om du matar in den prompten i en LLM igen har den all nödvändig information och du kan omedelbart beskriva nästa scen.
I alla fall var min son och jag betydligt nöjdare med resultaten än med gratispaketen hos Kling AI, Seedance och liknande tjänster. De många tillgängliga alternativen inbjuder också till experimenterande, och du slipper äntligen irriterande kreditbegränsningar, påminnelser om prenumerationer, annonser och oro kring datasäkerhet. Upplösningen är dock fortfarande ett problem. Full HD eller högre finns inte ens som alternativ, förmodligen eftersom hårdvarukraven skulle bli för höga. Framtida modeller kommer sannolikt att bli mer effektiva i detta avseende. För tillfället kan du också utöka ditt arbetsflöde med uppskalare.
Alla som har den nödvändiga hårdvaran och är intresserade av filmproduktion bör ta en titt på ComfyUI och en bra lokal AI-modell. Särskilt ComfyUI möjliggör otroligt komplexa, skiktade arbetsflöden – om du faktiskt behöver dem. För att komma igång finns dock det väsentliga redan på plats och går snabbt att lära sig.









