Meta heeft sinds 10 augustus twee open modellenlijnen naast elkaar staan, en dat maakt de keuze onnodig verwarrend. Llama is het bekende fundament van de open-source AI-wereld. Muse Glimmer is de nieuwkomer die op je eigen laptop moet draaien. In deze gids kies je in drie stappen welke van de twee je download.
Stap 1: check eerst de licentie, niet de benchmark
Dit is de stap die de meeste mensen overslaan en waar het het vaakst misgaat.
Muse Glimmer staat onder Apache 2.0. Dat is een echte open-source-licentie: gebruiken, aanpassen, commercieel uitrollen, zonder aanvullende voorwaarden van Meta. De gewichten staan bovendien ongated op Hugging Face, dus je hoeft geen formulier in te vullen om ze te mogen ophalen.
Llama 4 valt onder de Llama Community License. Die is gratis, maar niet OSI-open source. Er geldt een attributieplicht, boven 700 miljoen gebruikers heb je een aparte licentie nodig, en de multimodale varianten zijn onder die licentie uitgesloten voor bedrijven die in de EU gevestigd zijn. Dat laatste raakt je direct als je hier zit en met beeld wilt werken.
💡 Beginner-tip: “open weights” betekent dat je de modelbestanden mag downloaden en zelf draaien. Het betekent niet automatisch dat je ermee mag doen wat je wilt. De licentie ernaast bepaalt dat, en die verschilt per model.
Stap 2: reken je geheugen uit
Muse Glimmer is een dense model van 30 miljard parameters. Rond 4-bit gekwantiseerd blijft het onder de 20 GB, en dat is precies het punt waarop het op één consumenten-GPU of een Mac met genoeg unified memory past. Het contextvenster is 128K en het model is multimodaal.
Llama 4 werkt anders. Scout en Maverick zijn mixture-of-experts-modellen: 17 miljard actieve parameters, maar tot 400 miljard in totaal. Alleen de actieve experts rekenen mee per token, maar het hele model moet wel ergens staan. In de praktijk betekent dat serverhardware, of een provider die het voor je host.
Vuistregel: wil je het op je eigen machine, begin bij Glimmer. Wil je maximale kwaliteit en huur je toch capaciteit in, dan is Llama 4 via Ollama, vLLM of een API-aanbieder nog steeds een prima route.
Stap 3: haal het model binnen
Voor Glimmer staan de gewichten ongated op Hugging Face, dus je kunt ze rechtstreeks ophalen. Wil je het via Ollama draaien, zoek dan in de modelbibliotheek op de naam en kopieer het tag dat daar staat:
ollama pull <tag-uit-de-ollama-bibliotheek>
ollama run <tag-uit-de-ollama-bibliotheek>
⚠️ Check de exacte tag bij de bron. Modelnamen in Ollama en op Hugging Face verschillen vaak net iets van de marketingnaam, en bij een model van twee weken oud verschuift dat nog. Draait het niet vloeiend, pak dan een zwaarder gekwantiseerde variant: elke stap omlaag in kwantisatie scheelt geheugen en kost een beetje kwaliteit.
Voor Llama 4 loopt het meestal via een provider. Dan betaal je per token in plaats van per uur GPU, en hoef je zelf niets te hosten. Voor incidenteel gebruik is dat vrijwel altijd goedkoper dan een kaart kopen.
En de rest van Meta’s plannen?
Meta heeft aangekondigd dat ook de gewichten van het gesloten Muse Spark 1.2 openbaar worden. Per 13 augustus 2026 was dat nog niet gebeurd. Reken er dus niet op in je planning.
Kort samengevat: EU-bedrijf dat iets commercieel uitrolt op eigen hardware, pak Muse Glimmer. Draai je al op Llama met een werkende pijplijn, blijf dan zitten tot je een concrete reden hebt om te wisselen.
