Z.ai bracht eind augustus twee GLM-5.3-modellen uit, en ze hebben niet dezelfde licentie. Wie ‘open source, MIT’ onthield van GLM-5.2, moet nu eerst kijken welk model hij wil draaien.
Stap 1: kies Flash of het volledige model
GLM-5.3-Flash verscheen op 26 augustus (Bron: Z.ai docs). Het heeft 321 miljard parameters waarvan 18 miljard actief, en de Hugging Face-pagina noemt als licentie MIT (Bron: Hugging Face). Het is ook het eerste GLM-5-model met native beeldbegrip.
Het volledige GLM-5.3 volgde op 28 augustus, na een veiligheidsperiode van twee weken, en telt 753 miljard parameters (Bron: The New Stack). Voor codeertaken claimt Z.ai 50 procent beter dan GLM-5.2 op de eigen Code Bench (Bron: Z.ai docs). Dat is een vendor-cijfer.
Beginner-tip: ‘open weights’ betekent dat je het model kunt downloaden en zelf draaien. Dat is iets anders dan open source in de strenge zin. Lees eerst wat je lokaal kunt draaien als je nog nooit een model hebt geïnstalleerd.
Stap 2: lees de licentie voor je iets bouwt
Het volledige model draagt op Hugging Face de licentienaam ‘glm-5.3’, een eigen licentie (Bron: Hugging Face). Volgens The New Stack moeten bedrijven met meer dan $10 miljard omzet in twaalf maanden ‘must pass Z.AI’s security review’ voordat ze de software of afgeleiden commercieel inzetten. Digital Applied merkt op dat die drempel bedoeld is voor aanbieders van Model-as-a-Service, dat end-user-producten met modelfuncties zijn uitgezonderd, en dat er geen gepubliceerde beoordelingscriteria zijn (Bron: Digital Applied).
Voor een zzp’er, mkb-bedrijf of startup verandert er daarom in de praktijk weinig. Voor een multinational of een cloudaanbieder die het model doorverkoopt wel. De licentietekst zelf konden wij niet volledig inzien; lees hem dus zelf vóór je uitrolt.
Stap 3: reken je hardware na
Volgens The New Stack heeft het volledige model in een 2-bit-versie ongeveer 245 GB geheugen nodig en in 8-bit ongeveer 810 GB. Dat is serverwerk, niet iets voor je laptop. Flash is lichter in rekenwerk door de 18 miljard actieve parameters, maar je moet nog steeds alle 321 miljard parameters laden.
Gevorderden: beide modellen ondersteunen volgens Hugging Face onder meer vLLM, SGLang, KTransformers, Transformers en Unsloth. Start met Flash op vLLM of SGLang en meet eerst je doorvoer, voor je de investering in het grote model rechtvaardigt.
Stap 4: download alleen van de officiële bron
De modellen staan onder zai-org/GLM-5.3 en zai-org/GLM-5.3-Flash. Controleer de uitgever voor je iets ophaalt; nagemaakte repo’s met dezelfde naam komen voor. Onze gids over veilig downloaden loopt de checks langs.
Wil je niet zelf hosten, dan blijft de API. Volgens The New Stack kost het volledige model $1,40 input en $4,40 output per miljoen tokens, Flash $0,15 en $0,47. Hoe je een Coding Plan aan Claude Code koppelt, staat in onze gids daarover.
Checklist: ben je klaar?
- Je weet welk model je wilt: Flash (MIT) of volledig (GLM-5.3 License).
- Je hebt de licentietekst zelf gelezen en je omzet getoetst aan de $10-miljarddrempel.
- Je hebt de hardware of huurcapaciteit voor het gekozen model, inclusief de quantisatie.
- Je downloadt van
zai-orgen hebt de uitgever gecontroleerd. - Je hebt de prijzen op de Z.ai-site nagelopen als je de API gebruikt.
Voor de bredere context, waarom Chinese open modellen zo hard groeien, lees onze analyse op Het Laatste AI Nieuws.
