Alibaba gaf op 14 augustus 2026 Qwen3.8-27B vrij. Het interessante zit niet in de benchmarkscores maar in de licentie: Apache 2.0, bevestigd in het licentiebestand zelf. Commercieel gebruik mag, zonder afdracht. Dat maakt de vraag “zelf draaien of huren” voor het eerst een echte afweging bij een model van dit kaliber.
Wat je krijgt
Een dens model van 27 miljard parameters — geen mixture-of-experts, dus bij elke vraag draait het hele model. Het is een native vision language model: tekst, afbeeldingen en video gaan erin, tekst komt eruit. Het contextvenster is 262.144 tokens.
Twee checkpoints staan op Hugging Face en ModelScope:
| Checkpoint | Formaat | Wanneer kiezen |
|---|---|---|
Qwen/Qwen3.8-27B | BF16 | Je hebt geheugen over en wilt geen enkele kwantisatie-twijfel |
Qwen/Qwen3.8-27B-FP8 | FP8, blokgrootte 128 | Standaardkeuze: ruwweg halve geheugenlast, volgens Alibaba nagenoeg gelijke kwaliteit |
Serveerrecepten zijn gepubliceerd voor vLLM en SGLang. Voor een eerste kennismaking zonder infrastructuur is Ollama of LM Studio de kortste route, mits daar een geschikte quant beschikbaar is.
De afweging in drie vragen
1. Gaat er gevoelige data in? Dit is de enige vraag die op zichzelf de doorslag kan geven. Draai je het model op eigen hardware, dan verlaat de invoer je netwerk niet. Bij elk gehost endpoint — ook OpenRouter — geldt het verhaal van elke cloudleverancier: kijk waar het draait en wat er met je invoer gebeurt.
2. Hoeveel tokens verwerk je per maand? OpenRouter rekent 0,45 dollar per miljoen ingaande en 3,20 dollar per miljoen uitgaande tokens. Onder de paar honderd miljoen tokens per maand haal je een GPU-investering er zelden uit. Daarboven kantelt het, zeker bij taken met veel invoer en weinig uitvoer — en dat is precies het profiel van documentverwerking en OCR.
3. Moet het altijd aan staan? Een lokaal model dat ‘s nachts stilstaat kost evenveel als een lokaal model dat draait. Een endpoint kost niets als je niets vraagt. Bij bursty gebruik wint huren bijna altijd.
Beginnen zonder iets te installeren
De snelste test kost je een half uur en geen hardware: zet het model via OpenRouter achter je bestaande code, gooi er twintig representatieve taken doorheen en vergelijk de uitkomsten met wat je nu gebruikt. Pas als het model die test doorstaat, is de hostingvraag relevant.
Wat je daarbij meet is niet de benchmarkscore maar jouw taak. Alibaba’s eigen cijfers zetten Qwen3.8-27B op 61,7 procent voor SWE-bench Pro tegen 53,4 procent voor Claude Opus 4.6 Max, maar dat zijn Alibaba’s metingen op een door Alibaba gecorrigeerde testset. Twee van de benchmarks in de tabel zijn in huis gemaakt en niet openbaar. Bruikbaar als richting, niet als bewijs.
Waar het misgaat
- YaRN standaard aanzetten. De uitbreiding naar een miljoen tokens is statisch geïmplementeerd in de gangbare frameworks en kan de nauwkeurigheid op korte invoer verlagen. Zet hem aan per taak, niet per server.
- De licentie van Max verwarren met die van 27B. Max heeft een eigen Alibaba-licentie, 27B heeft Apache 2.0. Check per checkpoint.
- Rekenen op een officiële API-prijs. Die is er nog niet. Wie er een noemt, citeert iets dat Alibaba niet heeft gepubliceerd.
- BF16 kiezen zonder reden. De FP8-variant is voor bijna iedereen de praktische keuze.
Wil je eerst het bredere plaatje — waarom er in twee weken tijd twee gratis modellen van deze klasse verschenen — dan staat de duiding op Het Laatste AI Nieuws.
