PagedAttention
Virtueel-geheugen-achtig KV-cache-beheer dat GPU-geheugen vrijwel volledig benut.
Open-source inference-engine voor LLM's op GPU-clusters — industriestandaard voor enterprise on-premise deploys
vLLM is een open-source inference-engine voor het serveren van LLM's op GPU-clusters in productie. Het gebruikt PagedAttention voor efficiënt geheugenbeheer en continuous batching voor hoge throughput. Sinds eind 2025 draait alles op de herbouwde V1-engine, met gescheiden scheduling van prefill en decode en chunked prefill als standaard — merkbaar lagere latency bij hoge concurrency. Het project valt onder de PyTorch Foundation en releaset vrijwel maandelijks. Naast NVIDIA ondersteunt vLLM ook AMD-GPU's, Intel- en ARM-CPU's en TPU's. Wordt gebruikt door enterprise-organisaties die LLM's on-premise of in private cloud willen draaien, en is de de-facto standaard voor zelf-gehoste LLM-serving.
Feiten geverifieerd op 6 juni 2026 · hoe wij beoordelen
vLLM is de snelste open-source inference-server voor LLM's op GPU-clusters — ideaal voor productie self-hosting. De industriestandaard voor enterprise on-premise deployments.
Waarom op de site: vLLM is de meest gebruikte open-source LLM-serving-engine voor productie-deployments en de de-facto standaard in enterprise on-premise LLM-infrastructure.
Beste alternatief: ollama
vLLM is het meest waardevol voor organisaties die grootschalige taalmodellen willen inzetten in hun applicaties en diensten.
Virtueel-geheugen-achtig KV-cache-beheer dat GPU-geheugen vrijwel volledig benut.
Voegt binnenkomende requests dynamisch samen voor maximale GPU-bezetting.
Herbouwde engine met gescheiden prefill/decode-scheduling en chunked prefill — lagere latency bij hoge concurrency.
GPTQ, AWQ, FP8 en INT8 voor lagere geheugen- en kostenvoetafdruk.
Start met één commando een API-server die drop-in werkt met OpenAI-SDK's.
Verdeel grote modellen over meerdere GPU's en nodes voor 70B+ modellen.
Draait op NVIDIA en AMD GPU's, Intel/ARM CPU's en Google TPU's.
Gratis (open-source, Apache 2.0). GPU-infrastructuur is de echte kostenpost.
Prijzen indicatief — controleer altijd de actuele tarieven bij de aanbieder.
Hands-on tutorials en uitleg om snel productief te worden met vLLM.
Typ een toolnaam, categorie of use case
Zoeken...
Geen tools gevonden
Wat de wereld er van zegt
In het nieuws
How to Scale LLM Inference for AI Agents Using vLLM
In this tutorial, I’ll show you how to scale LLM inference for AI agents using vLLM. I'll help you build an intuition for how LLM inference works, explore why agent workloads create GPU scheduling and
Benchmarking vLLM: Baseline and Our First Optimization
Part 4 of the Understanding LLM Serving series Read the series: Part 1 • Part 2 • Part 3 • Part 4 Continue reading on Understanding LLM Serving »