Wil je AI inzetten op gegevens die je liever niet de deur uit stuurt — klantdossiers, interne documenten, gevoelige aanvragen — dan is een cloud-dienst niet altijd de juiste keuze. Met Ollama draai je een taalmodel volledig op je eigen computer of server. De data blijft binnen je netwerk, en je betaalt geen tokens per aanvraag. In deze korte gids zie je hoe je er een simpele agent op laat draaien.
Wat Ollama doet
Ollama is een programma dat open modellen zoals Llama en Phi lokaal draait en ze beschikbaar maakt via een API. Na installatie haal je een model binnen met één commando:
ollama pull llama3.1
Vanaf dat moment draait er op je machine een API op http://localhost:11434. Het handige: die API spreekt dezelfde taal als de bekende OpenAI-API. Bestaande code die je voor een cloud-model schreef, wijs je naar Ollama door alleen de basis-URL te veranderen.
Je bestaande agent-code hergebruiken
Gebruik je Python met de OpenAI-bibliotheek, dan is de aanpassing minimaal:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # verplicht veld, maar wordt niet gecontroleerd
)
antwoord = client.chat.completions.create(
model="llama3.1",
messages=[{"role": "user", "content": "Vat deze aanvraag samen in één zin."}]
)
print(antwoord.choices[0].message.content)
Meer verandert er niet. Wat naar de cloud ging, gaat nu naar je eigen machine.
Van model naar agent
Een agent doet meer dan tekst teruggeven: hij kiest een actie en voert die uit. Daarvoor heb je een model nodig dat tool calling ondersteunt, zoals llama3.1. Je beschrijft in je verzoek welke functies het model mag aanroepen — bijvoorbeeld “zoek klantnummer op” of “zet in categorie X”. Het model geeft dan gestructureerd terug welke functie het wil gebruiken en met welke waarden. Jouw code voert die functie uit en stuurt het resultaat terug. Zo bouw je stap voor stap een agent die, bijvoorbeeld, een binnenkomende tekstaanvraag leest, classificeert en doorzet — allemaal zonder dat er een byte naar buiten gaat.
Wat het kost en waar de grens ligt
De winst is duidelijk: privacy en geen gebruikskosten. De prijs betaal je in hardware. Kleine modellen draaien op een goede laptop; grotere vragen om flink werkgeheugen en liefst een aparte grafische kaart. Begin daarom klein, krijg je opzet werkend, en schaal het model pas op als de kwaliteit erom vraagt. Voor gevoelige, afgebakende taken — een aanvraag triëren, een document samenvatten, gegevens ordenen — is een lokaal model vaak ruim voldoende, en houd je de regie volledig in eigen huis.
