Een team van AI-agents dat samen een taak oplost, klinkt als iets waarvoor je een cloudabonnement en een creditcard nodig hebt. Dat hoeft niet: freeCodeCamp publiceerde op 14 juli 2026 een tutorial die een multi-agent-systeem twee keer bouwt — eerst in kale Python, daarna in LangGraph — en alles draait lokaal via Ollama met een Qwen-model, dus zonder API-kosten (Bron: freeCodeCamp). In deze gids zet je diezelfde basis op.
Stap 1: installeer Ollama en haal een model binnen
Download Ollama voor macOS, Windows of Linux vanaf ollama.com. Daarna haal je in de terminal een model binnen:
ollama pull qwen3:8b
ollama run qwen3:8b
Qwen3 is een familie open modellen (Apache 2.0-licentie, vrij commercieel te gebruiken) van 0.6B tot 235B parameters (Bron: Ollama). De 8B-variant is het gangbare startpunt: die draait op een GPU met zo’n 6 GB VRAM of een Mac met 16 GB geheugen. Ollama serveert het model daarna lokaal op localhost:11434 — daar praten je agents straks mee.
💡 Beginner-tip: je hoeft niets van GPU’s te weten om dit te proberen. Werkt
ollama run qwen3:8ben krijg je antwoord in de terminal? Dan is je machine snel genoeg om verder te gaan.
Stap 2: begrijp hoe weinig een multi-agent-systeem eigenlijk is
De kern van de freeCodeCamp-aanpak: een “agent” is een prompt met een rol plus een functie die het model aanroept. Een multi-agent-systeem is een handvol van die functies die elkaars output doorgeven. Een onderzoeker-agent verzamelt punten, een schrijver-agent maakt er tekst van, een redacteur-agent controleert het resultaat. In kale Python is dat een for-loop en drie prompts — geen framework nodig.
Die eerste versie bouwen loont, ook als je daarna een framework pakt: je ziet precies welke problemen een framework wél en niet voor je oplost.
Stap 3: voeg LangGraph toe voor structuur
Zodra je workflow vertakt (“bij twijfel terug naar de onderzoeker”) of state moet bewaren, wordt kale Python onoverzichtelijk. Dan is LangGraph de logische volgende stap:
pip install langchain-ollama langgraph
In LangGraph beschrijf je je agents als nodes (Python-functies), de overgangen als edges, en deelt alles één state-object. Je lokale model koppel je met twee regels:
from langchain_ollama import ChatOllama
llm = ChatOllama(model="qwen3:8b")
Dezelfde graph werkt later ook met een cloudmodel — je wisselt alleen de LLM-regel om.
⚡ Gevorderden: wil je dat agents zelfstandig tools aanroepen (via
llm.bind_tools), test dat dan eerst los. Kleinere lokale modellen volgen tool-schema’s wisselvallig; vanaf qwen3:14b wordt dat merkbaar betrouwbaarder.
Stap 4: laat het team draaien en kijk mee
Start je graph met een opdracht en log elke tussenstap naar de terminal. Juist lokaal is dat gratis kijkgenot: je ziet per agent wat er in en uit gaat, zonder dat elke iteratie geld kost. Itereer op de rolprompts — daar zit bij multi-agent-systemen vrijwel altijd de grootste winst, niet in de graph-structuur. En werkt het team eenmaal, borg dat dan met vaste testcases: onze gids AI-agents evalueren met een LLM-as-a-judge bouwt zo’n testbank op dezelfde lokale Ollama-basis.
Wil je eerst dieper in Ollama zelf duiken, pak dan onze gids Ollama voor developers erbij, of lees hoe je open-weight-modellen lokaal draait. Wat AI-agents nu wel en niet kunnen, legt hetlaatsteainieuws.nl uit in AI-agents in 2026: wat zijn ze en wat kun je er echt mee?
Checklist: ben je klaar?
- Ollama geïnstalleerd en
ollama run qwen3:8bgeeft antwoord - Eerste multi-agent-versie in kale Python gebouwd (2-3 rollen)
-
pip install langchain-ollama langgraphgedraaid - Dezelfde workflow als LangGraph-graph met nodes, edges en gedeelde state
- Tussenstappen gelogd zodat je per agent ziet wat er gebeurt
- Rolprompts minstens één keer aangescherpt op basis van de output