Een team van AI-agents dat samen een taak oplost, klinkt als iets waarvoor je een cloudabonnement en een creditcard nodig hebt. Dat hoeft niet: freeCodeCamp publiceerde op 14 juli 2026 een tutorial die een multi-agent-systeem twee keer bouwt — eerst in kale Python, daarna in LangGraph — en alles draait lokaal via Ollama met een Qwen-model, dus zonder API-kosten (Bron: freeCodeCamp). In deze gids zet je diezelfde basis op.
Stap 1: installeer Ollama en haal een model binnen
Download Ollama voor macOS, Windows of Linux vanaf ollama.com. Nieuw met Ollama? Onze installatiegids voor lokale modellen loopt de basis stap voor stap door. Daarna haal je in de terminal een model binnen:
ollama pull qwen3:8b
ollama run qwen3:8b
Qwen3 is een familie open modellen (Apache 2.0-licentie, vrij commercieel te gebruiken) van 0.6B tot 235B parameters (Bron: Ollama). De 8B-variant is het gangbare startpunt: die draait op een GPU met zo’n 6 GB VRAM of een Mac met 16 GB geheugen. Ollama serveert het model daarna lokaal op localhost:11434 — daar praten je agents straks mee.
💡 Beginner-tip: je hoeft niets van GPU’s te weten om dit te proberen. Werkt
ollama run qwen3:8ben krijg je antwoord in de terminal? Dan is je machine snel genoeg om verder te gaan.
Stap 2: begrijp hoe weinig een multi-agent-systeem eigenlijk is
De kern van de freeCodeCamp-aanpak: een “agent” is een prompt met een rol plus een functie die het model aanroept. Een multi-agent-systeem is een handvol van die functies die elkaars output doorgeven. Een onderzoeker-agent verzamelt punten, een schrijver-agent maakt er tekst van, een redacteur-agent controleert het resultaat. In kale Python is dat een for-loop en drie prompts — geen framework nodig.
Die eerste versie bouwen loont, ook als je daarna een framework pakt: je ziet precies welke problemen een framework wél en niet voor je oplost.
Stap 3: voeg LangGraph toe voor structuur
Zodra je workflow vertakt (“bij twijfel terug naar de onderzoeker”) of state moet bewaren, wordt kale Python onoverzichtelijk. Dan is LangGraph de logische volgende stap:
pip install langchain-ollama langgraph
In LangGraph beschrijf je je agents als nodes (Python-functies), de overgangen als edges, en deelt alles één state-object. Je lokale model koppel je met twee regels:
from langchain_ollama import ChatOllama
llm = ChatOllama(model="qwen3:8b")
Dezelfde graph werkt later ook met een cloudmodel — je wisselt alleen de LLM-regel om.
⚡ Gevorderden: wil je dat agents zelfstandig tools aanroepen (via
llm.bind_tools), test dat dan eerst los. Kleinere lokale modellen volgen tool-schema’s wisselvallig; vanaf qwen3:14b wordt dat merkbaar betrouwbaarder.
Stap 4: laat het team draaien en kijk mee
Start je graph met een opdracht en log elke tussenstap naar de terminal. Juist lokaal is dat gratis kijkgenot: je ziet per agent wat er in en uit gaat, zonder dat elke iteratie geld kost. Itereer op de rolprompts — daar zit bij multi-agent-systemen vrijwel altijd de grootste winst, niet in de graph-structuur. En werkt het team eenmaal, borg dat dan met vaste testcases: onze gids AI-agents evalueren met een LLM-as-a-judge bouwt zo’n testbank op dezelfde lokale Ollama-basis.
Wil je eerst dieper in Ollama zelf duiken, pak dan onze gids Ollama voor developers erbij, of lees hoe je open-weight-modellen lokaal draait. Wil je zo’n team ook op je eigen documenten laten antwoorden, dan koppel je ze via RAG — bijvoorbeeld met LlamaIndex. Wat AI-agents nu wel en niet kunnen, legt hetlaatsteainieuws.nl uit in AI-agents in 2026: wat zijn ze en wat kun je er echt mee?
Checklist: ben je klaar?
- Ollama geïnstalleerd en
ollama run qwen3:8bgeeft antwoord - Eerste multi-agent-versie in kale Python gebouwd (2-3 rollen)
-
pip install langchain-ollama langgraphgedraaid - Dezelfde workflow als LangGraph-graph met nodes, edges en gedeelde state
- Tussenstappen gelogd zodat je per agent ziet wat er gebeurt
- Rolprompts minstens één keer aangescherpt op basis van de output
