Een taalmodel kent de wereld tot zijn trainingsdatum, maar niet jouw handleidingen, contracten of kennisbank. LlamaIndex lost dat op: het verbindt een model met je eigen documenten, zodat je er vragen over kunt stellen mét bronvermelding. Dat heet RAG. Deze gids laat in vijf stappen zien hoe een basis-chatbot eruitziet. Je hebt Python-kennis nodig.
Wat RAG doet, kort
Bij RAG (Retrieval-Augmented Generation) zoekt het systeem eerst de relevante stukken uit jouw documenten op en geeft die als context mee aan het taalmodel. Het model antwoordt dan op basis van die stukken, niet uit zijn geheugen. Zo krijg je actuele, controleerbare antwoorden over informatie die het model nooit heeft gezien. De uitleg in gewone taal staat in onze cross-post Wat is RAG? op hetlaatsteainieuws.nl.
Stap 1: installeren en documenten klaarzetten
Installeer de bibliotheek met pip install llama-index. Zet je documenten (PDF’s, tekstbestanden, Word) in één map, bijvoorbeeld data/. Zorg dat je een API-sleutel hebt voor het taalmodel dat je wilt gebruiken; LlamaIndex roept dat model aan voor het genereren van antwoorden en het maken van embeddings.
Stap 2: laden en indexeren
Met een paar regels lees je de map in en bouw je een doorzoekbare index:
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader
documents = SimpleDirectoryReader("data").load_data()
index = VectorStoreIndex.from_documents(documents)
SimpleDirectoryReader leest alle bestanden in de map; VectorStoreIndex knipt ze in stukken en zet ze om in vectoren zodat je op betekenis kunt zoeken.
Stap 3: een query-engine maken en vragen stellen
query_engine = index.as_query_engine()
antwoord = query_engine.query("Wat is de opzegtermijn in het contract?")
print(antwoord)
De query-engine zoekt de relevante stukken op en laat het model daarop antwoorden. Je krijgt een antwoord in gewone taal, gebaseerd op jouw documenten.
Stap 4: toon de bronnen
Het verschil tussen een speeltje en een bruikbaar systeem is de bronvermelding. Vraag de bijbehorende passages op zodat je (of je gebruiker) kan controleren waar het antwoord vandaan komt:
for node in antwoord.source_nodes:
print(node.node.get_content()[:200], node.score)
⚡ Gevorderden: De standaard-instellingen zijn prima om te starten, maar productie vraagt afstelling. Experimenteer met chunk-grootte, een reranker en hybride zoeken (vector plus trefwoord) om de kwaliteit van de opgehaalde stukken op te krikken. Daar wint of verliest een RAG-systeem zijn betrouwbaarheid.
Stap 5: lastige PDF’s? Gebruik LlamaParse
Bevat je bron ingewikkelde tabellen, formulieren of scans, dan haalt de standaard-reader er vaak rommel uit. LlamaParse, het parse-onderdeel van LlamaCloud, zet zulke documenten betrouwbaarder om. Het heeft een gratis tier van 1.000 credits per maand; daarboven kosten 1.000 credits 1,25 dollar, met parseerkosten per pagina afhankelijk van de complexiteit (Bron: LlamaIndex pricing).
Wie liever ziet hoe zo’n systeem er in de praktijk uitziet, kan onze stukken RAG op je eigen bedrijfsdata en een hybride RAG-zoeksysteem met Claude erbij pakken.
Checklist: ben je klaar?
-
llama-indexgeïnstalleerd via pip - Documenten in één map gezet (
data/) - API-sleutel voor je taalmodel ingesteld
- Index gebouwd met
VectorStoreIndex - Query-engine getest met een echte vraag
- Bronvermelding (
source_nodes) zichtbaar gemaakt - Bij lastige PDF’s: LlamaParse geprobeerd
Bronnen
- LlamaIndex — officiële site (framework en documentatie)
- LlamaIndex Pricing Guide 2026 (LlamaParse-credits en gratis tier)
- Wat is RAG? — hetlaatsteainieuws.nl (RAG in gewone taal)
