Een PDF met tabellen overtypen in een spreadsheet is het soort werk waar niemand op zit te wachten. Mistral OCR 4.1, sinds 16 juli 2026 algemeen beschikbaar, doet dat voor je: het model zet documenten, scans en foto’s om in schone, gestructureerde tekst — inclusief tabellen en betrouwbaarheidsscores per stukje herkende tekst (Bron: Mistral AI Docs).
💡 Beginner-tip: OCR staat voor optical character recognition — tekst herkennen in een afbeelding of scan. Het verschil met een simpele OCR-tool is dat Mistral OCR de structuur van het document snapt: het weet dat een blok tekst een tabel is, een kop, of een alinea, in plaats van alleen losse letters te herkennen.
Wat er nieuw is in versie 4.1
De belangrijkste toevoeging ten opzichte van eerdere versies is extractie op paragraafniveau: het model geeft nu bounding boxes (de exacte locatie van een tekstblok op de pagina), structurele bloklabels en betrouwbaarheidsscores terug — per woord, per pagina of per blok, afhankelijk van wat je nodig hebt (Bron: Mistral AI Docs). Dat laatste is vooral handig als je de output automatisch verder verwerkt: je kunt dan programmatisch filteren op stukken tekst waar het model minder zeker over was, en die apart laten controleren.
In drie stappen: van document naar bruikbare tekst
-
Kies je invoer. De
/v1/ocr-endpoint accepteert drie soorten input: een direct geüploade file, een document-URL (voor een PDF die al online staat) of een image-URL. Voor een snelle test volstaat een publieke PDF-link. -
Stuur de aanvraag. Een minimale aanroep ziet er zo uit:
POST /v1/ocr { "model": "mistral-ocr-4-1", "document": { "type": "document_url", "document_url": "https://voorbeeld.nl/factuur.pdf" }, "table_format": "markdown" }Je krijgt per pagina een object terug met de herkende markdown, eventuele afbeeldingen en de paginadimensies. Wil je ook weten hóe zeker het model was, voeg dan
confidence_scores_granularitytoe met de waarde"word","page"of"block". -
Verwerk de output. De markdown per pagina kun je direct gebruiken als input voor een ander AI-model, opslaan als doorzoekbare tekst, of — bij tabellen — rechtstreeks parsen naar een spreadsheet. Met
table_format: "html"krijg je tabellen als HTML in plaats van markdown, handig als je ze in een webpagina wilt tonen. Wil je de omgezette tabellen meteen laten analyseren in plaats van los inlezen, dan is ChatGPT, Julius of Excel-AI de logische vervolgstap.⚡ Gevorderden: wil je gestructureerde data volgens je eigen schema extraheren — bijvoorbeeld altijd “factuurnummer”, “datum” en “totaalbedrag” uit elke factuur — gebruik dan
document_annotation_formatmet een JSON-schema en eendocument_annotation_promptdie aangeeft wat je precies wilt. Dat kost wel het hogere tarief van $5 per 1.000 pagina’s in plaats van $4.
Grote volumes: de batch-endpoint
Moet je honderden of duizenden documenten verwerken, dan is losse aanroepen sturen omslachtig en traag. Mistral biedt daarvoor een aparte /v1/batch-endpoint, specifiek gebouwd om OCR op schaal te draaien zonder dat je op elk antwoord apart hoeft te wachten (Bron: Mistral AI Docs). Praktisch is dit het verschil tussen een script dat 500 facturen ‘s nachts in één keer wegwerkt, en 500 losse aanroepen die je handmatig moet orkestreren.
Waar je op moet letten
De documentatie noemt geen concrete verwerkingssnelheid, dus test zelf even hoe lang een batch van jouw typische documentgrootte duurt voordat je het in een tijdskritisch proces inbouwt. En reken de kosten door: bij $4 per 1.000 pagina’s is een facturenstroom van een paar honderd stuks per maand goedkoop, maar bij tienduizenden pagina’s per maand tikt dat wel aan — zeker als je de duurdere geannoteerde extractie gebruikt.
Wil je weten hoe het bredere Mistral-ecosysteem zich verhoudt tot andere Europese AI-spelers, inclusief de vraag hoe “soeverein” die AI eigenlijk is? Daar schreven we eerder over op hetlaatsteainieuws.nl. Gaat je bron niet over een document maar over een webpagina, dan is Firecrawl het equivalent voor websites.
Checklist: ben je klaar om te starten met Mistral OCR?
- API-sleutel bij Mistral geregeld (of eerst getest via de speeltuin)
- Documenttype gekozen: file-upload, document-URL of image-URL
-
table_formatingesteld op markdown of html, afhankelijk van je vervolgstap - Bij twijfel over kwaliteit:
confidence_scores_granularitytoegevoegd - Voor gestructureerde velden:
document_annotation_formatmet eigen JSON-schema overwogen - Grote volumes? Overgestapt op
/v1/batchin plaats van losse aanroepen - Kosten doorgerekend op basis van je verwachte paginavolume per maand
