In het kort
- RAG geeft het model bij elke vraag de juiste stukken uit je eigen documenten mee. Fine tuning verandert het model zelf.
- Wil je dat AI jouw informatie gebruikt, kies RAG. Wil je dat AI zich op een vaste manier gedraagt, overweeg fine tuning.
- RAG is sneller op te zetten, makkelijk bij te werken en laat zien waar een antwoord vandaan komt.
- Fine tuning vraagt veel goede voorbeelden en is bij de grote aanbieders steeds minder beschikbaar.
RAG vs fine tuning in het kort
Vergelijk het met een nieuwe medewerker.
RAG is die medewerker een goed geordende kast met handboeken geven. Bij elke vraag pakt hij eerst de juiste map, leest de relevante pagina en antwoordt daarop. Verandert er iets, dan vervang je de pagina. RAG staat voor retrieval augmented generation: ophalen, en dan pas schrijven. De techniek werd in 2020 beschreven in een onderzoeksartikel van Patrick Lewis en collega's. Hoe het precies werkt, lees je in wat is RAG.
Fine tuning is die medewerker een cursus laten volgen tot hij het werk op een bepaalde manier gewend is. Hij weet het daarna uit zijn hoofd, maar als er iets verandert moet hij opnieuw op cursus. Je traint het model bij met voorbeelden van de vraag en het goede antwoord.
Het belangrijkste verschil: RAG verandert wat het model weet op het moment van de vraag, fine tuning verandert hoe het model zich gedraagt. Een model dat je bijtraint op je productcatalogus onthoudt die catalogus slecht en verzint er met stelligheid dingen bij. Kennis stop je daarom beter in RAG.
De verschillen naast elkaar
| RAG | Fine tuning | |
|---|---|---|
| Wat het doet | Zoekt relevante stukken en geeft ze mee bij de vraag | Traint het model bij met voorbeelden |
| Goed voor | Kennis: producten, beleid, handboeken, dossiers | Gedrag: vaste vorm, toon, een specifieke taak |
| Wat je nodig hebt | Je documenten, redelijk op orde | Honderden tot duizenden goede voorbeelden van vraag en antwoord |
| Bijwerken | Document vervangen, direct actueel | Opnieuw trainen |
| Bronvermelding | Ja, het systeem weet uit welk document het antwoord komt | Nee |
| Verzinnen van feiten | Minder, omdat het model de tekst voor zich heeft | Blijft een risico |
| Opzetten | Dagen tot weken | Weken, vooral door het maken van de voorbeelden |
| Kosten per vraag | Iets hoger, want de gevonden tekst gaat mee als invoer | Kan lager, omdat de instructies korter worden |
| Toegang regelen | Per gebruiker in te stellen welke documenten meedoen | Alles wat in het model zit, is voor iedereen |
*Laatst gecontroleerd: september 2026.*
Wanneer kies je RAG en wanneer fine tuning?
- Kies RAG als AI vragen moet beantwoorden met jouw informatie, die informatie verandert of per klant verschilt, en je wilt kunnen zien waar een antwoord vandaan komt.
- Overweeg fine tuning als Het model een heel vaste vorm of stijl moet aanhouden, je lange instructies wilt vervangen door een kleiner en goedkoper model, en je genoeg goede voorbeelden hebt.
- Probeer eerst goede instructies Een duidelijke prompt met drie tot vijf voorbeelden lost een groot deel van de problemen op waarvoor mensen aan fine tuning denken. Dat kost uren in plaats van weken.
- Combineer als het moet Grote toepassingen gebruiken soms allebei: een bijgetraind model voor de vorm en RAG voor de kennis. Voor het mkb is dat zelden nodig.
Voorbeeld uit het mkb: een technische groothandel
Een technische groothandel met 20.000 artikelen wil dat de binnendienst sneller antwoord geeft op vragen als welke pomp past bij deze installatie en wat de levertijd is. De informatie staat in productbladen, handleidingen en het voorraadsysteem.
De eerste gedachte is een eigen AI-model trainen op alle productbladen. Dat blijkt de verkeerde keuze:
- Er komen elke week artikelen bij en prijzen en levertijden veranderen dagelijks. Bij fine tuning zou het model steeds achterlopen.
- De binnendienst wil kunnen zien uit welk productblad een antwoord komt, om het te controleren.
- Er zijn geen duizenden voorbeelden van goede antwoorden beschikbaar.
De groothandel kiest RAG. De productbladen en handleidingen worden doorzoekbaar gemaakt, levertijden en voorraad komen live uit het voorraadsysteem. Bij elke vraag zoekt het systeem de relevante stukken, het taalmodel schrijft een antwoord met een verwijzing naar het productblad en een medewerker controleert het voor het naar de klant gaat.
Wel wil de groothandel dat elk antwoord dezelfde opbouw heeft. Dat lossen ze op met een instructie en drie voorbeelden, zonder fine tuning. Dit voorbeeld is samengesteld om de keuze uit te leggen en beschrijft geen bestaande klant.
Fine tuning in 2026: minder beschikbaar dan je denkt
Wie wil fine tunen, heeft minder keus dan een paar jaar geleden.
- OpenAI schrijft in zijn documentatie dat het fine tuning platform wordt afgebouwd en niet meer toegankelijk is voor nieuwe gebruikers. Bestaande gebruikers kunnen nog enkele maanden trainen. Modellen die al zijn bijgetraind, blijven werken tot hun basismodel stopt.
- Google biedt fine tuning voor Gemini in Google Cloud. Gesuperviseerd bijtrainen kan in september 2026 met Gemini 3.5 Flash, Gemini 3.1 Flash-Lite, Gemini 2.5 Pro, Gemini 2.5 Flash en Gemini 2.5 Flash-Lite. Voorkeurstraining alleen met de twee 2.5 Flash-modellen.
- Anthropic. Claude kun je bijtrainen via Amazon Bedrock, maar alleen het oudere Claude 3 Haiku en alleen in een Amerikaanse regio.
- Open modellen zoals Llama en Mistral kun je zelf fine tunen en draaien op een eigen server. Dat geeft de meeste controle, maar vraagt ook de meeste technische kennis. Meer daarover in lokale LLM.
Wat bijtrainen kost, hangt af van het model en de hoeveelheid voorbeelden. De actuele tarieven staan op de prijspagina van Google Cloud.
De grote aanbieders zetten dus vooral in op betere modellen die je met instructies en je eigen documenten stuurt. Dat is precies waar RAG voor bedoeld is.
Wat kost RAG en wat kost fine tuning?
RAG kost vooral opzetwerk: documenten verzamelen, opschonen en doorzoekbaar maken, en de koppeling met je systemen. Daarna betaal je per vraag voor de extra invoertokens. Een rekenvoorbeeld: bij elke vraag gaan vijf stukken tekst van 500 tokens mee, samen 2.500 tokens. Met Claude Sonnet 5 à $2 per miljoen invoertokens is dat een halve cent per vraag, of ongeveer $50 per 10.000 vragen. Prijspeil september 2026. Rekenen met je eigen aantallen doe je met de token calculator.
Fine tuning kost vooral mensenwerk: het verzamelen, schrijven en controleren van honderden tot duizenden goede voorbeelden. Daar komen de trainingskosten bij, en bij de meeste aanbieders een hogere prijs per vraag voor het bijgetrainde model. Bij elke verandering begin je deels opnieuw.
Voor een mkb-bedrijf is RAG daardoor bijna altijd goedkoper, ook omdat je documenten toch al hebt en voorbeelden meestal niet.
Je eigen kennis veilig in een AI
Bij RAG gaan je eigen documenten door een AI. Dan wil je weten waar ze staan en wie erbij kan. Wij bouwen RAG-toepassingen die je documenten binnen Europa of op je eigen server houden en per gebruiker bepalen welke documenten meedoen. Dat doen we onder private AI. Een toepassing die klanten of medewerkers vragen laat stellen, is een AI-chatbot met RAG erachter.
Wil je eerst zien welke kant-en-klare tools er zijn, lees dan AI-tools voor bedrijven. Twijfel je of RAG of iets anders bij je vraag past, plan dan een strategiegesprek.
Veelgestelde vragen
Wat is het verschil tussen RAG en fine tuning?
Bij RAG zoekt het systeem bij elke vraag de relevante stukken uit je documenten en geeft die mee aan het model. Bij fine tuning train je het model zelf bij met voorbeelden. RAG is voor kennis, fine tuning voor gedrag.
Kan ik ChatGPT trainen op mijn eigen documenten?
Wat mensen daarmee meestal bedoelen, is RAG: het model krijgt je documenten mee bij de vraag. Dat werkt beter dan bijtrainen, want het model blijft actueel en kan laten zien waar een antwoord vandaan komt.
Is RAG veilig voor vertrouwelijke documenten?
Dat hangt af van de opzet. Met een zakelijk account, opslag in de EU of op een eigen server en toegangsrechten per gebruiker kan het veilig. Regel dit voordat de eerste documenten erin gaan.
Hoeveel voorbeelden heb ik nodig voor fine tuning?
Meestal honderden tot duizenden goede voorbeelden van vraag en antwoord. Het maken en controleren daarvan is vaak het meeste werk.
Verder lezen
Meer vergelijkingen
Bronnen
Geraadpleegd in september 2026.
- Lewis e.a., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020). arxiv.org
- OpenAI, Model optimization. developers.openai.com
- Google Cloud, Tune Gemini models. docs.cloud.google.com
- Amazon Bedrock, Supported models and Regions for fine-tuning. docs.aws.amazon.com
- Google Cloud, prijzen generatieve AI (ook voor bijtrainen). cloud.google.com