In het kort
- RAG betekent: eerst zoeken (retrieval), dan antwoorden (generation) op basis van wat gevonden is.
- Het taalmodel leert je documenten niet uit het hoofd. Het krijgt bij elke vraag de relevante passages mee.
- Voordeel: actuele antwoorden uit je eigen bronnen, met bronvermelding, zonder een model te hoeven trainen.
- De kwaliteit hangt vooral af van je documenten en van hoe goed het zoeken werkt.
Retrieval augmented generation uitleg in gewone taal
Een taalmodel zoals GPT of Claude weet veel, maar niets over jouw bedrijf. Het kent je prijslijst niet, je retourvoorwaarden niet en de handleiding van je machines ook niet. Vraag je het toch, dan gaat het gokken. Dat klinkt overtuigend en is vaak fout.
RAG lost dat op met een tussenstap. Denk aan een nieuwe medewerker met een map vol documenten. Als een klant iets vraagt, zoekt hij eerst de juiste pagina op, leest die en formuleert dan een antwoord. Zo werkt RAG ook:
- Vraag. Een klant of medewerker stelt een vraag.
- Zoeken. Het systeem zoekt in jouw documenten de passages die het beste bij de vraag passen.
- Meegeven. Die passages gaan samen met de vraag naar het taalmodel, met de opdracht: antwoord alleen op basis van deze tekst.
- Antwoord. Het model schrijft een antwoord in gewone taal, met een verwijzing naar het document waar het vandaan komt.
Een Nederlandse vertaling is er niet echt. Letterlijk betekent het "generatie versterkt met opgehaalde informatie". In de praktijk zegt iedereen gewoon RAG, of spreekt men van een chatbot op eigen data of een AI-kennisbank. Bedoeld wordt steeds hetzelfde: het model antwoordt met jouw informatie als basis, en het laat zien waar die informatie vandaan komt.
De term komt uit een onderzoek van Facebook AI Research uit 2020. Inmiddels zit RAG in bijna elke chatbot die op bedrijfsinformatie antwoordt. Wat een taalmodel precies is, lees je in wat is een LLM.
Hoe werkt het zoeken? Embeddings en vectordatabases
Het slimme deel van RAG zit in het zoeken. Gewoon zoeken op trefwoorden mist veel: een klant vraagt "kan ik mijn bestelling terugsturen?" terwijl in je voorwaarden "retourneren" staat.
Daarom werkt RAG meestal met embeddings. Elk stuk tekst wordt omgezet in een reeks getallen die de betekenis vastlegt. Teksten met een vergelijkbare betekenis krijgen vergelijkbare getallen. Die getallen staan in een vectordatabase. Bij een vraag zoekt het systeem de stukken waarvan de betekenis het dichtst bij de vraag ligt.
In de praktijk combineren goede systemen twee manieren van zoeken: op betekenis en op exacte woorden, zoals productcodes of artikelnummers. Daarna zet een tweede stap de beste resultaten bovenaan.
| Onderdeel | Wat het doet |
|---|---|
| Documenten opknippen | Lange documenten in stukken van een paar alinea's verdelen |
| Embeddings maken | Elk stuk omzetten in getallen die de betekenis vastleggen |
| Vectordatabase | De stukken opslaan en snel doorzoeken |
| Taalmodel | Het antwoord schrijven op basis van de gevonden stukken |
RAG chatbot of een model trainen?
Veel ondernemers denken dat je een AI-model moet trainen op je eigen data. Voor het beantwoorden van vragen is dat bijna nooit nodig.
| RAG | Model trainen (fine-tunen) | |
|---|---|---|
| Nieuwe informatie toevoegen | Document toevoegen, direct bruikbaar | Opnieuw trainen |
| Bronvermelding | Ja | Nee |
| Kosten | Laag tot gemiddeld | Hoger |
| Geschikt voor | Feiten, voorwaarden, handleidingen, kennisbanken | Een vaste schrijfstijl of een specifieke taak |
| Toegang per gebruiker | Goed te regelen | Lastig, wat erin zit, zit erin |
Vuistregel: gaat het om wat het model weet, kies RAG. Gaat het om hoe het model schrijft of werkt, dan kan trainen zinvol zijn. Vaak is ook dat met goede instructies op te lossen. Een AI chatbot voor klanten of personeel bouwen we daarom bijna altijd met RAG.
Voorbeelden van een RAG oplossing in het mkb
- Klantenservice. Een chatbot die vragen over levering, retour en producten beantwoordt uit je voorwaarden, productinformatie en veelgestelde vragen.
- Interne kennisbank. Medewerkers vragen "hoe maak ik een creditnota aan?" en krijgen het antwoord uit de werkinstructies.
- Technische dienst. Een monteur zoekt in honderden pagina's handleidingen naar de foutcode van een machine.
- Offertes en aanbestedingen. Het systeem zoekt in eerdere offertes en referenties de passages die bij een nieuwe aanvraag passen.
- Zorg en juridisch. Antwoorden uit protocollen of dossiers, met strikte toegangsrechten.
Bij gevoelige documenten telt waar alles draait. De documenten, de vectordatabase en het model kunnen in Europa of op een eigen server staan. Dat lees je bij private AI. Welk klantvoorbeeld mogen we hier noemen?
Hoe wij het aanpakken
Bij een RAG-project besteden we de meeste tijd niet aan het model. We besteden die aan de documenten. Welke versie is de juiste? Wat is verouderd? Staat hetzelfde op drie plekken anders? Een chatbot die uit rommelige documenten zoekt, geeft rommelige antwoorden.
Daarna stellen we een testset op: een paar tientallen echte vragen met het goede antwoord erbij. Elke aanpassing aan het zoeken of de instructies meten we tegen die set. Zo weet je of het beter wordt, in plaats van dat je op gevoel bijstuurt.
Tot slot regelen we wat er gebeurt als het systeem het antwoord niet vindt. Dan zegt het dat eerlijk en verwijst het naar een medewerker. Een chatbot die zegt "dat weet ik niet" is beter dan een die iets verzint.
Veelgemaakte fouten met RAG
- Alles erin gooien. Oude prijslijsten en concepten naast de actuele versie zorgen voor tegenstrijdige antwoorden.
- Geen toegangsrechten. Als iedereen alles kan vragen, komt het salarisoverzicht zo in een antwoord terecht. Regel per gebruiker wat het systeem mag doorzoeken.
- Tabellen en scans vergeten. Pdf's met tabellen of gescande pagina's worden vaak slecht gelezen. Controleer wat er na het inlezen overblijft.
- Niet testen. Zonder testset weet je niet hoe vaak het systeem goed zit.
- Geen bronvermelding tonen. Met een bron kan de gebruiker het antwoord controleren. Zonder bron moet hij blind vertrouwen.
- Denken dat RAG fouten uitsluit. Het maakt verzinnen veel minder waarschijnlijk, maar niet onmogelijk. Laat bij belangrijke antwoorden een mens meekijken.
Veelgestelde vragen
Wat is RAG in AI?
RAG staat voor retrieval augmented generation. Een AI-tool zoekt eerst de relevante stukken in je eigen documenten op en schrijft daarna een antwoord op basis van die stukken, met een bronverwijzing.
Wat is het verschil tussen RAG en fine-tunen?
Bij RAG krijgt het model bij elke vraag de juiste informatie mee. Bij fine-tunen pas je het model zelf aan. Voor feiten en documenten is RAG goedkoper, actueler en controleerbaar.
Wordt het taalmodel getraind op mijn documenten?
Nee. Bij RAG blijven je documenten in je eigen database. Het model krijgt alleen de passages die bij een vraag horen. Kies wel een aanbieder of opzet die niet traint op wat je meestuurt.
Welke documenten kun je gebruiken?
Bijna alles met tekst: pdf's, Word-bestanden, webpagina's, kennisbankartikelen, e-mails en tickets. Tabellen en scans vragen extra aandacht bij het inlezen.
Kan een RAG chatbot nog steeds fouten maken?
Ja, minder vaak dan een model zonder bronnen, maar het kan. Bijvoorbeeld als het zoeken het verkeerde stuk vindt. Een testset, bronvermelding en een duidelijke doorverwijzing naar een mens beperken dat.
Verder lezen
Meer uit de kennisbank
Bronnen
Geraadpleegd in september 2026.
- Lewis e.a., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020). arxiv.org