In het kort
- Een lokale LLM draait op je eigen hardware. Je gegevens gaan niet naar een externe aanbieder.
- Ollama is de bekendste manier om te beginnen. Eén download, één opdracht, en het model draait.
- Kleine modellen draaien op een goede laptop. Grote modellen vragen een server met veel videogeheugen.
- Lokaal is vooral zinvol voor gevoelige gegevens, vaste taken en veel volume. Voor het zwaarste denkwerk wint de cloud nog.
Wat is een local LLM?
Een LLM, een groot taalmodel, is de techniek achter ChatGPT en Claude. Hoe dat werkt, lees je in wat is een LLM. Meestal gebruik je zo'n model via internet: je tekst gaat naar de servers van de aanbieder, die stuurt een antwoord terug.
Bij een local LLM draait het model op hardware die jij beheert. Dat kan je eigen laptop zijn, een server op kantoor of een server die je huurt bij een Europese hoster. Wie zoekt op local llm, bedoelt meestal dat laatste: AI gebruiken zonder dat gegevens naar een Amerikaanse cloud gaan.
Dat kan omdat steeds meer makers hun modellen openlijk beschikbaar stellen. Je mag de modelbestanden downloaden en zelf draaien. Bekende families zijn:
| Model | Van | Formaten (voorbeelden) |
|---|---|---|
| Llama | Meta | 1B tot 405B |
| Gemma | van 270M tot 31B | |
| Mistral | Mistral AI (Frankrijk) | 7B en groter |
| Qwen | Alibaba | van 0,5B tot 480B |
| gpt-oss | OpenAI | 20B en 120B |
| DeepSeek-R1 | DeepSeek | 1,5B tot 671B |
De B staat voor miljard parameters, grofweg de omvang van het model. Groter is meestal slimmer, maar ook zwaarder om te draaien.
Zo draai je een LLM lokaal met Ollama
Ollama is een gratis programma dat het downloaden en draaien van open modellen eenvoudig maakt. Het werkt op Windows, macOS en Linux.
- Installeer Ollama via de website ollama.com.
- Start een model met één opdracht in de terminal, bijvoorbeeld
ollama run gemma3. Ollama downloadt het model de eerste keer en opent daarna een chat. - Gebruik het in je software. Ollama heeft een API die werkt met programma's die gemaakt zijn voor OpenAI of Anthropic. Zo kun je een lokaal model aansluiten op bijvoorbeeld een n8n-workflow of een eigen chatomgeving.
Alternatieven zijn LM Studio, met een grafische interface, en llama.cpp of vLLM voor wie meer controle of snelheid op een server wil.
Let op één ding. Ollama biedt inmiddels ook cloudmodellen aan, die draaien zonder eigen videokaart. Die draaien dan niet lokaal. Kies je voor lokaal vanwege privacy, controleer dan dat je een model gebruikt dat op je eigen machine staat.
Welke hardware heb je nodig?
Dit is de grootste beperking. Een model moet in het geheugen passen, het liefst in het geheugen van de videokaart. Modellen worden vaak 'gecomprimeerd' aangeboden, dat heet quantisatie. Ze worden dan kleiner en sneller, met een klein verlies aan kwaliteit.
Grove vuistregels, uitgaande van zo'n gecomprimeerd model:
| Modelgrootte | Geschikt voor | Hardware |
|---|---|---|
| 1B tot 4B | Eenvoudige taken, samenvatten, classificeren | Gewone laptop |
| 7B tot 14B | Mail, klantvragen, tekst uit documenten halen | Laptop of pc met een goede videokaart of veel werkgeheugen, of een recente Mac |
| 20B tot 35B | Betere redeneringen, langere documenten | Werkstation met veel videogeheugen of een krachtige Mac |
| 70B en groter | In de buurt van oudere cloudmodellen | Server met meerdere zware videokaarten |
De exacte eisen verschillen per model en per compressie. Test altijd met je eigen taken voordat je hardware koopt.
Wat kost een lokale LLM?
De modellen zelf zijn meestal gratis. De kosten zitten in de hardware, de stroom en het beheer.
- Op je eigen laptop: geen extra kosten, geschikt om te testen.
- Een eigen server met videokaart: een eenmalige investering, plus stroom en onderhoud. Die loopt sterk op naarmate je grotere modellen wilt draaien.
- Een gehuurde GPU-server bij een Europese aanbieder: een vast bedrag per uur of per maand.
- Beheer: installatie, updates, beveiliging en monitoring. Dit is vaak de grootste post.
Vergelijk dat met de cloud. Daar betaal je per token, en bij weinig gebruik is dat vaak goedkoper. Bij veel volume, bijvoorbeeld duizenden documenten per dag, kan een eigen model goedkoper uitvallen. Een vergelijking van cloudprijzen staat in LLM kosten.
Wat is de beste lokale LLM?
Er is niet één beste. Het hangt af van je taak, je taal en je hardware. Een paar richtlijnen:
- Nederlands: test altijd in het Nederlands. Sommige modellen zijn sterk in het Engels, maar zwakker in onze taal. Grotere modellen doen het hier meestal beter.
- Documenten en data: kies een model met een groot contextvenster, zodat het lange teksten in één keer kan lezen.
- Programmeren: er zijn aparte codemodellen, zoals Qwen Coder.
- Zoeken in je eigen documenten: combineer een taalmodel met een embeddingmodel, dat teksten doorzoekbaar maakt.
Nieuwe versies verschijnen elke paar maanden. Een model dat vandaag het beste is, is dat over een half jaar vaak niet meer. Richt je systeem dus zo in dat je makkelijk kunt wisselen.
Wanneer kies je voor lokaal?
Cloud is logischer als
- Je de allerbeste kwaliteit nodig hebt, bijvoorbeeld voor complexe analyses
- Je weinig volume hebt
- Je geen tijd of kennis hebt voor beheer
- De gegevens niet gevoelig zijn, of een zakelijk contract met EU-opslag volstaat
Lokaal is logischer als
- Je werkt met medische, juridische of andere zeer gevoelige gegevens
- Je veel dezelfde taken uitvoert, zoals documenten sorteren of gegevens uitlezen
- Je niet afhankelijk wilt zijn van een Amerikaanse aanbieder
- Je volledige controle wilt over welk model draait en wanneer het verandert
Veelgemaakte fouten
- Verwachten dat een klein model net zo goed is als de cloud. Test met echte taken en vergelijk.
- Eerst hardware kopen. Test eerst op een gehuurde server. Dan weet je welk formaat model je nodig hebt.
- Denken dat lokaal automatisch veilig is. Een server zonder goede toegangscontrole is net zo kwetsbaar. Regel wie erbij kan en leg vast wat er gebeurt.
- Licenties niet lezen. Open modellen hebben verschillende licenties. Controleer of zakelijk gebruik is toegestaan.
- Geen plan voor updates. Modellen en software veranderen snel. Spreek af wie dat bijhoudt.
Wij zetten voor gevoelige gegevens een eigen server of private AI op, met toegangsbeheer, logging en menselijk toezicht. Welk lokaal model en welke hardware gebruikt ShareConnect in de praktijk voor private AI, en mogen we een klantvoorbeeld noemen? Meer over die aanpak lees je bij private AI.
Veelgestelde vragen
Wat is een local LLM?
Een taalmodel dat je op je eigen computer of server draait, in plaats van via een cloudaanbieder. Je downloadt een open model en start het met een programma als Ollama. Je gegevens blijven dan in je eigen omgeving.
Wat is Ollama?
Een gratis programma voor Windows, macOS en Linux waarmee je open taalmodellen downloadt en lokaal draait. Het heeft ook een API, zodat je een lokaal model in je eigen software kunt gebruiken.
Kan ik een LLM op mijn laptop draaien?
Ja, kleinere modellen tot ongeveer 14 miljard parameters draaien op een goede laptop of een recente Mac. Voor grotere modellen heb je een krachtige videokaart of server nodig.
Wat kost een lokale LLM?
De modellen zijn meestal gratis. Je betaalt voor hardware of een gehuurde server, stroom en beheer. Bij weinig gebruik is de cloud vaak goedkoper, bij veel volume kan lokaal goedkoper zijn.
Is een lokale LLM veiliger?
Je gegevens gaan niet naar een externe aanbieder, en dat is een groot voordeel. Maar de server zelf moet ook goed beveiligd zijn, met toegangscontrole, updates en logging.