Ga naar de inhoud

Private AI

Een LLM lokaal draaien: zo werkt het

Een local LLM is een taalmodel dat je op je eigen computer of server draait, in plaats van bij OpenAI, Anthropic of Google. Je downloadt een open model, zoals Llama, Mistral, Gemma, Qwen of gpt-oss, en start het met een programma als Ollama. Je teksten verlaten je eigen omgeving dan niet. Het nadeel: de beste lokale modellen zijn minder sterk dan de grote cloudmodellen, en je hebt geschikte hardware nodig.

In het kort

  • Een lokale LLM draait op je eigen hardware. Je gegevens gaan niet naar een externe aanbieder.
  • Ollama is de bekendste manier om te beginnen. Eén download, één opdracht, en het model draait.
  • Kleine modellen draaien op een goede laptop. Grote modellen vragen een server met veel videogeheugen.
  • Lokaal is vooral zinvol voor gevoelige gegevens, vaste taken en veel volume. Voor het zwaarste denkwerk wint de cloud nog.

Wat is een local LLM?

Een LLM, een groot taalmodel, is de techniek achter ChatGPT en Claude. Hoe dat werkt, lees je in wat is een LLM. Meestal gebruik je zo'n model via internet: je tekst gaat naar de servers van de aanbieder, die stuurt een antwoord terug.

Bij een local LLM draait het model op hardware die jij beheert. Dat kan je eigen laptop zijn, een server op kantoor of een server die je huurt bij een Europese hoster. Wie zoekt op local llm, bedoelt meestal dat laatste: AI gebruiken zonder dat gegevens naar een Amerikaanse cloud gaan.

Dat kan omdat steeds meer makers hun modellen openlijk beschikbaar stellen. Je mag de modelbestanden downloaden en zelf draaien. Bekende families zijn:

ModelVanFormaten (voorbeelden)
LlamaMeta1B tot 405B
GemmaGooglevan 270M tot 31B
MistralMistral AI (Frankrijk)7B en groter
QwenAlibabavan 0,5B tot 480B
gpt-ossOpenAI20B en 120B
DeepSeek-R1DeepSeek1,5B tot 671B

De B staat voor miljard parameters, grofweg de omvang van het model. Groter is meestal slimmer, maar ook zwaarder om te draaien.

Zo draai je een LLM lokaal met Ollama

Ollama is een gratis programma dat het downloaden en draaien van open modellen eenvoudig maakt. Het werkt op Windows, macOS en Linux.

  1. Installeer Ollama via de website ollama.com.
  2. Start een model met één opdracht in de terminal, bijvoorbeeld ollama run gemma3. Ollama downloadt het model de eerste keer en opent daarna een chat.
  3. Gebruik het in je software. Ollama heeft een API die werkt met programma's die gemaakt zijn voor OpenAI of Anthropic. Zo kun je een lokaal model aansluiten op bijvoorbeeld een n8n-workflow of een eigen chatomgeving.

Alternatieven zijn LM Studio, met een grafische interface, en llama.cpp of vLLM voor wie meer controle of snelheid op een server wil.

Let op één ding. Ollama biedt inmiddels ook cloudmodellen aan, die draaien zonder eigen videokaart. Die draaien dan niet lokaal. Kies je voor lokaal vanwege privacy, controleer dan dat je een model gebruikt dat op je eigen machine staat.

Welke hardware heb je nodig?

Dit is de grootste beperking. Een model moet in het geheugen passen, het liefst in het geheugen van de videokaart. Modellen worden vaak 'gecomprimeerd' aangeboden, dat heet quantisatie. Ze worden dan kleiner en sneller, met een klein verlies aan kwaliteit.

Grove vuistregels, uitgaande van zo'n gecomprimeerd model:

ModelgrootteGeschikt voorHardware
1B tot 4BEenvoudige taken, samenvatten, classificerenGewone laptop
7B tot 14BMail, klantvragen, tekst uit documenten halenLaptop of pc met een goede videokaart of veel werkgeheugen, of een recente Mac
20B tot 35BBetere redeneringen, langere documentenWerkstation met veel videogeheugen of een krachtige Mac
70B en groterIn de buurt van oudere cloudmodellenServer met meerdere zware videokaarten

De exacte eisen verschillen per model en per compressie. Test altijd met je eigen taken voordat je hardware koopt.

Wat kost een lokale LLM?

De modellen zelf zijn meestal gratis. De kosten zitten in de hardware, de stroom en het beheer.

Vergelijk dat met de cloud. Daar betaal je per token, en bij weinig gebruik is dat vaak goedkoper. Bij veel volume, bijvoorbeeld duizenden documenten per dag, kan een eigen model goedkoper uitvallen. Een vergelijking van cloudprijzen staat in LLM kosten.

Wat is de beste lokale LLM?

Er is niet één beste. Het hangt af van je taak, je taal en je hardware. Een paar richtlijnen:

Nieuwe versies verschijnen elke paar maanden. Een model dat vandaag het beste is, is dat over een half jaar vaak niet meer. Richt je systeem dus zo in dat je makkelijk kunt wisselen.

Wanneer kies je voor lokaal?

Cloud is logischer als

  • Je de allerbeste kwaliteit nodig hebt, bijvoorbeeld voor complexe analyses
  • Je weinig volume hebt
  • Je geen tijd of kennis hebt voor beheer
  • De gegevens niet gevoelig zijn, of een zakelijk contract met EU-opslag volstaat

Lokaal is logischer als

  • Je werkt met medische, juridische of andere zeer gevoelige gegevens
  • Je veel dezelfde taken uitvoert, zoals documenten sorteren of gegevens uitlezen
  • Je niet afhankelijk wilt zijn van een Amerikaanse aanbieder
  • Je volledige controle wilt over welk model draait en wanneer het verandert

Veelgemaakte fouten

Wij zetten voor gevoelige gegevens een eigen server of private AI op, met toegangsbeheer, logging en menselijk toezicht. Welk lokaal model en welke hardware gebruikt ShareConnect in de praktijk voor private AI, en mogen we een klantvoorbeeld noemen? Meer over die aanpak lees je bij private AI.

Veelgestelde vragen

Wat is een local LLM?

Een taalmodel dat je op je eigen computer of server draait, in plaats van via een cloudaanbieder. Je downloadt een open model en start het met een programma als Ollama. Je gegevens blijven dan in je eigen omgeving.

Wat is Ollama?

Een gratis programma voor Windows, macOS en Linux waarmee je open taalmodellen downloadt en lokaal draait. Het heeft ook een API, zodat je een lokaal model in je eigen software kunt gebruiken.

Kan ik een LLM op mijn laptop draaien?

Ja, kleinere modellen tot ongeveer 14 miljard parameters draaien op een goede laptop of een recente Mac. Voor grotere modellen heb je een krachtige videokaart of server nodig.

Wat kost een lokale LLM?

De modellen zijn meestal gratis. Je betaalt voor hardware of een gehuurde server, stroom en beheer. Bij weinig gebruik is de cloud vaak goedkoper, bij veel volume kan lokaal goedkoper zijn.

Is een lokale LLM veiliger?

Je gegevens gaan niet naar een externe aanbieder, en dat is een groot voordeel. Maar de server zelf moet ook goed beveiligd zijn, met toegangscontrole, updates en logging.

Verder lezen

Meer uit de kennisbank

Bronnen

Geraadpleegd in september 2026.

  1. Ollama, Library. ollama.com
  2. Ollama Docs. docs.ollama.com
Terug naar de kennisbank

Wil je AI gebruiken zonder dat je gegevens de deur uit gaan?

We testen welk model past bij jouw taken en zetten het op een eigen of Europese server, met toegangsbeheer en logging.

1 open vraag