Wat een lokale LLM is en waarin die verschilt van ChatGPT
Een lokale LLM is een taalmodel dat op je eigen hardware draait, een laptop, een pc of een server in het bedrijf, in plaats van via internet bij een aanbieder te worden gebruikt. De tekst die je invoert en de antwoorden blijven op die machine. Dat kan omdat steeds meer makers modellen met open gewichten publiceren die iedereen kan downloaden en draaien: OpenAI met gpt-oss, Google met Gemma of Alibaba met Qwen, allemaal onder de ruime licentie Apache 2.0.
Het praktische verschil met ChatGPT of Claude in de browser zit in de verdeling van de verantwoordelijkheden. In de cloud zorgt de aanbieder voor servers, updates en capaciteit, en betaal jij het abonnement of het verbruik. Lokaal heb je volledige controle over de data en het gekozen model, maar ook de zorg voor de hardware, de snelheid en het onderhoud. Open modellen zijn dichter bij sommige commerciële modellen gekomen: volgens OpenAI komt gpt-oss-120b dicht bij o4-mini op de belangrijkste redeneerbenchmarks, maar bij de zwaarste taken hebben de topmodellen uit de cloud doorgaans een voorsprong.
Hoeveel geheugen je nodig hebt voor een lokale LLM
De basisregel voor dimensionering is het geheugen, niet de processor. Elke parameter van het model neemt ruimte in: bij FP16-precisie zijn dat twee bytes, dus ongeveer 2 GB geheugen per miljard parameters, en bij 4-bitkwantisatie, de variant die lokaal meestal wordt gebruikt, ongeveer 0,5 GB. Een model met 20 miljard parameters heeft dus zo'n 10 GB nodig voor alleen de gewichten. Het geheugen kan dat van de videokaart zijn of, bij computers met unified memory, het gedeelde geheugen van het systeem.
Bovenop de gewichten komt het geheugen voor de context, de KV-cache, dat groeit met elk token in het gesprek en met elke gebruiker die tegelijk werkt. Daarom kan een model dat ruim past wanneer één persoon het test, zonder geheugen komen te zitten zodra een heel team het gebruikt. Dimensioneringsgidsen raden een reserve van 15-20% aan voor het draaien. Als concrete richtpunten: gpt-oss-20b is een download van 14 GB en draait met 16 GB geheugen, terwijl gpt-oss-120b 65 GB groot is en op één GPU van 80 GB past.
| Grootte van het model | Geheugen voor de gewichten, bij 4 bit | Waar het draait, indicatief |
|---|---|---|
| 3-4 miljard parameters | ongeveer 2 GB | gewone laptop, voor tests |
| 12-14 miljard | ongeveer 6-7 GB | pc met een videokaart van 12-16 GB |
| 20-32 miljard | ongeveer 10-16 GB | videokaart van 24 GB of Mac met minstens 32 GB unified memory |
| meer dan 100 miljard | meer dan 50 GB | server met een GPU van 80 GB of meerdere kaarten |
Welke opensourcemodellen je in 2026 lokaal kunt draaien
Het aanbod is het afgelopen jaar sterk veranderd, en de licentie is net zo belangrijk geworden als de prestaties. Apache 2.0, de licentie van gpt-oss, Gemma 4 en Qwen3, staat commercieel gebruik, aanpassing en integratie in producten toe zonder aparte overeenkomst met de maker. Andere modelfamilies hebben eigen licenties, met voorwaarden die je moet lezen voordat je ze in een product of in een dienst voor klanten gebruikt. Het label „open source” in een presentatie betekent niet automatisch dat je alles met het model mag doen.
Voor een bedrijf in Roemenië telt ook de taal. Gemma 4 geeft ondersteuning op voor meer dan 140 talen, en Qwen3 noemt 119 talen en dialecten, waaronder het Roemeens. Dat garandeert niet dezelfde kwaliteit als in het Engels, zeker niet bij juridische, fiscale of technische terminologie. De enige test die telt, is die op je eigen documenten: dezelfde vragen aan meerdere modellen, met antwoorden die worden vergeleken door iemand die weet hoe een correct antwoord in dat vakgebied eruitziet.
- 01gpt-oss OpenAI, sinds augustus 2025, in de varianten 20b en 120b, licentie Apache 2.0.
- 02Gemma 4 Google, sinds april 2026, van kleine varianten voor apparaten tot een model met 31 miljard parameters, licentie Apache 2.0.
- 03Qwen3 Alibaba, sinds april 2025, in meerdere groottes, met opgegeven ondersteuning voor het Roemeens, licentie Apache 2.0.
Ollama, LM Studio, llama.cpp of vLLM: waarmee je het model draait
Voor de eerste tests heb je niets ingewikkelds nodig. Ollama, een opensourceproject onder de MIT-licentie, downloadt en draait een model met één opdracht en biedt een API die compatibel is met die van OpenAI, zodat veel bestaande applicaties zonder grote aanpassingen met het lokale model kunnen verbinden. LM Studio doet hetzelfde via een grafische interface en is sinds juli 2025 ook gratis voor gebruik op het werk, zonder aparte licentie. Voor wie geen opdrachtregel wil, is het meestal het eenvoudigste startpunt.
Onder veel van deze applicaties draait llama.cpp, de open-source-engine die het mogelijk maakte om gekwantiseerde modellen op gewone hardware te draaien. Wanneer je van één persoon naar een team gaat, wordt capaciteit het probleem: meerdere gebruikers tegelijk, snelle antwoorden voor iedereen en monitoring. Daar wordt doorgaans vLLM gebruikt, een inferentieserver onder de Apache 2.0-licentie, gebouwd voor veel verzoeken tegelijk. Het verschil tussen een test op een laptop en een systeem dat een team dagelijks gebruikt, zit meer in de infrastructuur dan in het model.
| Tool | Waar het goed voor is | Licentie |
|---|---|---|
| Ollama | Eenvoudig draaien via de opdrachtregel en een lokale API die compatibel is met OpenAI | MIT |
| LM Studio | Grafische interface, individuele tests, zonder opdrachtregel | Gratis app, ook op het werk |
| llama.cpp | De basisengine voor gekwantiseerde modellen op gewone hardware | MIT |
| vLLM | Server voor veel gelijktijdige gebruikers | Apache 2.0 |
Lokale LLM vs cloud: wat je wint en wat je verliest
De eerlijke vergelijking is niet die tussen een gratis model en een abonnement, maar tussen twee manieren van betalen. In de cloud betaal je per gebruiker of naar het volume verwerkte tekst, en de kosten stijgen met het gebruik. Lokaal betaal je vooraf de hardware en daarna de tijd van de mensen die hem installeren, bijwerken en beveiligen. Bij een laag of onregelmatig volume is de cloud bijna altijd goedkoper. Bij een hoog en constant volume, met gevoelige data, kan de balans doorslaan naar de lokale variant.
Er zijn ook verschillen die niet in de berekening staan. Lokaal verandert het model niet van de ene dag op de andere zonder dat je het weet en werkt het ook zonder internet, maar het krijgt ook niet vanzelf verbeteringen. In de cloud heb je meteen toegang tot de nieuwste modellen, maar de data gaat via de infrastructuur van een ander, ook al is dat contractueel geregeld. Voor veel bedrijven is het realistische antwoord een combinatie: taken met gevoelige data draaien lokaal, en taken zonder risico gaan naar een zorgvuldig gekozen clouddienst.
| Criterium | Lokale LLM | Cloud |
|---|---|---|
| Waar de data naartoe gaat | Blijft op de hardware van het bedrijf | Gaat via de servers van de aanbieder |
| Maximale kwaliteit | Goed, onder de topmodellen | De nieuwste en grootste modellen |
| Kosten | Hardware vooraf betaald, plus onderhoud | Abonnement of betalen naar verbruik |
| Onderhoud | Jouw zorg of die van een partner | Zorg van de aanbieder |
| Zonder internet | Werkt | Werkt niet |
Wanneer een lokale LLM loont voor een bedrijf en wanneer niet
Een lokale LLM heeft zin wanneer minstens een van de voorwaarden hieronder duidelijk is vervuld, niet alleen in principe. Meestal gaat het om data die door een contract of door de aard ervan niet bij een externe aanbieder mag terechtkomen: klantdossiers, medische gegevens, technische of financiële documentatie. Bij een bedrijf met veel gebruikers en een constant volume wordt de teamversie een private AI-infrastructuur, met een server die is afgestemd op het aantal mensen dat tegelijk werkt.
Het loont niet voor een experiment van een maand, voor een team van een paar mensen dat af en toe AI gebruikt of wanneer niemand in het bedrijf en geen enkele partner zich om het onderhoud bekommert. Een server zonder toezicht, met een verouderd model en haastig ingestelde toegang, schept meer risico's dan hij oplost. Voor een bredere analyse van de self-hosted variant, met de gevolgen voor de AVG en de huidige grenzen, schreven we apart over self-hosted AI voor bedrijven.
- 01Gevoelige data documenten die niet bij een externe aanbieder mogen terechtkomen.
- 02Constant volume dagelijks gebruik, groot genoeg om de cloudkosten te laten meetellen.
- 03Offline werken locaties of processen waar internet niet gegarandeerd is.
- 04Iemand is verantwoordelijk een persoon of partner die het systeem bijwerkt en beveiligt.
Hoe je een lokale LLM in je bedrijf test, stap voor stap
Een eerste test kan in een paar dagen en begint bij een echte taak, niet bij een demo. Kies iets wat het team vaak doet, bijvoorbeeld interne documenten samenvatten of vragen over procedures beantwoorden, en bereid voor de eerste ronde een set documenten zonder gevoelige data voor. Stel dezelfde vragen aan een klein model, een middelgroot model en een clouddienst, en vergelijk daarna de antwoorden, de snelheid en het gebruikte geheugen.
Als de resultaten goed zijn, is de volgende stap geen krachtigere laptop, maar een server voor het team, met toegangscontrole, logging en een veilige manier om in de documenten van het bedrijf te zoeken. Dat betekent meestal een AI-assistent op de bedrijfsdocumenten die met bronvermelding antwoordt en is gebouwd op het model dat in de test is gekozen. Zijn de resultaten in het Roemeens niet goed genoeg voor je taak, dan heb je dat goedkoop ontdekt, vóór elke investering in hardware.
- 01Kies een echte taak en een set documenten zonder gevoelige data.
- 02Installeer Ollama of LM Studio op een testcomputer.
- 03Stel dezelfde vragen aan een klein en een middelgroot model.
- 04Vergelijk met een clouddienst: kwaliteit in het Roemeens, snelheid, geheugen.
- 05Beslis op basis van de resultaten of een server voor het team loont.
Bronnen en verder lezen.
Veelgestelde vragen
Wat is een lokale LLM?
Een lokale LLM is een taalmodel dat wordt gedownload en gedraaid op eigen hardware, een laptop, een pc of een server in het bedrijf. De ingevoerde tekst en de antwoorden komen niet bij een externe aanbieder terecht, maar onderhoud, updates en beveiliging zijn jouw verantwoordelijkheid.
Welke computer heb ik nodig voor een lokale LLM?
Dat hangt af van de grootte van het model. Bij 4-bitkwantisatie neemt een model ongeveer 0,5 GB geheugen in per miljard parameters, plus ruimte voor de context. Een model met 20 miljard parameters draait indicatief op een videokaart van 16-24 GB of op een Mac met voldoende unified memory.
Ollama of LM Studio: welke kies ik?
LM Studio is eenvoudiger als je een grafische interface wilt en zelf op je eigen computer test. Ollama past beter als je het model via een API met andere applicaties wilt verbinden of op een server wilt draaien. Beide kun je gratis op het werk gebruiken.
Is een lokale LLM net zo goed als ChatGPT?
Voor veel alledaagse taken, zoals samenvattingen, classificaties of antwoorden op basis van documenten, leveren de huidige open modellen goede resultaten. Bij complex redeneren en zeer zware taken hebben de topmodellen uit de cloud doorgaans een voorsprong. Het verschil zie je het best door te testen op je eigen taken.
Mag ik een opensourcemodel commercieel gebruiken?
Dat hangt af van de licentie. Modellen onder Apache 2.0, zoals gpt-oss, Gemma 4 en Qwen3, staan commercieel gebruik en aanpassing toe. Andere modellen hebben eigen licenties met voorwaarden, dus lees de licentie voordat je het model in een product of dienst gebruikt.
Begrijpt een lokale LLM Roemeens?
Meerdere open modellen geven ondersteuning voor het Roemeens op: Qwen3 noemt het onder zijn 119 talen en dialecten, en Gemma 4 noemt meer dan 140 talen. De kwaliteit verschilt wel van het Engels, zeker bij vaktermen, dus test het op de documenten van het bedrijf voordat je een beslissing neemt.

Laten we kijken wat we bij jou kunnen automatiseren.
Een gratis sessie van 30 minuten: we vertellen je wat er te automatiseren valt, hoe lang het duurt en wat het kost, met een vaste prijs na de discovery.
