Blog · AI

Lokale LLM voor bedrijven: wat draait, waarop en wanneer het loont

Een lokale LLM is een taalmodel dat op je eigen computer of server draait, zonder dat de tekst bij een externe aanbieder terechtkomt. De dimensionering begint bij het geheugen: ongeveer 0,5 GB per miljard parameters bij 4-bitkwantisatie, plus ruimte voor de context. Het loont als de data gevoelig is en het volume constant, niet als gratis vervanger van ChatGPT.

8minuten leestijd
2026-09-17gepubliceerd
AIcategorie
Towerservers naast elkaar, met brandende statuslampjes
AI
01

Wat een lokale LLM is en waarin die verschilt van ChatGPT

Een lokale LLM is een taalmodel dat op je eigen hardware draait, een laptop, een pc of een server in het bedrijf, in plaats van via internet bij een aanbieder te worden gebruikt. De tekst die je invoert en de antwoorden blijven op die machine. Dat kan omdat steeds meer makers modellen met open gewichten publiceren die iedereen kan downloaden en draaien: OpenAI met gpt-oss, Google met Gemma of Alibaba met Qwen, allemaal onder de ruime licentie Apache 2.0.

Het praktische verschil met ChatGPT of Claude in de browser zit in de verdeling van de verantwoordelijkheden. In de cloud zorgt de aanbieder voor servers, updates en capaciteit, en betaal jij het abonnement of het verbruik. Lokaal heb je volledige controle over de data en het gekozen model, maar ook de zorg voor de hardware, de snelheid en het onderhoud. Open modellen zijn dichter bij sommige commerciële modellen gekomen: volgens OpenAI komt gpt-oss-120b dicht bij o4-mini op de belangrijkste redeneerbenchmarks, maar bij de zwaarste taken hebben de topmodellen uit de cloud doorgaans een voorsprong.

02

Hoeveel geheugen je nodig hebt voor een lokale LLM

De basisregel voor dimensionering is het geheugen, niet de processor. Elke parameter van het model neemt ruimte in: bij FP16-precisie zijn dat twee bytes, dus ongeveer 2 GB geheugen per miljard parameters, en bij 4-bitkwantisatie, de variant die lokaal meestal wordt gebruikt, ongeveer 0,5 GB. Een model met 20 miljard parameters heeft dus zo'n 10 GB nodig voor alleen de gewichten. Het geheugen kan dat van de videokaart zijn of, bij computers met unified memory, het gedeelde geheugen van het systeem.

Bovenop de gewichten komt het geheugen voor de context, de KV-cache, dat groeit met elk token in het gesprek en met elke gebruiker die tegelijk werkt. Daarom kan een model dat ruim past wanneer één persoon het test, zonder geheugen komen te zitten zodra een heel team het gebruikt. Dimensioneringsgidsen raden een reserve van 15-20% aan voor het draaien. Als concrete richtpunten: gpt-oss-20b is een download van 14 GB en draait met 16 GB geheugen, terwijl gpt-oss-120b 65 GB groot is en op één GPU van 80 GB past.

Grootte van het modelGeheugen voor de gewichten, bij 4 bitWaar het draait, indicatief
3-4 miljard parametersongeveer 2 GBgewone laptop, voor tests
12-14 miljardongeveer 6-7 GBpc met een videokaart van 12-16 GB
20-32 miljardongeveer 10-16 GBvideokaart van 24 GB of Mac met minstens 32 GB unified memory
meer dan 100 miljardmeer dan 50 GBserver met een GPU van 80 GB of meerdere kaarten
03

Welke opensourcemodellen je in 2026 lokaal kunt draaien

Het aanbod is het afgelopen jaar sterk veranderd, en de licentie is net zo belangrijk geworden als de prestaties. Apache 2.0, de licentie van gpt-oss, Gemma 4 en Qwen3, staat commercieel gebruik, aanpassing en integratie in producten toe zonder aparte overeenkomst met de maker. Andere modelfamilies hebben eigen licenties, met voorwaarden die je moet lezen voordat je ze in een product of in een dienst voor klanten gebruikt. Het label „open source” in een presentatie betekent niet automatisch dat je alles met het model mag doen.

Voor een bedrijf in Roemenië telt ook de taal. Gemma 4 geeft ondersteuning op voor meer dan 140 talen, en Qwen3 noemt 119 talen en dialecten, waaronder het Roemeens. Dat garandeert niet dezelfde kwaliteit als in het Engels, zeker niet bij juridische, fiscale of technische terminologie. De enige test die telt, is die op je eigen documenten: dezelfde vragen aan meerdere modellen, met antwoorden die worden vergeleken door iemand die weet hoe een correct antwoord in dat vakgebied eruitziet.

  • 01gpt-oss OpenAI, sinds augustus 2025, in de varianten 20b en 120b, licentie Apache 2.0.
  • 02Gemma 4 Google, sinds april 2026, van kleine varianten voor apparaten tot een model met 31 miljard parameters, licentie Apache 2.0.
  • 03Qwen3 Alibaba, sinds april 2025, in meerdere groottes, met opgegeven ondersteuning voor het Roemeens, licentie Apache 2.0.
04

Ollama, LM Studio, llama.cpp of vLLM: waarmee je het model draait

Voor de eerste tests heb je niets ingewikkelds nodig. Ollama, een opensourceproject onder de MIT-licentie, downloadt en draait een model met één opdracht en biedt een API die compatibel is met die van OpenAI, zodat veel bestaande applicaties zonder grote aanpassingen met het lokale model kunnen verbinden. LM Studio doet hetzelfde via een grafische interface en is sinds juli 2025 ook gratis voor gebruik op het werk, zonder aparte licentie. Voor wie geen opdrachtregel wil, is het meestal het eenvoudigste startpunt.

Onder veel van deze applicaties draait llama.cpp, de open-source-engine die het mogelijk maakte om gekwantiseerde modellen op gewone hardware te draaien. Wanneer je van één persoon naar een team gaat, wordt capaciteit het probleem: meerdere gebruikers tegelijk, snelle antwoorden voor iedereen en monitoring. Daar wordt doorgaans vLLM gebruikt, een inferentieserver onder de Apache 2.0-licentie, gebouwd voor veel verzoeken tegelijk. Het verschil tussen een test op een laptop en een systeem dat een team dagelijks gebruikt, zit meer in de infrastructuur dan in het model.

ToolWaar het goed voor isLicentie
OllamaEenvoudig draaien via de opdrachtregel en een lokale API die compatibel is met OpenAIMIT
LM StudioGrafische interface, individuele tests, zonder opdrachtregelGratis app, ook op het werk
llama.cppDe basisengine voor gekwantiseerde modellen op gewone hardwareMIT
vLLMServer voor veel gelijktijdige gebruikersApache 2.0
05

Lokale LLM vs cloud: wat je wint en wat je verliest

De eerlijke vergelijking is niet die tussen een gratis model en een abonnement, maar tussen twee manieren van betalen. In de cloud betaal je per gebruiker of naar het volume verwerkte tekst, en de kosten stijgen met het gebruik. Lokaal betaal je vooraf de hardware en daarna de tijd van de mensen die hem installeren, bijwerken en beveiligen. Bij een laag of onregelmatig volume is de cloud bijna altijd goedkoper. Bij een hoog en constant volume, met gevoelige data, kan de balans doorslaan naar de lokale variant.

Er zijn ook verschillen die niet in de berekening staan. Lokaal verandert het model niet van de ene dag op de andere zonder dat je het weet en werkt het ook zonder internet, maar het krijgt ook niet vanzelf verbeteringen. In de cloud heb je meteen toegang tot de nieuwste modellen, maar de data gaat via de infrastructuur van een ander, ook al is dat contractueel geregeld. Voor veel bedrijven is het realistische antwoord een combinatie: taken met gevoelige data draaien lokaal, en taken zonder risico gaan naar een zorgvuldig gekozen clouddienst.

CriteriumLokale LLMCloud
Waar de data naartoe gaatBlijft op de hardware van het bedrijfGaat via de servers van de aanbieder
Maximale kwaliteitGoed, onder de topmodellenDe nieuwste en grootste modellen
KostenHardware vooraf betaald, plus onderhoudAbonnement of betalen naar verbruik
OnderhoudJouw zorg of die van een partnerZorg van de aanbieder
Zonder internetWerktWerkt niet
06

Wanneer een lokale LLM loont voor een bedrijf en wanneer niet

Een lokale LLM heeft zin wanneer minstens een van de voorwaarden hieronder duidelijk is vervuld, niet alleen in principe. Meestal gaat het om data die door een contract of door de aard ervan niet bij een externe aanbieder mag terechtkomen: klantdossiers, medische gegevens, technische of financiële documentatie. Bij een bedrijf met veel gebruikers en een constant volume wordt de teamversie een private AI-infrastructuur, met een server die is afgestemd op het aantal mensen dat tegelijk werkt.

Het loont niet voor een experiment van een maand, voor een team van een paar mensen dat af en toe AI gebruikt of wanneer niemand in het bedrijf en geen enkele partner zich om het onderhoud bekommert. Een server zonder toezicht, met een verouderd model en haastig ingestelde toegang, schept meer risico's dan hij oplost. Voor een bredere analyse van de self-hosted variant, met de gevolgen voor de AVG en de huidige grenzen, schreven we apart over self-hosted AI voor bedrijven.

  • 01Gevoelige data documenten die niet bij een externe aanbieder mogen terechtkomen.
  • 02Constant volume dagelijks gebruik, groot genoeg om de cloudkosten te laten meetellen.
  • 03Offline werken locaties of processen waar internet niet gegarandeerd is.
  • 04Iemand is verantwoordelijk een persoon of partner die het systeem bijwerkt en beveiligt.
07

Hoe je een lokale LLM in je bedrijf test, stap voor stap

Een eerste test kan in een paar dagen en begint bij een echte taak, niet bij een demo. Kies iets wat het team vaak doet, bijvoorbeeld interne documenten samenvatten of vragen over procedures beantwoorden, en bereid voor de eerste ronde een set documenten zonder gevoelige data voor. Stel dezelfde vragen aan een klein model, een middelgroot model en een clouddienst, en vergelijk daarna de antwoorden, de snelheid en het gebruikte geheugen.

Als de resultaten goed zijn, is de volgende stap geen krachtigere laptop, maar een server voor het team, met toegangscontrole, logging en een veilige manier om in de documenten van het bedrijf te zoeken. Dat betekent meestal een AI-assistent op de bedrijfsdocumenten die met bronvermelding antwoordt en is gebouwd op het model dat in de test is gekozen. Zijn de resultaten in het Roemeens niet goed genoeg voor je taak, dan heb je dat goedkoop ontdekt, vóór elke investering in hardware.

  • 01Kies een echte taak en een set documenten zonder gevoelige data.
  • 02Installeer Ollama of LM Studio op een testcomputer.
  • 03Stel dezelfde vragen aan een klein en een middelgroot model.
  • 04Vergelijk met een clouddienst: kwaliteit in het Roemeens, snelheid, geheugen.
  • 05Beslis op basis van de resultaten of een server voor het team loont.
08

Bronnen en verder lezen.

FAQ

Veelgestelde vragen

Wat is een lokale LLM?

Een lokale LLM is een taalmodel dat wordt gedownload en gedraaid op eigen hardware, een laptop, een pc of een server in het bedrijf. De ingevoerde tekst en de antwoorden komen niet bij een externe aanbieder terecht, maar onderhoud, updates en beveiliging zijn jouw verantwoordelijkheid.

Welke computer heb ik nodig voor een lokale LLM?

Dat hangt af van de grootte van het model. Bij 4-bitkwantisatie neemt een model ongeveer 0,5 GB geheugen in per miljard parameters, plus ruimte voor de context. Een model met 20 miljard parameters draait indicatief op een videokaart van 16-24 GB of op een Mac met voldoende unified memory.

Ollama of LM Studio: welke kies ik?

LM Studio is eenvoudiger als je een grafische interface wilt en zelf op je eigen computer test. Ollama past beter als je het model via een API met andere applicaties wilt verbinden of op een server wilt draaien. Beide kun je gratis op het werk gebruiken.

Is een lokale LLM net zo goed als ChatGPT?

Voor veel alledaagse taken, zoals samenvattingen, classificaties of antwoorden op basis van documenten, leveren de huidige open modellen goede resultaten. Bij complex redeneren en zeer zware taken hebben de topmodellen uit de cloud doorgaans een voorsprong. Het verschil zie je het best door te testen op je eigen taken.

Mag ik een opensourcemodel commercieel gebruiken?

Dat hangt af van de licentie. Modellen onder Apache 2.0, zoals gpt-oss, Gemma 4 en Qwen3, staan commercieel gebruik en aanpassing toe. Andere modellen hebben eigen licenties met voorwaarden, dus lees de licentie voordat je het model in een product of dienst gebruikt.

Begrijpt een lokale LLM Roemeens?

Meerdere open modellen geven ondersteuning voor het Roemeens op: Qwen3 noemt het onder zijn 119 talen en dialecten, en Gemma 4 noemt meer dan 140 talen. De kwaliteit verschilt wel van het Engels, zeker bij vaktermen, dus test het op de documenten van het bedrijf voordat je een beslissing neemt.

The Niche Society
Het team van The Niche SocietyAI- en software-engineers uit Boekarest · LinkedIn
gepubliceerd 2026-09-17

Laten we kijken wat we bij jou kunnen automatiseren.

Een gratis sessie van 30 minuten: we vertellen je wat er te automatiseren valt, hoe lang het duurt en wat het kost, met een vaste prijs na de discovery.

Plan een gratis kennismakingoffice@thenichesociety.ro

We reageren dezelfde werkdag.

+40 733 045 833