Wat betekent self-hosted AI-infrastructuur voor een bedrijf
Een self-hosted AI-infrastructuur betekent dat het taalmodel draait op servers die het bedrijf beheert, of op een dedicated GPU bij een provider in de EU — niet in een Amerikaanse publieke API waar je, aanvraag na aanvraag, contracten, toegangscodes of klantgegevens naartoe stuurt. Het verschil is niet cosmetisch: de data verlaat de vastgestelde perimeter dan nooit meer.
We hebben het niet alleen over „een model draaien". Een privé AI-platform betekent een interface voor medewerkers, rolgebaseerde rechten, koppeling met interne documenten en systemen, auditlogs en monitoring — alles wat ontbreekt in een generiek AI-chatabonnement.
Van tientallen losse chats op Amerikaanse servers naar agents die in de systemen van het bedrijf werken, op een open-source model dat draait op GPU's in de Europese Unie. Video in het Engels.
Het platform is niet alleen een model: interface, RAG, agents, audit
Een privé LLM lost, op zichzelf, niets op voor een bedrijf. De waarde ontstaat pas wanneer het model gekoppeld is aan een interface die medewerkers ook echt gebruiken, aan de documenten van het bedrijf en, waar dat zinvol is, aan de bestaande operationele systemen.
We bouwen elke component als onderdeel van hetzelfde platform, niet als losse tools die handmatig aan elkaar zijn gekoppeld. Het onderdeel dat het platform elke dag bruikbaar maakt, de koppeling van agents aan je ERP via MCP-servers, heeft een aparte pagina.
Interface met rollen, rechten en SSO
Elke medewerker logt in met het bedrijfsaccount; wat iemand kan zien en opvragen hangt af van de rol, niet van gezond verstand.
Zoeken in bedrijfsdocumenten
De antwoorden komen uit de interne procedures, contracten en rapporten, niet uit het algemene geheugen van het model.
Connectors via API of op maat gebouwde MCP
Agents die bestaande systemen lezen en er, met expliciete goedkeuring, in schrijven — ERP, CRM, SAGA, SAP.
Gebruiks- en toegangslogs
Wie wat heeft gevraagd, wat het model heeft geantwoord — intern zichtbaar, niet verborgen achter een externe API.
Evaluatiesets per gebruikscase
We meten de nauwkeurigheid op de echte data van je bedrijf, niet op een generieke publieke benchmark.
Hoe groot moet een AI-server eigenlijk zijn
De dimensionering gebeurt niet op basis van „het grootste beschikbare model", maar op basis van de gebruikscase: hoeveel medewerkers het systeem tegelijk gebruiken, hoe lang de verwerkte context is (hele documenten of korte vragen) en welke omvang en quantisatie het gekozen model heeft — deze variabelen bepalen het benodigde videogeheugen.
Een heel groot MoE-model (mixture-of-experts) kan zelfs gequantiseerd honderden GB videogeheugen vragen; een model van 20-30 miljard parameters draait daarentegen probleemloos op een enkele GPU met veel geheugen. Voor de meeste interne processen is de tweede optie de juiste — niet het grootste model, maar het model dat bij de taak past. Voor een eerste test op één computer hebben we apart beschreven hoe je een lokale LLM draait en hoeveel geheugen die nodig heeft.
Privé LLM: on-premise bij jou of op een dedicated GPU in de EU
Er zijn twee manieren om een privé LLM te draaien, niet maar één. Op eigen servers (on-premise) beheert het bedrijf de infrastructuur fysiek — een geschikte optie waar het interne of contractuele beleid dit expliciet vereist. Op een dedicated GPU bij een provider in de Europese Unie koopt het bedrijf geen hardware, maar de data verlaat de EU nog steeds niet en komt niet terecht bij een Amerikaanse provider.
De keuze hangt ook af van de dataresidentie die de AVG vereist, van de transparantieverplichtingen uit de AI Act en, voor gereguleerde sectoren, van de NIS2-vereisten — feitelijke onderwerpen om op tafel te leggen met de juridische afdeling van je bedrijf, geen terrein waarop wij juridisch advies geven. Lopen de termen door elkaar in de interne gesprekken, dan hebben we apart uitgelegd het verschil tussen self-hosted AI en soevereine AI. Op dezelfde infrastructuur kan een AI-assistent op de bedrijfsdocumenten draaien, met antwoorden die de bron vermelden.
Self-hosted of API: waar ligt de rendabiliteitsdrempel
Er bestaat geen universeel antwoord. Bij weinig gebruikers en pieksgewijs verkeer is betalen per token bij een gehoste API vrijwel zeker goedkoper dan je eigen server onderhouden — de infrastructuur zou buiten de piekmomenten grotendeels stilstaan.
Bij enkele tientallen dagelijkse gebruikers, constant verkeer en gevoelige data begint self-hosted te winnen — zowel op kosten bij groot volume als op controle over de data. De exacte drempel hangt af van het aantal gebruikers en van het echte volume aan aanvragen; we berekenen die tijdens de discovery, op basis van de cijfers van het bedrijf, niet uit een generieke tabel.
Self-hosted of API? 5 vragen voordat je beslist
Vink aan wat op jou van toepassing is.
Vink de punten hierboven aan.
Van discovery tot infrastructuur overgedragen aan het bedrijf
We beginnen met discovery: gebruikscases, welke data er is en hoe schoon die is, beveiligingseisen, een dimensioneringsinschatting. Daarna volgt een pilot op één afdeling, met vooraf geschreven acceptatiecriteria — net als bij elke serieuze AI-implementatie.
Na de pilot breiden we uit naar productie met actieve monitoring en dragen we uiteindelijk de code en infrastructuur over aan het bedrijf. Ze blijven van jullie — we exploiteren geen gesloten platform waar je eindeloos van afhankelijk blijft.
Vaste prijs, na een korte discovery.
- audit van gebruikscases en data
- beveiligings- en compliance-eisen
- dimensioneringsadvies
- modelkeuze + runtime (vLLM/SGLang)
- RAG op de documenten van de afdeling
- geschreven acceptatiecriteria
- uitbreiding naar meerdere afdelingen
- monitoring en auditlogs
- overdracht code + infrastructuur
Elk project heeft een andere context, andere processen en een andere infrastructuur, dus de prijs wordt vastgesteld na een korte, betaalde discovery en verandert daarna niet meer.
Veelgestelde vragen
Hoe groot moet de server zijn?
Dat hangt af van drie dingen: hoeveel medewerkers het model tegelijk gebruiken, hoe lang de verwerkte context is en welk model je kiest. Een heel groot MoE-model kan zelfs gequantiseerd honderden GB videogeheugen vragen; een model van 20-30 miljard parameters draait daarentegen op een enkele GPU met veel geheugen — de juiste variant voor de meeste interne processen. De exacte dimensionering gebeurt tijdens de discovery, op basis van jouw gebruikscase.
Kan ik lokale AI gebruiken met de data uit ons ERP?
Ja — de agents verbinden met je ERP/CRM via API of via op maat gebouwde MCP-connectors, lezen de benodigde data en kunnen, met expliciete goedkeuring, terugschrijven naar het systeem. Het hele proces blijft op de gekozen self-hosted of EU-infrastructuur, zonder dat de data uit je ERP via een externe API loopt.
Is het goedkoper dan ChatGPT Team/Enterprise?
Daar bestaat geen universeel antwoord op. Bij weinig gebruikers en pieksgewijs verkeer blijft een abonnement of betalen per token meestal goedkoper. Bij enkele tientallen dagelijkse gebruikers, constant verkeer en gevoelige data begint self-hosted te winnen — de exacte drempel hangt af van het aantal gebruikers en het volume aan aanvragen, en wordt berekend tijdens de discovery, niet uit een generieke prijstabel.
Welk open-source model kiezen we?
Dat hangt af van de taak, de taal en de geaccepteerde latentie — er bestaat geen universeel beste model. We werken met open-weight modelfamilies zoals Qwen, DeepSeek, GLM, Gemma of Mistral, geserveerd via productie-engines zoals vLLM of SGLang, en kiezen de juiste variant tijdens de discovery, op basis van tests op jouw echte case.
Blijft de data in Roemenië/de EU?
Ja — het platform draait ofwel op de servers van het bedrijf (on-premise, fysiek waar het bedrijf zich bevindt), ofwel op een dedicated GPU bij een provider in de Europese Unie. De data verlaat de vastgestelde perimeter niet, niet naar een externe API en niet buiten de EU — relevant voor de dataresidentie die de AVG vereist en voor NIS2 in gereguleerde sectoren.
Waar kan een AI-server voor een bedrijf in Roemenië draaien?
Op de eigen servers van het bedrijf, on-premise, of op dedicated GPU's die worden gehuurd bij een aanbieder in de Europese Unie. Welke variant past, hangt af van hoeveel medewerkers hem tegelijk gebruiken, hoe gevoelig de data is en wie de infrastructuur beheert; de dimensionering gebeurt in de discovery, op basis van de cijfers van het bedrijf.

Laten we kijken wat we bij jou kunnen automatiseren.
Een gratis sessie van 30 minuten: we vertellen je wat er te automatiseren valt, hoe lang het duurt en wat het kost, met een vaste prijs na de discovery.
