AI-INFRASTRUCTUUR

AI-infrastructuur privé: on‑premise of in de EU-cloud

Een externe API is snel opgestart, maar contracten, toegangscodes en klantgegevens komen op servers buiten het bedrijf terecht. We bouwen AI-platforms die on-premise draaien of op een dedicated GPU in de EU, met de data binnen de perimeter die het bedrijf zelf vastlegt.

EUde infrastructuur draait binnen de perimeter van het bedrijf of op een dedicated GPU in de Europese Unie, niet op een Amerikaanse API
open-weightmodelfamilies met open gewichten (Qwen, DeepSeek, GLM, Gemma, Mistral), geen gesloten model in een API
van het bedrijfde code en infrastructuur blijven bij overdracht eigendom van de klant, niet van de leverancier
AI-INFRASTRUCTUUR
AI-INFRASTRUCTUUR
01

Wat betekent self-hosted AI-infrastructuur voor een bedrijf

Een self-hosted AI-infrastructuur betekent dat het taalmodel draait op servers die het bedrijf beheert, of op een dedicated GPU bij een provider in de EU — niet in een Amerikaanse publieke API waar je, aanvraag na aanvraag, contracten, toegangscodes of klantgegevens naartoe stuurt. Het verschil is niet cosmetisch: de data verlaat de vastgestelde perimeter dan nooit meer.

We hebben het niet alleen over „een model draaien". Een privé AI-platform betekent een interface voor medewerkers, rolgebaseerde rechten, koppeling met interne documenten en systemen, auditlogs en monitoring — alles wat ontbreekt in een generiek AI-chatabonnement.

Private AI-infrastructuur, uitgelegd in tweeënhalve minuut
Van tientallen losse chats op Amerikaanse servers naar agents die in de systemen van het bedrijf werken, op een open-source model dat draait op GPU's in de Europese Unie. Video in het Engels.
02

Het platform is niet alleen een model: interface, RAG, agents, audit

Een privé LLM lost, op zichzelf, niets op voor een bedrijf. De waarde ontstaat pas wanneer het model gekoppeld is aan een interface die medewerkers ook echt gebruiken, aan de documenten van het bedrijf en, waar dat zinvol is, aan de bestaande operationele systemen.

We bouwen elke component als onderdeel van hetzelfde platform, niet als losse tools die handmatig aan elkaar zijn gekoppeld. Het onderdeel dat het platform elke dag bruikbaar maakt, de koppeling van agents aan je ERP via MCP-servers, heeft een aparte pagina.

INTERNE CHAT

Interface met rollen, rechten en SSO

Elke medewerker logt in met het bedrijfsaccount; wat iemand kan zien en opvragen hangt af van de rol, niet van gezond verstand.

RAG

Zoeken in bedrijfsdocumenten

De antwoorden komen uit de interne procedures, contracten en rapporten, niet uit het algemene geheugen van het model.

AGENTS + ERP/CRM

Connectors via API of op maat gebouwde MCP

Agents die bestaande systemen lezen en er, met expliciete goedkeuring, in schrijven — ERP, CRM, SAGA, SAP.

AUDIT & MONITORING

Gebruiks- en toegangslogs

Wie wat heeft gevraagd, wat het model heeft geantwoord — intern zichtbaar, niet verborgen achter een externe API.

EVALUATIE

Evaluatiesets per gebruikscase

We meten de nauwkeurigheid op de echte data van je bedrijf, niet op een generieke publieke benchmark.

03

Hoe groot moet een AI-server eigenlijk zijn

De dimensionering gebeurt niet op basis van „het grootste beschikbare model", maar op basis van de gebruikscase: hoeveel medewerkers het systeem tegelijk gebruiken, hoe lang de verwerkte context is (hele documenten of korte vragen) en welke omvang en quantisatie het gekozen model heeft — deze variabelen bepalen het benodigde videogeheugen.

Een heel groot MoE-model (mixture-of-experts) kan zelfs gequantiseerd honderden GB videogeheugen vragen; een model van 20-30 miljard parameters draait daarentegen probleemloos op een enkele GPU met veel geheugen. Voor de meeste interne processen is de tweede optie de juiste — niet het grootste model, maar het model dat bij de taak past. Voor een eerste test op één computer hebben we apart beschreven hoe je een lokale LLM draait en hoeveel geheugen die nodig heeft.

04

Privé LLM: on-premise bij jou of op een dedicated GPU in de EU

Er zijn twee manieren om een privé LLM te draaien, niet maar één. Op eigen servers (on-premise) beheert het bedrijf de infrastructuur fysiek — een geschikte optie waar het interne of contractuele beleid dit expliciet vereist. Op een dedicated GPU bij een provider in de Europese Unie koopt het bedrijf geen hardware, maar de data verlaat de EU nog steeds niet en komt niet terecht bij een Amerikaanse provider.

De keuze hangt ook af van de dataresidentie die de AVG vereist, van de transparantieverplichtingen uit de AI Act en, voor gereguleerde sectoren, van de NIS2-vereisten — feitelijke onderwerpen om op tafel te leggen met de juridische afdeling van je bedrijf, geen terrein waarop wij juridisch advies geven. Lopen de termen door elkaar in de interne gesprekken, dan hebben we apart uitgelegd het verschil tussen self-hosted AI en soevereine AI. Op dezelfde infrastructuur kan een AI-assistent op de bedrijfsdocumenten draaien, met antwoorden die de bron vermelden.

05

Self-hosted of API: waar ligt de rendabiliteitsdrempel

Er bestaat geen universeel antwoord. Bij weinig gebruikers en pieksgewijs verkeer is betalen per token bij een gehoste API vrijwel zeker goedkoper dan je eigen server onderhouden — de infrastructuur zou buiten de piekmomenten grotendeels stilstaan.

Bij enkele tientallen dagelijkse gebruikers, constant verkeer en gevoelige data begint self-hosted te winnen — zowel op kosten bij groot volume als op controle over de data. De exacte drempel hangt af van het aantal gebruikers en van het echte volume aan aanvragen; we berekenen die tijdens de discovery, op basis van de cijfers van het bedrijf, niet uit een generieke tabel.

Self-hosted of API? 5 vragen voordat je beslist

Vink aan wat op jou van toepassing is.

0 van 5

Vink de punten hierboven aan.

06

Van discovery tot infrastructuur overgedragen aan het bedrijf

We beginnen met discovery: gebruikscases, welke data er is en hoe schoon die is, beveiligingseisen, een dimensioneringsinschatting. Daarna volgt een pilot op één afdeling, met vooraf geschreven acceptatiecriteria — net als bij elke serieuze AI-implementatie.

Na de pilot breiden we uit naar productie met actieve monitoring en dragen we uiteindelijk de code en infrastructuur over aan het bedrijf. Ze blijven van jullie — we exploiteren geen gesloten platform waar je eindeloos van afhankelijk blijft.

07

Vaste prijs, na een korte discovery.

Discovery AI-infrastructuur
op aanvraag · na discoveryEén dag analyse: gebruikscases, beschikbare data, beveiligingseisen en een dimensioneringsinschatting
  • audit van gebruikscases en data
  • beveiligings- en compliance-eisen
  • dimensioneringsadvies
Pilot op één afdeling
op aanvraag · na discoveryHet gekozen model draait op één afdeling, op on-premise of EU-infrastructuur, met vooraf geschreven acceptatiecriteria
  • modelkeuze + runtime (vLLM/SGLang)
  • RAG op de documenten van de afdeling
  • geschreven acceptatiecriteria
Rollout + overdracht
op aanvraag · na discoveryWe breiden uit naar meerdere afdelingen met gebruiksmonitoring, en dragen daarna de code en infrastructuur over aan het bedrijf
  • uitbreiding naar meerdere afdelingen
  • monitoring en auditlogs
  • overdracht code + infrastructuur

Elk project heeft een andere context, andere processen en een andere infrastructuur, dus de prijs wordt vastgesteld na een korte, betaalde discovery en verandert daarna niet meer.

FAQ

Veelgestelde vragen

Hoe groot moet de server zijn?

Dat hangt af van drie dingen: hoeveel medewerkers het model tegelijk gebruiken, hoe lang de verwerkte context is en welk model je kiest. Een heel groot MoE-model kan zelfs gequantiseerd honderden GB videogeheugen vragen; een model van 20-30 miljard parameters draait daarentegen op een enkele GPU met veel geheugen — de juiste variant voor de meeste interne processen. De exacte dimensionering gebeurt tijdens de discovery, op basis van jouw gebruikscase.

Kan ik lokale AI gebruiken met de data uit ons ERP?

Ja — de agents verbinden met je ERP/CRM via API of via op maat gebouwde MCP-connectors, lezen de benodigde data en kunnen, met expliciete goedkeuring, terugschrijven naar het systeem. Het hele proces blijft op de gekozen self-hosted of EU-infrastructuur, zonder dat de data uit je ERP via een externe API loopt.

Is het goedkoper dan ChatGPT Team/Enterprise?

Daar bestaat geen universeel antwoord op. Bij weinig gebruikers en pieksgewijs verkeer blijft een abonnement of betalen per token meestal goedkoper. Bij enkele tientallen dagelijkse gebruikers, constant verkeer en gevoelige data begint self-hosted te winnen — de exacte drempel hangt af van het aantal gebruikers en het volume aan aanvragen, en wordt berekend tijdens de discovery, niet uit een generieke prijstabel.

Welk open-source model kiezen we?

Dat hangt af van de taak, de taal en de geaccepteerde latentie — er bestaat geen universeel beste model. We werken met open-weight modelfamilies zoals Qwen, DeepSeek, GLM, Gemma of Mistral, geserveerd via productie-engines zoals vLLM of SGLang, en kiezen de juiste variant tijdens de discovery, op basis van tests op jouw echte case.

Blijft de data in Roemenië/de EU?

Ja — het platform draait ofwel op de servers van het bedrijf (on-premise, fysiek waar het bedrijf zich bevindt), ofwel op een dedicated GPU bij een provider in de Europese Unie. De data verlaat de vastgestelde perimeter niet, niet naar een externe API en niet buiten de EU — relevant voor de dataresidentie die de AVG vereist en voor NIS2 in gereguleerde sectoren.

Waar kan een AI-server voor een bedrijf in Roemenië draaien?

Op de eigen servers van het bedrijf, on-premise, of op dedicated GPU's die worden gehuurd bij een aanbieder in de Europese Unie. Welke variant past, hangt af van hoeveel medewerkers hem tegelijk gebruiken, hoe gevoelig de data is en wie de infrastructuur beheert; de dimensionering gebeurt in de discovery, op basis van de cijfers van het bedrijf.

The Niche Society
Het team van The Niche SocietyAI- en software-engineers uit Boekarest · LinkedIn
bijgewerkt op 17 sep 2026

Laten we kijken wat we bij jou kunnen automatiseren.

Een gratis sessie van 30 minuten: we vertellen je wat er te automatiseren valt, hoe lang het duurt en wat het kost, met een vaste prijs na de discovery.

Plan een gratis kennismakingoffice@thenichesociety.ro

We reageren dezelfde werkdag.

+40 733 045 833