# Infrastructură AI privată: on‑premise sau în cloud UE

> O infrastructură AI privată pentru companii: LLM rulat on-premise sau pe GPU dedicat în UE, cu RAG, agenți pe ERP și date care nu ies din companie.

URL: https://thenichesociety.ro/ai-engineering/infrastructura-ai

Un API extern e simplu de pornit, dar contractele, codurile de acces și datele clienților ajung pe servere din afara companiei. **Construim platforma AI a companiei pe serverele voastre sau pe GPU dedicat în UE**: chat intern cu roluri, căutare în documente și agenți conectați la ERP.

## Ce înseamnă infrastructură AI self-hosted pentru o companie

O infrastructură AI self-hosted înseamnă că modelul de limbaj rulează pe servere controlate de companie sau pe GPU dedicat la un furnizor din UE — nu într-un API public american căruia îi trimiți, cerere cu cerere, contracte, coduri de acces sau date de clienți. Diferența nu e cosmetică: datele nu mai ies niciodată din perimetrul stabilit.

Nu vorbim doar despre „a rula un model”. O platformă AI privată înseamnă interfață pentru angajați, permisiuni pe roluri, conectare la documentele și sistemele interne, loguri de audit și monitorizare — tot ce lipsește dintr-un abonament generic de chat AI.

## Platforma nu e doar un model: interfață, RAG, agenți, audit

Un LLM privat, luat singur, nu rezolvă nimic pentru o companie. Valoarea apare când modelul e conectat la o interfață pe care o folosesc efectiv angajații, la documentele companiei și, acolo unde are sens, la sistemele operaționale existente.

Construim fiecare componentă ca parte a aceleiași platforme, nu ca instrumente separate legate manual una de alta. Partea care face platforma utilă în fiecare zi, [conectarea agenților la ERP prin servere MCP](https://thenichesociety.ro/ai-engineering/integrare-erp-mcp), are o pagină separată.

**Interfață cu roluri, permisiuni și SSO**
Fiecare angajat intră cu contul companiei; ce poate vedea și cere depinde de rolul lui, nu de bunul simț.

**Căutare pe documentele companiei**
Răspunsurile vin din procedurile, contractele și rapoartele interne, nu din memoria generală a modelului.

**Conectori prin API sau MCP construit pe măsură**
Agenți care citesc și, cu aprobare explicită, scriu în sistemele existente — ERP, CRM, SAGA, SAP.

**Loguri de utilizare și acces**
Cine a întrebat ce, ce a răspuns modelul — vizibil intern, nu ascuns în spatele unui API extern.

**Seturi de evaluare pe fiecare caz de utilizare**
Măsurăm precizia pe date reale ale companiei, nu pe un benchmark public generic.

Ai în minte un caz, de la chat intern la agenți pe ERP? În 30 de minute îți spunem de unde ai porni.

## Ce am construit deja și ce ni se cere

Trei repere din proiecte reale din România, cu detalii în [studiul de caz FOX](https://thenichesociety.ro/studii-de-caz/fox) și pe pagina despre [contabilitatea automatizată pe SAGA](https://thenichesociety.ro/contabilitate-automatizata). Suntem, deliberat, o echipă mică de ingineri AI și software din București: cine vorbește cu tine la discovery e cine construiește efectiv. Multe proiecte rămân sub NDA, așa că alte referințe relevante le discutăm confidențial, în discovery.

**Platformă AI suverană, cerută de client**
După un training AI pentru 28 de angajați, o platformă de redeem pentru 250 de câștigători și un discovery pe SAP, același producător industrial ne-a cerut o ofertă pentru o platformă AI suverană, găzduită în UE.

**Agenți pe un program fără API**
20 de unelte care citesc direct datele SAGA, doar în citire, fără să scrie nimic în baza clientului. Impozitul pe profit calculat automat din jurnal a coincis cu cifra manuală, cu toleranță de un leu.

**Nucleul SAP rămâne neatins**
În discovery-ul pentru digitalizarea producției pe SAP, propunerea e side-by-side: extensiile stau lângă ERP și comunică prin interfețe oficiale, fără modificări în nucleu.

[Studiul de caz FOX, etapă cu etapă](https://thenichesociety.ro/studii-de-caz/fox)

## Cât de mare trebuie să fie un server AI, de fapt

Dimensionarea nu se face după „cel mai mare model disponibil”, ci după cazul de utilizare: câți angajați folosesc sistemul simultan, cât de lung e contextul procesat (documente întregi sau întrebări scurte) și ce dimensiune și cuantizare are modelul ales — aceste variabile decid memoria video necesară.

Un model foarte mare, de tip MoE (mixture-of-experts), poate cere sute de GB de memorie video chiar și cuantizat; un model de 20-30 de miliarde de parametri, în schimb, rulează confortabil pe un singur GPU cu memorie mare. Pentru majoritatea proceselor interne, varianta potrivită e a doua — nu cel mai mare model, ci cel potrivit sarcinii. Ca reper, la cuantizare pe 4 biți ponderile cer cam 0,5 GB de memorie pentru fiecare miliard de parametri, adică circa 10 GB la un model de 20 de miliarde; peste ele se adaugă memoria pentru context, care crește cu fiecare utilizator simultan, plus o rezervă de 15-20%. Pentru un prim test pe un singur calculator, am descris separat cum rulezi un [LLM local](https://thenichesociety.ro/blog-llm-local-pentru-firme) și câtă memorie îi trebuie.

## Self-hosted sau API: unde e pragul de rentabilitate

Nu există un răspuns universal. Pentru puțini utilizatori și trafic în valuri, plata per token la un API găzduit e aproape sigur mai ieftină decât să întreții propriul server — infrastructura ar sta degeaba în afara vârfurilor de utilizare.

Pentru multe zeci de utilizatori zilnici, trafic constant și date sensibile, self-hosted-ul începe să câștige — atât pe cost la volum mare, cât și pe control asupra datelor. Pragul exact depinde de numărul de utilizatori și de volumul real de cereri; îl calculăm în discovery, pe cifrele companiei, nu dintr-un tabel generic.

[Discută rezultatul cu noi: 30 de minute, gratuit](https://thenichesociety.ro/?from=ai-engineering-infrastructura-ai#book)

## LLM privat: on-premise la tine sau pe GPU dedicat în UE

Sunt două moduri de a rula un LLM privat, nu unul singur. Pe servere proprii (on-premise), compania controlează fizic infrastructura — variantă potrivită acolo unde politica internă sau contractuală cere asta explicit. Pe GPU dedicat la un furnizor din Uniunea Europeană, compania nu cumpără hardware, dar datele tot nu ies din UE și nu ajung la un furnizor american.

Alegerea ține și de rezidența datelor cerută de GDPR, de obligațiile de transparență din AI Act și, pentru sectoarele reglementate, de cerințele NIS2 — subiecte factuale de pus pe masă cu echipa juridică a companiei, nu zonă în care dăm noi consultanță legală. De la noi, echipa juridică primește datele tehnice: unde rulează modelul, ce date intră în el, cine are acces și ce se înregistrează în jurnal. Dacă termenii se amestecă în discuțiile interne, am explicat separat [diferența dintre AI self-hosted și AI suveran](https://thenichesociety.ro/blog-ai-suveran-self-hosted-ue). Pe aceeași infrastructură poate rula un [asistent AI pe documentele companiei](https://thenichesociety.ro/ai-engineering/asistent-pe-documente), cu răspunsuri care citează sursa.

## De la discovery la infrastructură predată companiei

Nimic nu intră în producție înainte să treacă un pilot măsurat pe criterii scrise, iar la final platforma e a voastră, nu una închisă de care depindeți la nesfârșit.

Infrastructura e fundația pe care o folosim în toate proiectele [agenției noastre de AI](https://thenichesociety.ro/ai-engineering), de la chatboți la agenți pe SAP.

- 01Discovery de o zi: cazurile de utilizare, datele disponibile, cerințele de securitate și o estimare de dimensionare. Primești raportul și prețul fix; poți opri aici.
- 02Pilot pe un departament, de regulă 2–6 săptămâni: modelul ales rulează on-premise sau pe GPU dedicat în UE, cu RAG pe documentele departamentului. La on-premise se adaugă timpul de livrare al serverelor.
- 03Decizie go / no-go pe criteriile scrise înainte de pilot: extindem, ajustăm sau oprim.
- 04Rollout pe mai multe departamente, cu monitorizare de utilizare și loguri de audit.
- 05Predare: codul, infrastructura și documentația rămân ale companiei, iar cei care o administrează primesc training. Mai departe o operați voi sau o întreținem noi, pe retainer lunar.
[Începe cu discuția gratuită de 30 de minute](https://thenichesociety.ro/?from=ai-engineering-infrastructura-ai#book)

## Preț fix, după un discovery scurt.

- audit cazuri de utilizare și date
- cerințe de securitate și conformitate
- recomandare de dimensionare
- alegere model + runtime (vLLM/SGLang)
- RAG pe documentele departamentului
- criterii de acceptare scrise
- extindere multi-departament
- monitorizare și loguri de audit
- predare cod + infrastructură
Fiecare proiect are alt context, alte fluxuri și altă infrastructură, așa că prețul se stabilește după un discovery scurt și plătit, iar apoi nu se schimbă pe parcurs.

Ai în minte un caz, de la chat intern la agenți pe ERP? În 30 de minute îți spunem de unde ai porni.

## Întrebări frecvente

### Cât costă și cât durează o infrastructură AI privată?

Prețul proiectului e fix: îl stabilim după discovery-ul de o zi, pe scope scris, și nu se schimbă pe parcurs. La varianta on-premise, serverele sunt ale companiei; în UE, compania nu cumpără hardware, iar GPU-ul dedicat îl facturăm la cost, fără adaos. Pilotul pe un departament durează de regulă 2–6 săptămâni, plus timpul de livrare al serverelor dacă alegeți on-premise.

### Cât de mare trebuie să fie serverul?

Depinde de trei lucruri: câți angajați îl folosesc simultan, cât de lung e contextul procesat și ce model alegi. Un model foarte mare, de tip MoE, poate cere sute de GB de memorie video chiar și cuantizat; un model de 20-30 de miliarde de parametri rulează pe un singur GPU cu memorie mare — varianta potrivită pentru majoritatea proceselor interne. Dimensionarea exactă se face în discovery, pe cazul tău de utilizare.

### Pot folosi AI local cu datele din ERP?

Da — agenții se conectează la ERP/CRM prin API sau prin conectori MCP construiți pe măsură, citesc datele necesare și, cu aprobare explicită, pot scrie înapoi în sistem. Tot fluxul rămâne pe infrastructura self-hosted sau UE aleasă, fără ca datele din ERP să treacă printr-un API extern.

### Este mai ieftin decât ChatGPT Team/Enterprise?

Nu are un răspuns universal. Pentru puțini utilizatori și trafic în valuri, un abonament sau plata per token rămâne de regulă mai ieftină. Pentru multe zeci de utilizatori zilnici, trafic constant și date sensibile, self-hosted-ul începe să câștige — pragul exact depinde de numărul de utilizatori și volumul de cereri și se calculează în discovery, nu dintr-un tabel de prețuri generic.

### Ce model open-source alegem?

Depinde de sarcină, limbă și latența acceptată — nu există un model universal mai bun. Lucrăm cu familii de modele open-weight precum Qwen, DeepSeek, GLM, Gemma sau Mistral, servite prin motoare de producție precum vLLM sau SGLang, și alegem varianta potrivită în discovery, pe baza testelor pe cazul tău real.

### Datele rămân în România/UE?

Da — platforma rulează fie pe serverele companiei (on-premise, fizic acolo unde e compania), fie pe GPU dedicat la un furnizor din Uniunea Europeană. Datele nu ies din perimetrul stabilit nici către un API extern, nici în afara UE — relevant pentru rezidența datelor cerută de GDPR și pentru NIS2 în sectoarele reglementate.

### Unde poate rula un server AI pentru o firmă din România?

Fie pe serverele firmei, on-premise, fie pe GPU dedicat închiriat la un furnizor din Uniunea Europeană. Varianta potrivită depinde de câți angajați îl folosesc simultan, de cât de sensibile sunt datele și de cine administrează infrastructura, iar dimensionarea se face în discovery, pe cifrele companiei.

### Cine întreține platforma după predare?

Alegeți voi: o operează echipa voastră IT, cu documentația și training-ul primite la predare, sau o întreținem noi pe retainer lunar, cu actualizări de model, monitorizare și ajustări ale integrărilor. Codul și infrastructura rămân ale companiei în ambele cazuri, așa că puteți schimba oricând echipa care le întreține.

### Hai să vedem ce se poate automatiza la tine.

O sesiune gratuită de 30 de minute: îți spunem ce se poate automatiza, cât durează și cât costă, cu preț fix după discovery.

Răspundem în aceeași zi lucrătoare.
