# LLM local pentru firme: ce rulează, pe ce și când merită

> Ce calculator îți trebuie pentru un LLM local, ce modele open-source merg în română, Ollama sau LM Studio și când merită față de cloud pentru o firmă.

URL: https://thenichesociety.ro/blog-llm-local-pentru-firme

Un LLM local este un model de limbaj care rulează pe calculatorul sau serverul tău, fără ca textul să ajungă la un furnizor extern. **Dimensionarea pornește de la memorie: aproximativ 0,5 GB pentru fiecare miliard de parametri la cuantizare pe 4 biți, plus spațiu pentru context.** Merită când datele sunt sensibile și volumul e constant, nu ca înlocuitor gratuit pentru ChatGPT. [Construim astfel de sisteme](https://thenichesociety.ro/ai-engineering/infrastructura-ai) on-premise sau pe GPU dedicat în UE.

## Ce este un LLM local și prin ce diferă de ChatGPT

Un LLM local este un model de limbaj care rulează pe hardware-ul tău, un laptop, un PC sau un server din firmă, în loc să fie accesat prin internet la un furnizor. Textul pe care îl introduci și răspunsurile rămân pe mașina respectivă. Asta e posibil pentru că tot mai mulți producători publică modele cu ponderi deschise, pe care oricine le poate descărca și rula: OpenAI cu gpt-oss, Google cu Gemma sau Alibaba cu Qwen, toate sub licența permisivă Apache 2.0.

Diferența practică față de ChatGPT sau Claude folosite în browser e împărțirea responsabilităților. În cloud, furnizorul se ocupă de servere, actualizări și capacitate, iar tu plătești abonamentul sau consumul. Local, ai control complet asupra datelor și a modelului ales, dar și grija hardware-ului, a vitezei și a întreținerii. Modelele deschise s-au apropiat de unele modele comerciale: OpenAI spune că gpt-oss-120b ajunge aproape de o4-mini pe testele principale de raționament, însă pentru sarcinile cele mai grele modelele de vârf din cloud au, de regulă, un avantaj.

## Câtă memorie îți trebuie pentru un LLM local

Regula de bază pentru dimensionare e memoria, nu procesorul. Fiecare parametru al modelului ocupă spațiu: la precizie FP16 sunt doi octeți, adică aproximativ 2 GB de memorie pentru fiecare miliard de parametri, iar la cuantizare pe 4 biți, varianta folosită de obicei local, aproximativ 0,5 GB. Un model de 20 de miliarde de parametri are deci nevoie de circa 10 GB doar pentru ponderi. Memoria poate fi cea a plăcii video sau, pe calculatoarele cu memorie unificată, memoria comună a sistemului.

Peste ponderi se adaugă memoria pentru context, numită KV cache, care crește cu fiecare token din conversație și cu fiecare utilizator care lucrează în același timp. De aceea un model care încape confortabil când îl testează o singură persoană poate rămâne fără memorie când îl folosește o echipă întreagă. Ghidurile de dimensionare recomandă o rezervă de 15-20% pentru rulare. Ca repere concrete, gpt-oss-20b se descarcă în 14 GB și rulează cu 16 GB de memorie, iar gpt-oss-120b are 65 GB și încape pe un singur GPU de 80 GB.

| Mărimea modelului | Memorie pentru ponderi, pe 4 biți | Unde rulează, orientativ |
|---|---|---|
| 3-4 miliarde de parametri | circa 2 GB | laptop obișnuit, pentru teste |
| 12-14 miliarde | circa 6-7 GB | PC cu placă video de 12-16 GB |
| 20-32 de miliarde | circa 10-16 GB | placă video de 24 GB sau Mac cu memorie unificată de cel puțin 32 GB |
| peste 100 de miliarde | peste 50 GB | server cu GPU de 80 GB sau mai multe plăci |

30 de minute, gratuit. Îți spunem sincer dacă are sens.

## Ce modele open-source poți rula local în 2026

Oferta s-a schimbat mult în ultimul an, iar licența a devenit la fel de importantă ca performanța. Apache 2.0, licența folosită de gpt-oss, Gemma 4 și Qwen3, permite utilizarea comercială, modificarea și integrarea în produse fără un acord separat cu producătorul. Alte familii de modele vin cu licențe proprii, cu condiții pe care trebuie să le citești înainte de a le folosi într-un produs sau într-un serviciu pentru clienți. Eticheta „open-source” dintr-o prezentare nu înseamnă automat că poți face orice cu modelul.

Pentru o firmă din România contează și limba. Gemma 4 declară suport pentru peste 140 de limbi, iar Qwen3 listează 119 limbi și dialecte, printre care și româna. Asta nu garantează aceeași calitate ca în engleză, mai ales la terminologie juridică, fiscală sau tehnică. Singurul test care contează e pe documentele tale: aceleași întrebări, puse mai multor modele, cu răspunsurile comparate de cineva care știe cum arată un răspuns corect în domeniul respectiv.

- 01**gpt-oss** OpenAI, din august 2025, în variantele 20b și 120b, licență Apache 2.0.
- 02**Gemma 4** Google, din aprilie 2026, de la variante mici pentru dispozitive până la un model de 31 de miliarde de parametri, licență Apache 2.0.
- 03**Qwen3** Alibaba, din aprilie 2025, în mai multe mărimi, cu suport declarat pentru limba română, licență Apache 2.0.

## Ollama, LM Studio, llama.cpp sau vLLM: cu ce rulezi modelul

Pentru primele teste nu ai nevoie de nimic complicat. Ollama, un proiect open-source sub licență MIT, descarcă și rulează un model cu o singură comandă și oferă un API compatibil cu cel al OpenAI, așa că multe aplicații existente se pot conecta la modelul local fără modificări mari. LM Studio face același lucru printr-o interfață grafică și, din iulie 2025, e gratuit și pentru utilizarea la serviciu, fără licență separată. Pentru cine nu vrea linie de comandă, e de obicei cel mai simplu punct de plecare.

Sub multe dintre aceste aplicații lucrează llama.cpp, motorul open-source care a făcut posibilă rularea modelelor cuantizate pe hardware obișnuit. Când treci de la o persoană la o echipă, problema devine capacitatea: mai mulți utilizatori simultan, răspunsuri rapide pentru toți și monitorizare. Acolo se folosește de regulă vLLM, un server de inferență cu licență Apache 2.0, gândit pentru multe cereri în paralel. Diferența dintre un test pe laptop și un sistem folosit zilnic de o echipă ține mai mult de infrastructură decât de model.

| Unealtă | Pentru ce e bună | Licență |
|---|---|---|
| Ollama | Rulare simplă din linie de comandă și API local compatibil OpenAI | MIT |
| LM Studio | Interfață grafică, teste individuale, fără linie de comandă | Aplicație gratuită, inclusiv la serviciu |
| llama.cpp | Motorul de bază pentru modele cuantizate pe hardware obișnuit | MIT |
| vLLM | Server pentru mulți utilizatori simultan | Apache 2.0 |

## LLM local vs cloud: ce câștigi și ce pierzi

Comparația corectă nu e între un model gratuit și un abonament, ci între două feluri de a plăti. În cloud plătești per utilizator sau după volumul de text procesat, iar costul crește odată cu folosirea. Local plătești la început hardware-ul, apoi timpul oamenilor care îl instalează, îl actualizează și îl securizează. La volum mic sau neregulat, cloud-ul iese aproape mereu mai ieftin. La volum mare și constant, cu date sensibile, balanța se poate înclina spre varianta locală.

Mai sunt diferențe care nu apar în calcul. Local, modelul nu se schimbă peste noapte fără să știi și funcționează și fără internet, dar nici nu primește singur îmbunătățiri. În cloud ai acces imediat la cele mai noi modele, dar datele trec prin infrastructura altcuiva, chiar dacă sub contract. Pentru multe firme, răspunsul realist e o combinație: sarcinile cu date sensibile rulează local, iar cele fără risc merg la un serviciu cloud ales cu atenție.

| Criteriu | LLM local | Cloud |
|---|---|---|
| Unde ajung datele | Rămân pe hardware-ul firmei | Trec prin serverele furnizorului |
| Calitatea maximă | Bună, sub modelele de vârf | Cele mai noi și mai mari modele |
| Cost | Hardware plătit la început, plus întreținere | Abonament sau plată după consum |
| Întreținere | În grija ta sau a unui partener | În grija furnizorului |
| Fără internet | Funcționează | Nu funcționează |

## Când merită un LLM local pentru o firmă și când nu

Un LLM local are sens când cel puțin una dintre condițiile de mai jos e îndeplinită clar. Cel mai des e vorba de date care, prin contract sau prin natura lor, nu trebuie să ajungă la un furnizor extern: dosare de clienți, date medicale, documentație tehnică sau financiară. La [RSM România](https://thenichesociety.ro/studii-de-caz/rsm-romania), în consultanță fiscală, proiectul pornește exact de la această situație: date de client care nu pot ieși din firmă. La o firmă cu mulți utilizatori și volum constant, varianta de echipă devine o [infrastructură AI privată](https://thenichesociety.ro/ai-engineering/infrastructura-ai), cu un server dimensionat după numărul de oameni care lucrează simultan.

Nu merită pentru un experiment de o lună, pentru o echipă de câțiva oameni care folosește AI ocazional sau când nimeni din firmă și niciun partener nu se ocupă de întreținere. Un server nesupravegheat, cu modelul neactualizat și accesul configurat în grabă, creează mai multe riscuri decât rezolvă. Pentru o analiză mai largă a variantei self-hosted, cu implicațiile de GDPR și limitele actuale, am scris separat despre [AI self-hosted pentru companii](https://thenichesociety.ro/blog-ai-suveran-self-hosted-ue).

- 01**Date sensibile** documente care nu au voie să ajungă la un furnizor extern.
- 02**Volum constant** utilizare zilnică, suficient de mare încât costul din cloud să conteze.
- 03**Funcționare offline** locații sau fluxuri în care internetul nu e garantat.
- 04**Cineva răspunde de sistem** o persoană sau un partener care îl actualizează și îl securizează.

## Cum testezi un LLM local în firmă, pas cu pas

Un prim test se poate face în câteva zile și pornește de la o sarcină reală, nu de la o demonstrație. Alege ceva ce echipa face des, de exemplu rezumatul unor documente interne sau răspunsuri la întrebări despre proceduri, și pregătește pentru prima rundă un set de documente fără date sensibile. Rulează aceleași întrebări pe un model mic, pe unul mediu și pe un serviciu cloud, apoi compară răspunsurile, viteza și memoria folosită.

Dacă rezultatele sunt bune, următorul pas nu e un laptop mai puternic, ci un server gândit pentru echipă, cu control de acces, jurnal și căutare sigură în documentele firmei: de obicei un [asistent AI pe documentele companiei](https://thenichesociety.ro/ai-engineering/asistent-pe-documente), care răspunde citând sursa. Dacă nu sunt bune în română pentru sarcina ta, ai aflat asta ieftin, înainte de orice investiție în hardware. Testul îl putem face și împreună: în sesiunea gratuită de 30 de minute alegem sarcina și documentele. Dacă mergem mai departe, prețul e fix, pe scope scris, iar codul și infrastructura rămân ale firmei.

- 01Alege o sarcină reală și un set de documente fără date sensibile.
- 02Instalează Ollama sau LM Studio pe un calculator de test.
- 03Rulează aceleași întrebări pe un model mic și pe unul mediu.
- 04Compară cu un serviciu cloud: calitatea în română, viteza, memoria.
- 05Decide pe baza rezultatelor dacă merită un server pentru echipă.

## Surse și lecturi.

- 01[OpenAI — Introducing gpt-oss](https://openai.com/index/introducing-gpt-oss/)
- 02[Google — Gemma 4 model card](https://ai.google.dev/gemma/docs/core/model_card_4)
- 03[Qwen — Qwen3: Think Deeper, Act Faster](https://qwenlm.github.io/blog/qwen3/)
- 04[Ollama — depozitul oficial pe GitHub](https://github.com/ollama/ollama)
- 05[LM Studio — LM Studio is free for use at work](https://lmstudio.ai/blog/free-for-work)
- 06[Runpod — GPU memory sizing guide for LLM inference](https://www.runpod.io/articles/guides/gpu-memory-sizing-guide-for-llm-inference)
30 de minute, gratuit. Îți spunem sincer dacă are sens.

## Întrebări frecvente

### Ce este un LLM local?

Un LLM local este un model de limbaj descărcat și rulat pe hardware-ul propriu, un laptop, un PC sau un server din firmă. Textul introdus și răspunsurile nu ajung la un furnizor extern, dar întreținerea, actualizările și securitatea rămân în grija ta.

### Ce calculator îmi trebuie pentru un LLM local?

Depinde de mărimea modelului. La cuantizare pe 4 biți, un model ocupă aproximativ 0,5 GB de memorie pentru fiecare miliard de parametri, plus spațiu pentru context. Un model de 20 de miliarde de parametri rulează orientativ pe o placă video de 16-24 GB sau pe un Mac cu memorie unificată suficientă.

### Ollama sau LM Studio: pe care îl aleg?

LM Studio e mai simplu dacă vrei o interfață grafică și testezi singur pe calculatorul tău. Ollama se potrivește mai bine când vrei să conectezi modelul la alte aplicații prin API sau să îl rulezi pe un server. Ambele pot fi folosite gratuit la serviciu.

### Este un LLM local la fel de bun ca ChatGPT?

Pentru multe sarcini obișnuite, cum ar fi rezumatele, clasificările sau răspunsurile pe documente, modelele deschise de azi dau rezultate bune. Pentru raționament complex și sarcini foarte grele, modelele de vârf din cloud au de regulă un avantaj. Diferența se vede cel mai bine testând pe sarcinile tale.

### Pot folosi comercial un model open-source?

Depinde de licență. Modelele publicate sub Apache 2.0, cum sunt gpt-oss, Gemma 4 și Qwen3, permit utilizarea comercială și modificarea. Alte modele au licențe proprii, cu condiții, așa că licența se citește înainte de a folosi modelul într-un produs sau serviciu.

### Un LLM local înțelege limba română?

Mai multe modele deschise declară suport pentru română: Qwen3 o include între cele 119 limbi și dialecte, iar Gemma 4 declară peste 140 de limbi. Calitatea diferă însă de engleză, mai ales la termenii de specialitate, așa că merită testat pe documentele firmei înainte de orice decizie.

### Hai să vedem ce se poate automatiza la tine.

O sesiune gratuită de 30 de minute: îți spunem ce se poate automatiza, cât durează și cât costă, cu preț fix după discovery.

Răspundem în aceeași zi lucrătoare.
