Blog · IA

LLM local para empresas: qué funciona, en qué equipo y cuándo compensa

Un LLM local es un modelo de lenguaje que funciona en tu propio ordenador o servidor, sin que el texto llegue a un proveedor externo. El dimensionamiento empieza por la memoria: unos 0,5 GB por cada mil millones de parámetros con cuantización de 4 bits, más espacio para el contexto. Compensa cuando los datos son sensibles y el volumen es constante, no como sustituto gratuito de ChatGPT.

8minutos de lectura
2026-09-17publicado
IAcategoría
Servidores de tipo torre colocados uno junto a otro, con los indicadores de funcionamiento encendidos
IA
01

Qué es un LLM local y en qué se diferencia de ChatGPT

Un LLM local es un modelo de lenguaje que funciona en tu propio hardware, un portátil, un PC o un servidor de la empresa, en lugar de usarse a través de internet desde un proveedor. El texto que introduces y las respuestas se quedan en ese equipo. Es posible porque cada vez más fabricantes publican modelos con pesos abiertos que cualquiera puede descargar y ejecutar: OpenAI con gpt-oss, Google con Gemma o Alibaba con Qwen, todos con la licencia permisiva Apache 2.0.

La diferencia práctica frente a ChatGPT o Claude usados en el navegador está en el reparto de responsabilidades. En la nube, el proveedor se ocupa de los servidores, las actualizaciones y la capacidad, y tú pagas la suscripción o el consumo. En local tienes control total sobre los datos y el modelo elegido, pero también la responsabilidad del hardware, la velocidad y el mantenimiento. Los modelos abiertos se han acercado a algunos modelos comerciales: OpenAI afirma que gpt-oss-120b se aproxima a o4-mini en las pruebas principales de razonamiento, pero en las tareas más difíciles los modelos punteros de la nube suelen mantener ventaja.

02

Cuánta memoria necesitas para un LLM local

La regla básica de dimensionamiento es la memoria, no el procesador. Cada parámetro del modelo ocupa espacio: con precisión FP16 son dos bytes, es decir, unos 2 GB de memoria por cada mil millones de parámetros, y con cuantización de 4 bits, la variante que se suele usar en local, unos 0,5 GB. Un modelo de 20 mil millones de parámetros necesita, por tanto, unos 10 GB solo para los pesos. La memoria puede ser la de la tarjeta gráfica o, en los ordenadores con memoria unificada, la memoria compartida del sistema.

A los pesos se suma la memoria para el contexto, llamada caché KV, que crece con cada token de la conversación y con cada usuario que trabaja al mismo tiempo. Por eso, un modelo que cabe con holgura cuando lo prueba una sola persona puede quedarse sin memoria cuando lo usa un equipo entero. Las guías de dimensionamiento recomiendan una reserva del 15-20% para la ejecución. Como referencias concretas, gpt-oss-20b se descarga en 14 GB y funciona con 16 GB de memoria, mientras que gpt-oss-120b ocupa 65 GB y cabe en una sola GPU de 80 GB.

Tamaño del modeloMemoria para los pesos, a 4 bitsDónde funciona, orientativo
3-4 mil millones de parámetrosunos 2 GBportátil corriente, para pruebas
12-14 mil millonesunos 6-7 GBPC con tarjeta gráfica de 12-16 GB
20-32 mil millonesunos 10-16 GBtarjeta gráfica de 24 GB o Mac con al menos 32 GB de memoria unificada
más de 100 mil millonesmás de 50 GBservidor con GPU de 80 GB o varias tarjetas
03

Qué modelos open source puedes ejecutar en local en 2026

La oferta ha cambiado mucho en el último año, y la licencia se ha vuelto tan importante como el rendimiento. Apache 2.0, la licencia que usan gpt-oss, Gemma 4 y Qwen3, permite el uso comercial, la modificación y la integración en productos sin un acuerdo aparte con el fabricante. Otras familias de modelos tienen licencias propias, con condiciones que debes leer antes de usarlos en un producto o en un servicio para clientes. La etiqueta «open source» en una presentación no significa automáticamente que puedas hacer cualquier cosa con el modelo.

Para una empresa de Rumanía también cuenta el idioma. Gemma 4 declara compatibilidad con más de 140 idiomas, y Qwen3 enumera 119 idiomas y dialectos, entre ellos el rumano. Eso no garantiza la misma calidad que en inglés, sobre todo con terminología jurídica, fiscal o técnica. La única prueba que cuenta es con tus propios documentos: las mismas preguntas, planteadas a varios modelos, con las respuestas comparadas por alguien que sepa cómo es una respuesta correcta en ese ámbito.

  • 01gpt-oss OpenAI, desde agosto de 2025, en las variantes 20b y 120b, licencia Apache 2.0.
  • 02Gemma 4 Google, desde abril de 2026, desde variantes pequeñas para dispositivos hasta un modelo de 31 mil millones de parámetros, licencia Apache 2.0.
  • 03Qwen3 Alibaba, desde abril de 2025, en varios tamaños, con compatibilidad declarada con el rumano, licencia Apache 2.0.
04

Ollama, LM Studio, llama.cpp o vLLM: con qué ejecutas el modelo

Para las primeras pruebas no necesitas nada complicado. Ollama, un proyecto open source con licencia MIT, descarga y ejecuta un modelo con un solo comando y ofrece una API compatible con la de OpenAI, así que muchas aplicaciones existentes pueden conectarse al modelo local sin grandes cambios. LM Studio hace lo mismo con una interfaz gráfica y, desde julio de 2025, también es gratuito para uso en el trabajo, sin licencia aparte. Para quien no quiere línea de comandos, suele ser el punto de partida más sencillo.

Debajo de muchas de estas aplicaciones funciona llama.cpp, el motor open source que hizo posible ejecutar modelos cuantizados en hardware corriente. Cuando pasas de una persona a un equipo, el problema pasa a ser la capacidad: varios usuarios a la vez, respuestas rápidas para todos y monitorización. Ahí se suele usar vLLM, un servidor de inferencia con licencia Apache 2.0, pensado para muchas peticiones en paralelo. La diferencia entre una prueba en un portátil y un sistema que un equipo usa a diario tiene más que ver con la infraestructura que con el modelo.

HerramientaPara qué sirveLicencia
OllamaEjecución sencilla desde la línea de comandos y API local compatible con OpenAIMIT
LM StudioInterfaz gráfica, pruebas individuales, sin línea de comandosAplicación gratuita, también en el trabajo
llama.cppEl motor base para modelos cuantizados en hardware corrienteMIT
vLLMServidor para muchos usuarios simultáneosApache 2.0
05

LLM local vs nube: qué ganas y qué pierdes

La comparación justa no es entre un modelo gratuito y una suscripción, sino entre dos formas de pagar. En la nube pagas por usuario o por volumen de texto procesado, y el coste crece con el uso. En local pagas el hardware al principio y después el tiempo de las personas que lo instalan, lo actualizan y lo protegen. Con un volumen bajo o irregular, la nube sale casi siempre más barata. Con un volumen alto y constante, y datos sensibles, la balanza puede inclinarse hacia la opción local.

También hay diferencias que no aparecen en los números. En local, el modelo no cambia de la noche a la mañana sin que lo sepas y funciona sin internet, pero tampoco recibe mejoras por sí solo. En la nube tienes acceso inmediato a los modelos más nuevos, pero los datos pasan por la infraestructura de otro, aunque sea bajo contrato. Para muchas empresas, la respuesta realista es una combinación: las tareas con datos sensibles funcionan en local y las que no tienen riesgo van a un servicio en la nube elegido con cuidado.

CriterioLLM localNube
Adónde van los datosSe quedan en el hardware de la empresaPasan por los servidores del proveedor
Calidad máximaBuena, por debajo de los modelos punterosLos modelos más nuevos y más grandes
CosteHardware pagado al principio, más mantenimientoSuscripción o pago por consumo
MantenimientoA tu cargo o de un socioA cargo del proveedor
Sin internetFuncionaNo funciona
06

Cuándo compensa un LLM local para una empresa y cuándo no

Un LLM local tiene sentido cuando al menos una de las condiciones de abajo se cumple con claridad, no solo en principio. Lo más habitual son datos que, por contrato o por su naturaleza, no deben llegar a un proveedor externo: expedientes de clientes, datos médicos, documentación técnica o financiera. En una empresa con muchos usuarios y un volumen constante, la versión para el equipo se convierte en una infraestructura de IA privada, con un servidor dimensionado según el número de personas que trabajan a la vez.

No compensa para un experimento de un mes, para un equipo de pocas personas que usa la IA de vez en cuando ni cuando nadie en la empresa ni ningún socio se ocupa del mantenimiento. Un servidor sin supervisión, con el modelo desactualizado y el acceso configurado con prisas, crea más riesgos de los que resuelve. Para un análisis más amplio de la opción self-hosted, con las implicaciones del RGPD y los límites actuales, hemos escrito por separado sobre la IA self-hosted para empresas.

  • 01Datos sensibles documentos que no pueden llegar a un proveedor externo.
  • 02Volumen constante uso diario, lo bastante grande como para que el coste en la nube importe.
  • 03Funcionamiento sin conexión ubicaciones o flujos en los que internet no está garantizado.
  • 04Alguien se responsabiliza del sistema una persona o un socio que lo actualiza y lo protege.
07

Cómo probar un LLM local en la empresa, paso a paso

Una primera prueba puede hacerse en pocos días y parte de una tarea real, no de una demostración. Elige algo que el equipo haga a menudo, por ejemplo resumir documentos internos o responder preguntas sobre procedimientos, y prepara para la primera ronda un conjunto de documentos sin datos sensibles. Lanza las mismas preguntas a un modelo pequeño, a uno mediano y a un servicio en la nube, y después compara las respuestas, la velocidad y la memoria utilizada.

Si los resultados son buenos, el siguiente paso no es un portátil más potente, sino un servidor pensado para el equipo, con control de acceso, registro y una forma segura de buscar en los documentos de la empresa. Eso suele significar un asistente de IA sobre los documentos de la empresa, que responde citando la fuente y se construye sobre el modelo elegido en la prueba. Si los resultados no son lo bastante buenos en rumano para tu tarea, lo has descubierto a bajo coste, antes de cualquier inversión en hardware.

  • 01Elige una tarea real y un conjunto de documentos sin datos sensibles.
  • 02Instala Ollama o LM Studio en un ordenador de pruebas.
  • 03Lanza las mismas preguntas a un modelo pequeño y a uno mediano.
  • 04Compara con un servicio en la nube: calidad en rumano, velocidad, memoria.
  • 05Decide según los resultados si compensa un servidor para el equipo.
08

Fuentes y lecturas.

FAQ

Preguntas frecuentes

¿Qué es un LLM local?

Un LLM local es un modelo de lenguaje que se descarga y se ejecuta en el propio hardware, un portátil, un PC o un servidor de la empresa. El texto introducido y las respuestas no llegan a un proveedor externo, pero el mantenimiento, las actualizaciones y la seguridad quedan a tu cargo.

¿Qué ordenador necesito para un LLM local?

Depende del tamaño del modelo. Con cuantización de 4 bits, un modelo ocupa unos 0,5 GB de memoria por cada mil millones de parámetros, más espacio para el contexto. Un modelo de 20 mil millones de parámetros funciona, orientativamente, en una tarjeta gráfica de 16-24 GB o en un Mac con suficiente memoria unificada.

Ollama o LM Studio: ¿cuál elijo?

LM Studio es más sencillo si quieres una interfaz gráfica y pruebas tú solo en tu ordenador. Ollama encaja mejor cuando quieres conectar el modelo a otras aplicaciones mediante una API o ejecutarlo en un servidor. Los dos pueden usarse gratis en el trabajo.

¿Un LLM local es tan bueno como ChatGPT?

Para muchas tareas habituales, como resúmenes, clasificaciones o respuestas basadas en documentos, los modelos abiertos actuales dan buenos resultados. En razonamiento complejo y tareas muy difíciles, los modelos punteros de la nube suelen mantener ventaja. La diferencia se ve mejor probando con tus propias tareas.

¿Puedo usar comercialmente un modelo open source?

Depende de la licencia. Los modelos publicados con Apache 2.0, como gpt-oss, Gemma 4 y Qwen3, permiten el uso comercial y la modificación. Otros modelos tienen licencias propias con condiciones, así que conviene leer la licencia antes de usar el modelo en un producto o servicio.

¿Un LLM local entiende el rumano?

Varios modelos abiertos declaran compatibilidad con el rumano: Qwen3 lo incluye entre sus 119 idiomas y dialectos, y Gemma 4 declara más de 140 idiomas. Aun así, la calidad difiere del inglés, sobre todo con términos especializados, por lo que conviene probarlo con los documentos de la empresa antes de cualquier decisión.

The Niche Society
El equipo de The Niche SocietyIngenieros de IA y software desde Bucarest · LinkedIn
publicado 2026-09-17

Veamos qué se puede automatizar en tu empresa.

Una sesión gratuita de 30 minutos: te decimos qué se puede automatizar, cuánto se tarda y cuánto cuesta, con precio fijo tras el discovery.

Reserva una sesión gratuitaoffice@thenichesociety.ro

Respondemos el mismo día laborable.

+40 733 045 833