Qué es un LLM local y en qué se diferencia de ChatGPT
Un LLM local es un modelo de lenguaje que funciona en tu propio hardware, un portátil, un PC o un servidor de la empresa, en lugar de usarse a través de internet desde un proveedor. El texto que introduces y las respuestas se quedan en ese equipo. Es posible porque cada vez más fabricantes publican modelos con pesos abiertos que cualquiera puede descargar y ejecutar: OpenAI con gpt-oss, Google con Gemma o Alibaba con Qwen, todos con la licencia permisiva Apache 2.0.
La diferencia práctica frente a ChatGPT o Claude usados en el navegador está en el reparto de responsabilidades. En la nube, el proveedor se ocupa de los servidores, las actualizaciones y la capacidad, y tú pagas la suscripción o el consumo. En local tienes control total sobre los datos y el modelo elegido, pero también la responsabilidad del hardware, la velocidad y el mantenimiento. Los modelos abiertos se han acercado a algunos modelos comerciales: OpenAI afirma que gpt-oss-120b se aproxima a o4-mini en las pruebas principales de razonamiento, pero en las tareas más difíciles los modelos punteros de la nube suelen mantener ventaja.
Cuánta memoria necesitas para un LLM local
La regla básica de dimensionamiento es la memoria, no el procesador. Cada parámetro del modelo ocupa espacio: con precisión FP16 son dos bytes, es decir, unos 2 GB de memoria por cada mil millones de parámetros, y con cuantización de 4 bits, la variante que se suele usar en local, unos 0,5 GB. Un modelo de 20 mil millones de parámetros necesita, por tanto, unos 10 GB solo para los pesos. La memoria puede ser la de la tarjeta gráfica o, en los ordenadores con memoria unificada, la memoria compartida del sistema.
A los pesos se suma la memoria para el contexto, llamada caché KV, que crece con cada token de la conversación y con cada usuario que trabaja al mismo tiempo. Por eso, un modelo que cabe con holgura cuando lo prueba una sola persona puede quedarse sin memoria cuando lo usa un equipo entero. Las guías de dimensionamiento recomiendan una reserva del 15-20% para la ejecución. Como referencias concretas, gpt-oss-20b se descarga en 14 GB y funciona con 16 GB de memoria, mientras que gpt-oss-120b ocupa 65 GB y cabe en una sola GPU de 80 GB.
| Tamaño del modelo | Memoria para los pesos, a 4 bits | Dónde funciona, orientativo |
|---|---|---|
| 3-4 mil millones de parámetros | unos 2 GB | portátil corriente, para pruebas |
| 12-14 mil millones | unos 6-7 GB | PC con tarjeta gráfica de 12-16 GB |
| 20-32 mil millones | unos 10-16 GB | tarjeta gráfica de 24 GB o Mac con al menos 32 GB de memoria unificada |
| más de 100 mil millones | más de 50 GB | servidor con GPU de 80 GB o varias tarjetas |
Qué modelos open source puedes ejecutar en local en 2026
La oferta ha cambiado mucho en el último año, y la licencia se ha vuelto tan importante como el rendimiento. Apache 2.0, la licencia que usan gpt-oss, Gemma 4 y Qwen3, permite el uso comercial, la modificación y la integración en productos sin un acuerdo aparte con el fabricante. Otras familias de modelos tienen licencias propias, con condiciones que debes leer antes de usarlos en un producto o en un servicio para clientes. La etiqueta «open source» en una presentación no significa automáticamente que puedas hacer cualquier cosa con el modelo.
Para una empresa de Rumanía también cuenta el idioma. Gemma 4 declara compatibilidad con más de 140 idiomas, y Qwen3 enumera 119 idiomas y dialectos, entre ellos el rumano. Eso no garantiza la misma calidad que en inglés, sobre todo con terminología jurídica, fiscal o técnica. La única prueba que cuenta es con tus propios documentos: las mismas preguntas, planteadas a varios modelos, con las respuestas comparadas por alguien que sepa cómo es una respuesta correcta en ese ámbito.
- 01gpt-oss OpenAI, desde agosto de 2025, en las variantes 20b y 120b, licencia Apache 2.0.
- 02Gemma 4 Google, desde abril de 2026, desde variantes pequeñas para dispositivos hasta un modelo de 31 mil millones de parámetros, licencia Apache 2.0.
- 03Qwen3 Alibaba, desde abril de 2025, en varios tamaños, con compatibilidad declarada con el rumano, licencia Apache 2.0.
Ollama, LM Studio, llama.cpp o vLLM: con qué ejecutas el modelo
Para las primeras pruebas no necesitas nada complicado. Ollama, un proyecto open source con licencia MIT, descarga y ejecuta un modelo con un solo comando y ofrece una API compatible con la de OpenAI, así que muchas aplicaciones existentes pueden conectarse al modelo local sin grandes cambios. LM Studio hace lo mismo con una interfaz gráfica y, desde julio de 2025, también es gratuito para uso en el trabajo, sin licencia aparte. Para quien no quiere línea de comandos, suele ser el punto de partida más sencillo.
Debajo de muchas de estas aplicaciones funciona llama.cpp, el motor open source que hizo posible ejecutar modelos cuantizados en hardware corriente. Cuando pasas de una persona a un equipo, el problema pasa a ser la capacidad: varios usuarios a la vez, respuestas rápidas para todos y monitorización. Ahí se suele usar vLLM, un servidor de inferencia con licencia Apache 2.0, pensado para muchas peticiones en paralelo. La diferencia entre una prueba en un portátil y un sistema que un equipo usa a diario tiene más que ver con la infraestructura que con el modelo.
| Herramienta | Para qué sirve | Licencia |
|---|---|---|
| Ollama | Ejecución sencilla desde la línea de comandos y API local compatible con OpenAI | MIT |
| LM Studio | Interfaz gráfica, pruebas individuales, sin línea de comandos | Aplicación gratuita, también en el trabajo |
| llama.cpp | El motor base para modelos cuantizados en hardware corriente | MIT |
| vLLM | Servidor para muchos usuarios simultáneos | Apache 2.0 |
LLM local vs nube: qué ganas y qué pierdes
La comparación justa no es entre un modelo gratuito y una suscripción, sino entre dos formas de pagar. En la nube pagas por usuario o por volumen de texto procesado, y el coste crece con el uso. En local pagas el hardware al principio y después el tiempo de las personas que lo instalan, lo actualizan y lo protegen. Con un volumen bajo o irregular, la nube sale casi siempre más barata. Con un volumen alto y constante, y datos sensibles, la balanza puede inclinarse hacia la opción local.
También hay diferencias que no aparecen en los números. En local, el modelo no cambia de la noche a la mañana sin que lo sepas y funciona sin internet, pero tampoco recibe mejoras por sí solo. En la nube tienes acceso inmediato a los modelos más nuevos, pero los datos pasan por la infraestructura de otro, aunque sea bajo contrato. Para muchas empresas, la respuesta realista es una combinación: las tareas con datos sensibles funcionan en local y las que no tienen riesgo van a un servicio en la nube elegido con cuidado.
| Criterio | LLM local | Nube |
|---|---|---|
| Adónde van los datos | Se quedan en el hardware de la empresa | Pasan por los servidores del proveedor |
| Calidad máxima | Buena, por debajo de los modelos punteros | Los modelos más nuevos y más grandes |
| Coste | Hardware pagado al principio, más mantenimiento | Suscripción o pago por consumo |
| Mantenimiento | A tu cargo o de un socio | A cargo del proveedor |
| Sin internet | Funciona | No funciona |
Cuándo compensa un LLM local para una empresa y cuándo no
Un LLM local tiene sentido cuando al menos una de las condiciones de abajo se cumple con claridad, no solo en principio. Lo más habitual son datos que, por contrato o por su naturaleza, no deben llegar a un proveedor externo: expedientes de clientes, datos médicos, documentación técnica o financiera. En una empresa con muchos usuarios y un volumen constante, la versión para el equipo se convierte en una infraestructura de IA privada, con un servidor dimensionado según el número de personas que trabajan a la vez.
No compensa para un experimento de un mes, para un equipo de pocas personas que usa la IA de vez en cuando ni cuando nadie en la empresa ni ningún socio se ocupa del mantenimiento. Un servidor sin supervisión, con el modelo desactualizado y el acceso configurado con prisas, crea más riesgos de los que resuelve. Para un análisis más amplio de la opción self-hosted, con las implicaciones del RGPD y los límites actuales, hemos escrito por separado sobre la IA self-hosted para empresas.
- 01Datos sensibles documentos que no pueden llegar a un proveedor externo.
- 02Volumen constante uso diario, lo bastante grande como para que el coste en la nube importe.
- 03Funcionamiento sin conexión ubicaciones o flujos en los que internet no está garantizado.
- 04Alguien se responsabiliza del sistema una persona o un socio que lo actualiza y lo protege.
Cómo probar un LLM local en la empresa, paso a paso
Una primera prueba puede hacerse en pocos días y parte de una tarea real, no de una demostración. Elige algo que el equipo haga a menudo, por ejemplo resumir documentos internos o responder preguntas sobre procedimientos, y prepara para la primera ronda un conjunto de documentos sin datos sensibles. Lanza las mismas preguntas a un modelo pequeño, a uno mediano y a un servicio en la nube, y después compara las respuestas, la velocidad y la memoria utilizada.
Si los resultados son buenos, el siguiente paso no es un portátil más potente, sino un servidor pensado para el equipo, con control de acceso, registro y una forma segura de buscar en los documentos de la empresa. Eso suele significar un asistente de IA sobre los documentos de la empresa, que responde citando la fuente y se construye sobre el modelo elegido en la prueba. Si los resultados no son lo bastante buenos en rumano para tu tarea, lo has descubierto a bajo coste, antes de cualquier inversión en hardware.
- 01Elige una tarea real y un conjunto de documentos sin datos sensibles.
- 02Instala Ollama o LM Studio en un ordenador de pruebas.
- 03Lanza las mismas preguntas a un modelo pequeño y a uno mediano.
- 04Compara con un servicio en la nube: calidad en rumano, velocidad, memoria.
- 05Decide según los resultados si compensa un servidor para el equipo.
Fuentes y lecturas.
Preguntas frecuentes
¿Qué es un LLM local?
Un LLM local es un modelo de lenguaje que se descarga y se ejecuta en el propio hardware, un portátil, un PC o un servidor de la empresa. El texto introducido y las respuestas no llegan a un proveedor externo, pero el mantenimiento, las actualizaciones y la seguridad quedan a tu cargo.
¿Qué ordenador necesito para un LLM local?
Depende del tamaño del modelo. Con cuantización de 4 bits, un modelo ocupa unos 0,5 GB de memoria por cada mil millones de parámetros, más espacio para el contexto. Un modelo de 20 mil millones de parámetros funciona, orientativamente, en una tarjeta gráfica de 16-24 GB o en un Mac con suficiente memoria unificada.
Ollama o LM Studio: ¿cuál elijo?
LM Studio es más sencillo si quieres una interfaz gráfica y pruebas tú solo en tu ordenador. Ollama encaja mejor cuando quieres conectar el modelo a otras aplicaciones mediante una API o ejecutarlo en un servidor. Los dos pueden usarse gratis en el trabajo.
¿Un LLM local es tan bueno como ChatGPT?
Para muchas tareas habituales, como resúmenes, clasificaciones o respuestas basadas en documentos, los modelos abiertos actuales dan buenos resultados. En razonamiento complejo y tareas muy difíciles, los modelos punteros de la nube suelen mantener ventaja. La diferencia se ve mejor probando con tus propias tareas.
¿Puedo usar comercialmente un modelo open source?
Depende de la licencia. Los modelos publicados con Apache 2.0, como gpt-oss, Gemma 4 y Qwen3, permiten el uso comercial y la modificación. Otros modelos tienen licencias propias con condiciones, así que conviene leer la licencia antes de usar el modelo en un producto o servicio.
¿Un LLM local entiende el rumano?
Varios modelos abiertos declaran compatibilidad con el rumano: Qwen3 lo incluye entre sus 119 idiomas y dialectos, y Gemma 4 declara más de 140 idiomas. Aun así, la calidad difiere del inglés, sobre todo con términos especializados, por lo que conviene probarlo con los documentos de la empresa antes de cualquier decisión.

Veamos qué se puede automatizar en tu empresa.
Una sesión gratuita de 30 minutos: te decimos qué se puede automatizar, cuánto se tarda y cuánto cuesta, con precio fijo tras el discovery.
