Qué significa la infraestructura de IA self-hosted para una empresa
Una infraestructura de IA self-hosted significa que el modelo de lenguaje se ejecuta en servidores controlados por la empresa o en GPU dedicada en un proveedor de la UE — no en una API pública estadounidense a la que le envías, solicitud tras solicitud, contratos, códigos de acceso o datos de clientes. La diferencia no es cosmética: los datos ya no salen nunca del perímetro establecido.
No hablamos solo de «ejecutar un modelo». Una plataforma de IA privada significa interfaz para empleados, permisos por roles, conexión a los documentos y sistemas internos, registros de auditoría y monitorización — todo lo que falta en una suscripción genérica de chat con IA.
De decenas de chats aislados en servidores de EE. UU. a agentes que trabajan dentro de los sistemas de la empresa, con un modelo de código abierto que se ejecuta en GPU en la Unión Europea. Vídeo en inglés.
La plataforma no es solo un modelo: interfaz, RAG, agentes, auditoría
Un LLM privado, tomado solo, no resuelve nada para una empresa. El valor aparece cuando el modelo está conectado a una interfaz que los empleados usan de verdad, a los documentos de la empresa y, donde tiene sentido, a los sistemas operativos existentes.
Construimos cada componente como parte de la misma plataforma, no como herramientas separadas conectadas manualmente entre sí. La parte que hace que la plataforma sea útil cada día, la conexión de los agentes al ERP mediante servidores MCP, tiene una página aparte.
Interfaz con roles, permisos y SSO
Cada empleado entra con la cuenta de la empresa; lo que puede ver y pedir depende de su rol, no del sentido común.
Búsqueda sobre los documentos de la empresa
Las respuestas vienen de los procedimientos, los contratos y los informes internos, no de la memoria general del modelo.
Conectores mediante API o MCP hechos a medida
Agentes que leen y, con aprobación explícita, escriben en los sistemas existentes — ERP, CRM, SAGA, SAP.
Registros de uso y acceso
Quién preguntó qué, qué respondió el modelo — visible internamente, no oculto detrás de una API externa.
Conjuntos de evaluación para cada caso de uso
Medimos la precisión sobre datos reales de la empresa, no sobre un benchmark público genérico.
Qué tamaño debe tener realmente un servidor de IA
El dimensionamiento no se hace según «el modelo más grande disponible», sino según el caso de uso: cuántos empleados usan el sistema simultáneamente, cuán largo es el contexto procesado (documentos completos o preguntas cortas) y qué tamaño y cuantización tiene el modelo elegido — estas variables determinan la memoria de vídeo necesaria.
Un modelo muy grande, de tipo MoE (mixture-of-experts), puede requerir cientos de GB de memoria de vídeo incluso cuantizado; un modelo de 20-30 mil millones de parámetros, en cambio, se ejecuta cómodamente en una sola GPU con memoria amplia. Para la mayoría de los procesos internos, la variante adecuada es la segunda — no el modelo más grande, sino el más adecuado para la tarea. Para una primera prueba en un solo ordenador, hemos descrito por separado cómo ejecutar un LLM local y cuánta memoria necesita.
LLM privado: on-premise en tus instalaciones o en GPU dedicada en la UE
Hay dos formas de ejecutar un LLM privado, no una sola. En servidores propios (on-premise), la empresa controla físicamente la infraestructura — la variante adecuada allí donde la política interna o contractual lo exige explícitamente. En GPU dedicada en un proveedor de la Unión Europea, la empresa no compra hardware, pero los datos tampoco salen de la UE ni llegan a un proveedor estadounidense.
La elección también depende de la residencia de datos exigida por el RGPD, de las obligaciones de transparencia del AI Act y, para los sectores regulados, de los requisitos de NIS2 — temas factuales que hay que poner sobre la mesa con el equipo jurídico de la empresa, no un terreno en el que ofrezcamos asesoría legal. Si los términos se mezclan en las conversaciones internas, hemos explicado aparte la diferencia entre la IA self-hosted y la IA soberana. Sobre la misma infraestructura puede funcionar un asistente de IA sobre los documentos de la empresa, con respuestas que citan la fuente.
Self-hosted o API: dónde está el umbral de rentabilidad
No existe una respuesta universal. Para pocos usuarios y tráfico en oleadas, el pago por token en una API alojada es casi con toda seguridad más barato que mantener tu propio servidor — la infraestructura estaría parada fuera de los picos de uso.
Para varias decenas de usuarios diarios, tráfico constante y datos sensibles, el self-hosted empieza a ganar — tanto en coste a gran volumen como en control sobre los datos. El umbral exacto depende del número de usuarios y del volumen real de solicitudes; lo calculamos en el discovery, sobre las cifras de la empresa, no a partir de una tabla genérica.
¿Self-hosted o API? 5 preguntas antes de decidir
Marca lo que es cierto para ti.
Marca los puntos de arriba.
Del discovery a la infraestructura entregada a la empresa
Empezamos por el discovery: casos de uso, qué datos existen y cuán limpios están, requisitos de seguridad, una estimación de dimensionamiento. Sigue un piloto en un único departamento, con criterios de aceptación escritos de antemano — igual que en cualquier implementación de IA seria.
Después del piloto, ampliamos a producción con monitorización activa y, al final, entregamos el código y la infraestructura a la empresa. Siguen siendo tuyos — no operamos una plataforma cerrada de la que dependas indefinidamente.
Precio fijo, tras un discovery breve.
- auditoría de casos de uso y datos
- requisitos de seguridad y cumplimiento
- Recomendación de dimensionamiento
- elección de modelo + runtime (vLLM/SGLang)
- RAG sobre los documentos del departamento
- criterios de aceptación por escrito
- extensión multidepartamento
- monitorización y registros de auditoría
- Entrega de código + infraestructura
Cada proyecto tiene otro contexto, otros flujos y otra infraestructura, así que el precio se fija tras un discovery breve y de pago, y después no cambia por el camino.
Preguntas frecuentes
¿Qué tamaño debe tener el servidor?
Depende de tres cosas: cuántos empleados lo usan simultáneamente, cuán largo es el contexto procesado y qué modelo eliges. Un modelo muy grande, de tipo MoE, puede requerir cientos de GB de memoria de vídeo incluso cuantizado; un modelo de 20-30 mil millones de parámetros se ejecuta en una sola GPU con memoria amplia — la variante adecuada para la mayoría de los procesos internos. El dimensionamiento exacto se hace en el discovery, sobre tu caso de uso.
¿Puedo usar IA local con los datos del ERP?
Sí — los agentes se conectan al ERP/CRM mediante API o mediante conectores MCP hechos a medida, leen los datos necesarios y, con aprobación explícita, pueden escribir de vuelta en el sistema. Todo el flujo permanece en la infraestructura self-hosted o de la UE elegida, sin que los datos del ERP pasen por una API externa.
¿Es más barato que ChatGPT Team/Enterprise?
No tiene una respuesta universal. Para pocos usuarios y tráfico en oleadas, una suscripción o el pago por token suele salir más barato. Para varias decenas de usuarios diarios, tráfico constante y datos sensibles, el self-hosted empieza a ganar — el umbral exacto depende del número de usuarios y del volumen de solicitudes, y se calcula en el discovery, no a partir de una tabla de precios genérica.
¿Qué modelo open-source elegimos?
Depende de la tarea, el idioma y la latencia aceptada — no existe un modelo universal mejor. Trabajamos con familias de modelos open-weight como Qwen, DeepSeek, GLM, Gemma o Mistral, servidos mediante motores de producción como vLLM o SGLang, y elegimos la variante adecuada en el discovery, a partir de pruebas sobre tu caso real.
¿Los datos permanecen en Rumanía/la UE?
Sí — la plataforma se ejecuta en los servidores de la empresa (on-premise, físicamente donde está la empresa) o en GPU dedicada en un proveedor de la Unión Europea. Los datos no salen del perímetro establecido ni hacia una API externa ni fuera de la UE — relevante para la residencia de datos exigida por el RGPD y para NIS2 en los sectores regulados.
¿Dónde puede funcionar un servidor de IA para una empresa de Rumanía?
O bien en los servidores de la empresa, on-premise, o bien en GPU dedicadas alquiladas a un proveedor de la Unión Europea. La opción adecuada depende de cuántos empleados lo usan a la vez, de lo sensibles que son los datos y de quién administra la infraestructura, y el dimensionamiento se hace en el discovery, con las cifras de la empresa.

Veamos qué se puede automatizar en tu empresa.
Una sesión gratuita de 30 minutos: te decimos qué se puede automatizar, cuánto se tarda y cuánto cuesta, con precio fijo tras el discovery.
