INFRAESTRUCTURA DE IA

Infraestructura de IA privada: on‑premise o en la nube de la UE

Una API externa es fácil de poner en marcha, pero los contratos, los códigos de acceso y los datos de clientes acaban en servidores fuera de la empresa. Construimos plataformas de IA que se ejecutan on-premise o en GPU dedicada en la UE, con los datos dentro del perímetro establecido por la empresa.

UEla infraestructura se ejecuta dentro del perímetro de la empresa o en GPU dedicada en la Unión Europea, no en una API de EE. UU.
open-weightfamilias de modelos con pesos abiertos (Qwen, DeepSeek, GLM, Gemma, Mistral), no un modelo cerrado dentro de una API
de la empresael código y la infraestructura siguen siendo propiedad del cliente tras la entrega, no del proveedor
INFRAESTRUCTURA DE IA
INFRAESTRUCTURA DE IA
01

Qué significa la infraestructura de IA self-hosted para una empresa

Una infraestructura de IA self-hosted significa que el modelo de lenguaje se ejecuta en servidores controlados por la empresa o en GPU dedicada en un proveedor de la UE — no en una API pública estadounidense a la que le envías, solicitud tras solicitud, contratos, códigos de acceso o datos de clientes. La diferencia no es cosmética: los datos ya no salen nunca del perímetro establecido.

No hablamos solo de «ejecutar un modelo». Una plataforma de IA privada significa interfaz para empleados, permisos por roles, conexión a los documentos y sistemas internos, registros de auditoría y monitorización — todo lo que falta en una suscripción genérica de chat con IA.

Infraestructura de IA privada, explicada en dos minutos y medio
De decenas de chats aislados en servidores de EE. UU. a agentes que trabajan dentro de los sistemas de la empresa, con un modelo de código abierto que se ejecuta en GPU en la Unión Europea. Vídeo en inglés.
02

La plataforma no es solo un modelo: interfaz, RAG, agentes, auditoría

Un LLM privado, tomado solo, no resuelve nada para una empresa. El valor aparece cuando el modelo está conectado a una interfaz que los empleados usan de verdad, a los documentos de la empresa y, donde tiene sentido, a los sistemas operativos existentes.

Construimos cada componente como parte de la misma plataforma, no como herramientas separadas conectadas manualmente entre sí. La parte que hace que la plataforma sea útil cada día, la conexión de los agentes al ERP mediante servidores MCP, tiene una página aparte.

CHAT INTERNO

Interfaz con roles, permisos y SSO

Cada empleado entra con la cuenta de la empresa; lo que puede ver y pedir depende de su rol, no del sentido común.

RAG

Búsqueda sobre los documentos de la empresa

Las respuestas vienen de los procedimientos, los contratos y los informes internos, no de la memoria general del modelo.

AGENTES + ERP/CRM

Conectores mediante API o MCP hechos a medida

Agentes que leen y, con aprobación explícita, escriben en los sistemas existentes — ERP, CRM, SAGA, SAP.

AUDITORÍA & MONITORIZACIÓN

Registros de uso y acceso

Quién preguntó qué, qué respondió el modelo — visible internamente, no oculto detrás de una API externa.

EVALUACIÓN

Conjuntos de evaluación para cada caso de uso

Medimos la precisión sobre datos reales de la empresa, no sobre un benchmark público genérico.

03

Qué tamaño debe tener realmente un servidor de IA

El dimensionamiento no se hace según «el modelo más grande disponible», sino según el caso de uso: cuántos empleados usan el sistema simultáneamente, cuán largo es el contexto procesado (documentos completos o preguntas cortas) y qué tamaño y cuantización tiene el modelo elegido — estas variables determinan la memoria de vídeo necesaria.

Un modelo muy grande, de tipo MoE (mixture-of-experts), puede requerir cientos de GB de memoria de vídeo incluso cuantizado; un modelo de 20-30 mil millones de parámetros, en cambio, se ejecuta cómodamente en una sola GPU con memoria amplia. Para la mayoría de los procesos internos, la variante adecuada es la segunda — no el modelo más grande, sino el más adecuado para la tarea. Para una primera prueba en un solo ordenador, hemos descrito por separado cómo ejecutar un LLM local y cuánta memoria necesita.

04

LLM privado: on-premise en tus instalaciones o en GPU dedicada en la UE

Hay dos formas de ejecutar un LLM privado, no una sola. En servidores propios (on-premise), la empresa controla físicamente la infraestructura — la variante adecuada allí donde la política interna o contractual lo exige explícitamente. En GPU dedicada en un proveedor de la Unión Europea, la empresa no compra hardware, pero los datos tampoco salen de la UE ni llegan a un proveedor estadounidense.

La elección también depende de la residencia de datos exigida por el RGPD, de las obligaciones de transparencia del AI Act y, para los sectores regulados, de los requisitos de NIS2 — temas factuales que hay que poner sobre la mesa con el equipo jurídico de la empresa, no un terreno en el que ofrezcamos asesoría legal. Si los términos se mezclan en las conversaciones internas, hemos explicado aparte la diferencia entre la IA self-hosted y la IA soberana. Sobre la misma infraestructura puede funcionar un asistente de IA sobre los documentos de la empresa, con respuestas que citan la fuente.

05

Self-hosted o API: dónde está el umbral de rentabilidad

No existe una respuesta universal. Para pocos usuarios y tráfico en oleadas, el pago por token en una API alojada es casi con toda seguridad más barato que mantener tu propio servidor — la infraestructura estaría parada fuera de los picos de uso.

Para varias decenas de usuarios diarios, tráfico constante y datos sensibles, el self-hosted empieza a ganar — tanto en coste a gran volumen como en control sobre los datos. El umbral exacto depende del número de usuarios y del volumen real de solicitudes; lo calculamos en el discovery, sobre las cifras de la empresa, no a partir de una tabla genérica.

¿Self-hosted o API? 5 preguntas antes de decidir

Marca lo que es cierto para ti.

0 de 5

Marca los puntos de arriba.

06

Del discovery a la infraestructura entregada a la empresa

Empezamos por el discovery: casos de uso, qué datos existen y cuán limpios están, requisitos de seguridad, una estimación de dimensionamiento. Sigue un piloto en un único departamento, con criterios de aceptación escritos de antemano — igual que en cualquier implementación de IA seria.

Después del piloto, ampliamos a producción con monitorización activa y, al final, entregamos el código y la infraestructura a la empresa. Siguen siendo tuyos — no operamos una plataforma cerrada de la que dependas indefinidamente.

07

Precio fijo, tras un discovery breve.

Discovery de infraestructura de IA
a consultar · tras el discoveryUn día de análisis: casos de uso, datos disponibles, requisitos de seguridad y una estimación de dimensionamiento
  • auditoría de casos de uso y datos
  • requisitos de seguridad y cumplimiento
  • Recomendación de dimensionamiento
Piloto en un departamento
a consultar · tras el discoveryEl modelo elegido se ejecuta en un único departamento, sobre infraestructura on-premise o de la UE, con criterios de aceptación escritos de antemano
  • elección de modelo + runtime (vLLM/SGLang)
  • RAG sobre los documentos del departamento
  • criterios de aceptación por escrito
Despliegue + entrega
a consultar · tras el discoveryAmpliamos a más departamentos con monitorización de uso y, después, entregamos el código y la infraestructura a la empresa
  • extensión multidepartamento
  • monitorización y registros de auditoría
  • Entrega de código + infraestructura

Cada proyecto tiene otro contexto, otros flujos y otra infraestructura, así que el precio se fija tras un discovery breve y de pago, y después no cambia por el camino.

FAQ

Preguntas frecuentes

¿Qué tamaño debe tener el servidor?

Depende de tres cosas: cuántos empleados lo usan simultáneamente, cuán largo es el contexto procesado y qué modelo eliges. Un modelo muy grande, de tipo MoE, puede requerir cientos de GB de memoria de vídeo incluso cuantizado; un modelo de 20-30 mil millones de parámetros se ejecuta en una sola GPU con memoria amplia — la variante adecuada para la mayoría de los procesos internos. El dimensionamiento exacto se hace en el discovery, sobre tu caso de uso.

¿Puedo usar IA local con los datos del ERP?

Sí — los agentes se conectan al ERP/CRM mediante API o mediante conectores MCP hechos a medida, leen los datos necesarios y, con aprobación explícita, pueden escribir de vuelta en el sistema. Todo el flujo permanece en la infraestructura self-hosted o de la UE elegida, sin que los datos del ERP pasen por una API externa.

¿Es más barato que ChatGPT Team/Enterprise?

No tiene una respuesta universal. Para pocos usuarios y tráfico en oleadas, una suscripción o el pago por token suele salir más barato. Para varias decenas de usuarios diarios, tráfico constante y datos sensibles, el self-hosted empieza a ganar — el umbral exacto depende del número de usuarios y del volumen de solicitudes, y se calcula en el discovery, no a partir de una tabla de precios genérica.

¿Qué modelo open-source elegimos?

Depende de la tarea, el idioma y la latencia aceptada — no existe un modelo universal mejor. Trabajamos con familias de modelos open-weight como Qwen, DeepSeek, GLM, Gemma o Mistral, servidos mediante motores de producción como vLLM o SGLang, y elegimos la variante adecuada en el discovery, a partir de pruebas sobre tu caso real.

¿Los datos permanecen en Rumanía/la UE?

Sí — la plataforma se ejecuta en los servidores de la empresa (on-premise, físicamente donde está la empresa) o en GPU dedicada en un proveedor de la Unión Europea. Los datos no salen del perímetro establecido ni hacia una API externa ni fuera de la UE — relevante para la residencia de datos exigida por el RGPD y para NIS2 en los sectores regulados.

¿Dónde puede funcionar un servidor de IA para una empresa de Rumanía?

O bien en los servidores de la empresa, on-premise, o bien en GPU dedicadas alquiladas a un proveedor de la Unión Europea. La opción adecuada depende de cuántos empleados lo usan a la vez, de lo sensibles que son los datos y de quién administra la infraestructura, y el dimensionamiento se hace en el discovery, con las cifras de la empresa.

The Niche Society
El equipo de The Niche SocietyIngenieros de IA y software desde Bucarest · LinkedIn
actualizado 17 sep 2026

Veamos qué se puede automatizar en tu empresa.

Una sesión gratuita de 30 minutos: te decimos qué se puede automatizar, cuánto se tarda y cuánto cuesta, con precio fijo tras el discovery.

Reserva una sesión gratuitaoffice@thenichesociety.ro

Respondemos el mismo día laborable.

+40 733 045 833