Coste real de la IA local en la empresa: siete líneas que no aparecen en la primera factura
El precio del servidor es la parte fácil.
Un servidor con GPU NVIDIA H100 de 80 GB se cotiza en el mercado español entre 30.000 y 55.000 euros según configuración de CPU, RAM y almacenamiento. Una L40S de 48 GB baja el ticket a 12.000-18.000 euros. Si sumas SAI de gama industrial, rack, refrigeración adicional y una red interna 10 Gbps para servir el modelo, la primera factura para tener un modelo pequeño (7B-14B parámetros) corriendo en tus oficinas ronda los 55.000-95.000 euros. Ese es el número que llega en el PDF del proveedor.
Es un tercio del coste real del primer año. A veces menos.
El resto son siete líneas que no aparecen en esa primera oferta: personal cualificado, MLOps, revalidación de prompts al cambiar de versión, seguridad, backups, continuidad y actualizaciones. Cada una se puede documentar con rangos de mercado públicos. Cada una sube la factura anual entre 40.000 y 250.000 euros según el escenario. Al sumar todo, el TCO del primer año de un SLM local en una mediana empresa española se mueve entre 180.000 y 450.000 euros. La segunda anualidad baja algo, pero no tanto como esperas.
Este post desglosa las siete líneas, con cifras, y las compara con lo que cuesta procesar el mismo volumen mensual contra una API con contrato de no retención de datos. Al final hay tres escenarios en los que el local sí sale a cuenta. Antes de esos tres, no.
1. La factura visible: hardware, energía y red
Empiezo por el número que sí aparece en el presupuesto porque conviene tenerlo claro para dimensionar el resto.
Hardware GPU. Un nodo con una H100 SXM ronda los 40.000 euros amortizados a 4 años. Un nodo con dos L40S para inferencia en paralelo, sobre 30.000 euros. Si tu carga es documental (RAG, resúmenes, extracción) y no entrenamiento, dos L40S dan más juego que una H100 sola. Añade CPU Xeon o EPYC, 256-512 GB de RAM y almacenamiento NVMe de 4-8 TB en RAID. Ticket realista de nodo completo: 45.000-65.000 euros.
Energía. Una H100 consume 700W bajo carga sostenida. Sumando CPU, memoria, ventilación y overhead del CPD, sube a 1.100-1.400W por nodo. Con el precio medio industrial español rondando los 0,15-0,20 euros/kWh según franja y contrato, un nodo funcionando 24/7 gasta entre 1.500 y 2.400 euros al año solo en electricidad. Multiplícalo por dos si tienes redundancia activa.
Red y CPD. Un armario en tu propio CPD con climatización adecuada, o el alquiler equivalente en un centro de datos español (Interxion, Equinix, Global Switch), oscila entre 4.000 y 12.000 euros al año según ubicación y potencia contratada. Si el CPD es propio, la partida se disuelve en gastos generales, pero existe.
Software base y licencias. Sistema operativo (RHEL o Ubuntu Pro con soporte), driver CUDA, framework de inferencia (vLLM, TGI, Triton), orquestador (Kubernetes o Nomad). Entre gratuito y 8.000 euros al año si contratas soporte empresarial de Red Hat o SUSE.
Total visible primer año, escenario medio: 65.000-110.000 euros. Esta cifra es la que suele aparecer en las tres primeras diapositivas del proveedor.
2. Personal MLOps: la línea que multiplica la factura
Aquí empieza el lío. Un modelo local no se instala una vez y se olvida. Necesita un perfil o un equipo que sepa desplegar, monitorizar, actualizar, medir latencia y calidad, y responder cuando algo se rompe a las 23:00 de un martes.
Los rangos salariales para perfiles MLOps en España, según los últimos informes de Michael Page y Hays Salary Guide:
| Perfil | Salario bruto anual (Madrid/Barcelona) | Tarifa freelance/hora |
|---|---|---|
| MLOps Engineer júnior (2-3 años) | 35.000-45.000 euros | 45-65 euros |
| MLOps Engineer senior (5+ años) | 55.000-75.000 euros | 75-110 euros |
| ML Platform Engineer / Lead | 70.000-95.000 euros | 100-150 euros |
| SRE con especialización GPU | 60.000-85.000 euros | 85-130 euros |
Traducción: contratar a un MLOps senior en plantilla, con coste empresa (aprox. 1,32x sobre bruto), sale entre 73.000 y 99.000 euros al año. Si vas por freelance porque no encuentras perfil o no quieres crecer plantilla, un contrato de dedicación parcial (20 horas/semana) ronda los 80.000-115.000 euros al año.
Un MLOps solo no basta. Necesitas al menos:
- Un MLOps senior o platform engineer que lleve el despliegue y las actualizaciones.
- Un SRE de guardia compartido con el resto de infraestructura, con know-how de GPU.
- Un data engineer que mantenga el pipeline de ingesta hacia el modelo (RAG, embeddings, reindexado).
Coste de personal año 1, escenario mínimo con un MLOps senior a jornada completa y participación del SRE existente: 85.000-110.000 euros. Escenario realista con equipo dedicado de dos personas: 150.000-200.000 euros.
Regla: si tu empresa no tiene ya un equipo de plataforma que sepa operar cargas GPU, esta línea es la que decide si el proyecto vive o muere. No se sustituye con cursos.
3. Revalidación de prompts al cambiar de modelo
Este coste no lo ve nadie hasta el mes 8 y sorprende siempre.
Los modelos abiertos se actualizan. Llama 3 pasa a Llama 3.1 y luego a 4. Mistral 7B pasa a Mistral Small 3. Qwen sube dos versiones al año. Cada vez que actualizas la versión del modelo base para aprovechar mejoras de calidad, contexto o coste computacional, los prompts que tenías afinados dejan de comportarse igual.
Síntoma: el prompt que extraía correctamente el 94% de los importes de una factura ahora extrae el 81%, o extrae el 96% pero devuelve el resultado en otro formato que rompe el sistema aguas abajo.
Solución: un ciclo de revalidación completo. Y ese ciclo cuesta.
Un ciclo típico de revalidación para una empresa con 12 casos de uso (extracción, clasificación, resumen, respuesta a cliente, redacción de propuestas, etc.) implica:
- Suite de evaluación. Un dataset etiquetado de 200-500 ejemplos por caso de uso. Si no la tienes, hay que construirla. Coste único de 8.000-25.000 euros de horas humanas. Coste de mantenimiento anual: 20-30% del inicial.
- Framework de eval. LangSmith, Promptfoo, DeepEval o desarrollo propio. Entre gratuito y 12.000 euros al año en licencias.
- Horas de ingeniería de prompt. Cada caso de uso revisado lleva entre 4 y 20 horas de un perfil que sepa (ML engineer o prompt engineer). A 80-120 euros/hora internos, con 12 casos, cada ciclo de revalidación cuesta entre 6.000 y 25.000 euros.
- Frecuencia realista. Dos ciclos completos al año como mínimo si quieres aprovechar mejoras del ecosistema abierto. Si te quedas anclado en el modelo del día de despliegue, pierdes 40% de calidad frente al estado del arte en 18 meses.
Coste anual de mantenimiento de prompts en un despliegue local con 12 casos de uso: 20.000-60.000 euros.
Nota crítica: si vas contra una API cerrada, este coste también existe cuando el proveedor actualiza el modelo por debajo. La diferencia es que en la API es opcional (puedes anclarte a un snapshot versionado durante 6-12 meses) y en local es obligatorio si quieres seguir cerca del estado del arte.
4. Seguridad, backups y aislamiento del modelo
Cuando el argumento comercial para llevarse el modelo a on premise es "los datos son sensibles y no salen de la empresa", la coherencia obliga a montar seguridad al nivel del argumento. Si el modelo procesa historiales clínicos, nóminas o contratos de licitación, no puede vivir en la misma red plana que el ERP y la impresora de recepción.
Segmentación de red. VLAN dedicada, firewall interno, reglas de acceso por rol. Coste de configuración inicial: 6.000-15.000 euros de consultoría de red. Coste anual de mantenimiento: 3.000-8.000 euros.
Cifrado en reposo y en tránsito. Los volúmenes de embeddings y el índice vectorial contienen fragmentos del contenido original y son tan sensibles como el documento fuente. Cifrado LUKS o equivalente, gestión de claves con HashiCorp Vault o solución similar. Coste anual entre 4.000 y 15.000 euros según herramienta.
Backups y disaster recovery. El índice vectorial de un RAG con 200.000 documentos ocupa 40-120 GB y tarda 8-30 horas en reindexarse desde cero. Si se corrompe y no hay backup, tu sistema queda inutilizable un día laborable entero. Backup incremental diario, snapshot semanal, prueba de restauración trimestral. Coste anual de almacenamiento y herramienta: 5.000-18.000 euros.
Registro de auditoría. Trazabilidad de qué usuario preguntó qué, cuándo, y qué respondió el modelo. Obligatorio para casos de uso bajo AI Act de alto riesgo (contratación, sanidad, servicios esenciales) y muy recomendable para el resto. Retención de al menos 24 meses. Coste anual entre 6.000 y 20.000 euros según volumen y herramienta.
Pentest anual del sistema. El servicio de un modelo local con acceso a datos internos es una superficie de ataque nueva. Un pentest específico con foco en inyección de prompt, exfiltración vía embeddings y abuso de contexto ronda los 8.000-18.000 euros según alcance en el mercado español (precio orientativo de firmas como S21sec o Deloitte Risk).
Coste anual de seguridad razonable para un despliegue local con datos sensibles: 32.000-74.000 euros.
Si el argumento comercial no soporta esta partida, el argumento comercial no era real.
5. Actualizaciones y continuidad: la línea que nadie presupuesta
Un modelo local envejece rápido. No hablo solo del modelo base. Hablo de todo el stack.
Driver CUDA y sistema. Actualizaciones cada 3-6 meses. Cada una obliga a validar que la inferencia sigue con la misma latencia y precisión. Coste de horas: 2.000-6.000 euros por ciclo.
Framework de inferencia. vLLM saca versión menor cada 4-6 semanas y mayor cada 6 meses. TGI y Triton igual. Cada mayor puede cambiar la API interna y romper tu wrapper.
Modelo base. Al menos una migración al año si quieres seguir cerca del estado del arte. Cada migración es un proyecto de 3-8 semanas de calendario con revalidación de prompts (ya cubierta en el punto 3) y validación de latencia y throughput bajo carga real.
Contrato de soporte del hardware. Ampliación de garantía y sustitución de GPU en 24-48h. Sin esto, una GPU averiada te deja fuera de servicio 3-8 semanas por plazos de reparación o reemplazo. Coste anual: 4-8% del valor del hardware. Sobre 50.000 euros de nodo, entre 2.000 y 4.000 euros al año.
Redundancia activa. Si el sistema es crítico (usuarios internos que dependen del modelo para trabajar), necesitas al menos dos nodos, con balanceador y failover. Doblas hardware, doblas energía, doblas licencias de soporte. Multiplica por 1,8 (no llega a 2 porque parte del CPD y del equipo se comparten).
Coste anual de mantenimiento y actualizaciones sin contar el equipo humano (que ya está en la línea 2): 12.000-35.000 euros. Con redundancia: sube el hardware base +80%.
6. API con no retención de datos: la comparativa que casi nadie hace bien
El argumento estrella para justificar local es "no puedo mandar mis datos a una API americana". Este argumento tenía peso real hace tres años. En 2026, todos los proveedores serios ofrecen contratos empresariales con no retención de datos (Zero Data Retention), residencia en la UE y en algunos casos residencia en España.
OpenAI Enterprise. Contrato con Zero Data Retention, residencia UE opcional, cumplimiento con SOC 2 Type II e ISO 27001. Los datos no se usan para entrenar ni se retienen más allá de la ventana de inferencia.
Anthropic Claude for Enterprise. Vía AWS Bedrock con residencia en Frankfurt o Irlanda. Contrato empresarial, Zero Data Retention, cumplimiento HIPAA y SOC 2.
Azure OpenAI Service. Residencia en España Central (región nueva desde 2024) o Suecia. Contrato Microsoft empresarial, integrable con Purview para gobierno de datos.
Mistral La Plateforme (empresarial). Empresa francesa, servidores en la UE, contrato Zero Retention, modelo europeo por defecto.
Los cuatro admiten firma de DPA (Data Processing Agreement) alineado con RGPD y anexo de subprocesadores. Un consultor de protección de datos español valida el contrato en 2-4 horas de trabajo.
Vamos a números. Un caso realista: mediana empresa que procesa 2 millones de páginas al año en un pipeline de extracción y resumen (facturas, contratos, correos comerciales). Volumen de tokens estimado: 3.000 millones de tokens de entrada, 400 millones de tokens de salida al año.
Con un modelo tipo GPT-4o mini, Claude Haiku 3.5 o Mistral Small en API empresarial, el precio combinado se mueve entre 0,15 y 0,60 euros por millón de tokens de entrada y 0,60 y 3 euros por millón de tokens de salida según proveedor y volumen negociado.
Coste anual API para ese volumen:
- Escenario barato (Mistral Small o GPT-4o mini con descuento por volumen): 3.000 M × 0,15 + 400 M × 0,60 = 690 euros al año (sí, seiscientos noventa).
- Escenario medio (Claude Haiku 3.5 empresarial): 3.000 M × 0,80 + 400 M × 4 = 4.000 euros al año.
- Escenario premium (GPT-4o o Claude Sonnet 4.5 sobre el 100% del volumen): 3.000 M × 2,50 + 400 M × 10 = 11.500 euros al año.
Añade a la API el coste humano de mantener el pipeline (que existe también, pero es menor): un data engineer parcial (0,3 FTE) para monitorización, throttling, gestión de errores y fallback. Unos 18.000-25.000 euros al año.
Total API con contrato empresarial y personal parcial para 2 M páginas/año: entre 19.000 y 37.000 euros al año.
Total local mismo volumen, escenario realista año 1: entre 210.000 y 380.000 euros.
La diferencia no es marginal. Es de un orden de magnitud, salvo en volúmenes muy altos.
7. Cuándo sí compensa el SLM local: tres escenarios
No estoy diciendo que local nunca tenga sentido. Estoy diciendo que la mayoría de empresas que se plantean local no están en ninguno de los tres escenarios donde compensa. Son estos:
Escenario A: volumen masivo con cargas predecibles. Procesas más de 20 millones de páginas al año o más de 40.000 millones de tokens de entrada con carga sostenida las 24 horas. A partir de ese punto, la inferencia por token contra API supera claramente el TCO local amortizado a 4 años. Perfil típico: gran aseguradora leyendo siniestros, plataforma legal analizando jurisprudencia a escala, medio de comunicación procesando su archivo histórico. No hay muchas medianas empresas ahí.
Escenario B: dato regulatorio que literalmente no puede salir de un perímetro físico. Casos concretos: información clasificada bajo secreto oficial, datos militares, algunos casos de investigación biomédica financiada por consorcios con cláusulas específicas de aislamiento físico. Nota: RGPD y datos sanitarios ordinarios no exigen esto. Un contrato empresarial con residencia UE y cifrado en tránsito y reposo cumple para casi todo el sector salud español, siempre que haya DPA firmado.
Escenario C: latencia por debajo de 50 ms con tráfico continuo desde un único edificio. Aplicaciones de tiempo real en fábrica, robótica, algún caso de asistente en punto de venta con SLA muy agresivo. Aquí la latencia de red hacia una API pública, aunque esté en un datacenter europeo, no cabe. Se resuelve con inferencia local. Es un porcentaje muy bajo de casos de uso de IA generativa en empresa.
Fuera de estos tres, el TCO local no compensa en 2026 para una mediana empresa española.
Errores frecuentes en la decisión de comprar servidor GPU
Error 1: Comparar el precio del hardware contra el precio unitario de la API. Síntoma: la hoja de cálculo del proveedor solo pone servidor vs coste por token. Solución: exigir un TCO a 3 años con las siete líneas de este post desglosadas y firmadas por el proveedor.
Error 2: Asumir que "on premise = cumplo RGPD". Síntoma: el comercial argumenta que llevar el modelo a tus oficinas cierra el debate de protección de datos. Solución: RGPD se cumple con base legal, DPA, cifrado, minimización y trazabilidad, no con la ubicación física del servidor. Un despliegue local mal configurado incumple igual o más que una API empresarial bien contratada.
Error 3: No presupuestar el equipo humano. Síntoma: la propuesta incluye hardware, instalación y "formación de 3 días al equipo actual". Solución: presupuestar al menos un MLOps senior a jornada completa desde el mes 1 y un SRE con know-how GPU compartido. Si no hay presupuesto para eso, no hay presupuesto para local.
Error 4: Elegir el modelo más grande "por si acaso". Síntoma: el proveedor propone Llama 3.3 70B porque "tiene más calidad" cuando el caso de uso es extracción de datos estructurados de facturas. Solución: empezar por un modelo de 7B-14B, medir precisión con suite de evaluación real y subir de tamaño solo si los números lo justifican. Duplicar tamaño del modelo cuadruplica la GPU necesaria.
Error 5: Ignorar el coste de la migración de vuelta. Síntoma: nadie pregunta qué pasa cuando decidas apagar el sistema local en 24 meses porque las APIs bajaron el precio otro 60%. Solución: exigir arquitectura desacoplada desde el diseño (capa de abstracción del proveedor de modelo, prompts versionados, suite de evaluación portable) para poder migrar sin reescribir el pipeline. Coste extra inicial de 4-8 semanas de trabajo. Ahorro potencial: 6 meses de reingeniería el día que quieras cambiar.
Preguntas frecuentes
Cuánto cuesta de verdad instalar un modelo pequeño local en una empresa española
En una mediana empresa (100-500 empleados) con un caso de uso documental y sin infraestructura MLOps previa, el TCO del primer año se mueve entre 180.000 y 450.000 euros, con 65.000-110.000 euros de hardware visible y el resto en personal, seguridad, mantenimiento y revalidación. El segundo año baja un 20-30% al desaparecer setup e inversión inicial de suite de evaluación. La cifra ronda 140.000-320.000 euros anuales sostenidos.
Qué gastos ocultos tiene tener un LLM propio en el servidor
Los siete que no aparecen en la primera factura: personal MLOps (85.000-200.000 euros/año), revalidación de prompts (20.000-60.000), seguridad y aislamiento (32.000-74.000), backups y disaster recovery (5.000-18.000), actualizaciones de stack y modelo (12.000-35.000), soporte de hardware y garantía extendida (2.000-4.000 por nodo) y energía y CPD (5.000-14.000 según redundancia). Ningún proveedor de hardware presupuesta las cinco primeras porque no son su negocio.
Sale más barato un SLM local o una API de OpenAI para procesar documentos
Para volúmenes por debajo de 20 millones de páginas al año (el 95% de las medianas empresas), la API con contrato empresarial y Zero Data Retention sale entre 8 y 20 veces más barata que el local, contando el TCO completo. Por encima de 20 millones de páginas al año y con carga sostenida, el punto de equilibrio se acerca. Por encima de 50 millones y con carga 24/7, el local suele ganar amortizando a 4 años.
Qué necesita una empresa para mantener un modelo de IA on premise
Cuatro bloques mínimos: equipo humano (al menos un MLOps senior dedicado y un SRE con know-how GPU compartido), stack técnico (framework de inferencia, orquestador, monitorización, gestión de secretos, cifrado), procesos (suite de evaluación versionada, ciclo de revalidación de prompts al menos dos veces al año, plan de disaster recovery probado trimestralmente) y contratos (soporte de hardware 24/7, garantía extendida, pentest anual, DPA interno con los departamentos usuarios). Si falta alguno de los cuatro, el despliegue funciona los tres primeros meses y se degrada silenciosamente a partir del sexto.
Puedo cumplir RGPD con una API en lugar de con servidor local
Sí, y en la mayoría de casos con menos esfuerzo. Los cuatro grandes proveedores empresariales (OpenAI, Anthropic vía Bedrock, Azure OpenAI, Mistral) ofrecen contratos con Zero Data Retention, residencia UE y DPA firmable. Un consultor de protección de datos español valida el contrato en 2-4 horas. Casos concretos que sí requieren local por normativa: información clasificada bajo secreto oficial, datos militares y algunos consorcios de investigación biomédica con cláusulas específicas. Sanidad, banca, seguros y administración pública ordinaria caben en contratos empresariales de API con residencia UE.
Cuánto tarda en amortizarse un servidor GPU comprado en 2026
Depende del volumen. Con carga media de mediana empresa (2 millones de páginas al año), no se amortiza. La API con contrato empresarial siempre gana. Con carga alta (20-40 millones de páginas al año), amortización estimada a 3,5-4 años, justo cuando el hardware ya toca fin de vida y hay que renovar. Con carga masiva y sostenida 24/7 (50+ millones de páginas/año), amortización a 24-30 meses. El proveedor de hardware raramente hace este cálculo en su presupuesto.
Cierre: el número que hay que pedir antes de firmar
La propuesta que llega en PDF con el precio del servidor GPU no es mala fe del proveedor. Es su modelo de negocio. Vende hardware. Su presupuesto incluye lo que él suministra. El coste real del proyecto vive en las siete líneas que él no vende y que caen sobre tu presupuesto operativo del año siguiente.
Antes de firmar cualquier propuesta de IA local, pide al proveedor un TCO a 3 años con las siete líneas de este post desglosadas: hardware, energía, personal, revalidación, seguridad, backups y actualizaciones. Si no puede o no quiere firmarlo, no es el proveedor adecuado. Si te lo firma y sigue saliendo a cuenta contra un contrato de API empresarial con Zero Data Retention para el mismo volumen y caso de uso, adelante. En la mayoría de casos no saldrá.
Si necesitas revisar una propuesta concreta de servidor GPU antes de firmarla, o comparar el TCO local frente a una arquitectura de API empresarial con residencia UE para tu volumen real, puedes reservar una sesión de 30 minutos para revisar tu caso sin coste. La sesión termina con un cálculo escrito de las siete líneas aplicado a tus cifras y una recomendación operativa: firmar, renegociar o cambiar de arquitectura.
Lecturas relacionadas
- Alfabetización en IA obligatoria: qué exige el artículo 4 del AI Act
- Contratos de API empresarial con Zero Data Retention: qué mirar en el DPA
- Suite de evaluación de prompts: cómo construir la tuya en 3 semanas
Fuentes
- Reglamento Europeo de IA (Reglamento UE 2024/1689, AI Act)
- Michael Page, Estudio de Remuneración Tecnología 2026
- Hays Salary Guide España 2026
- INCIBE, servicios de ciberseguridad para empresas
- Documentación pública de OpenAI Enterprise, Anthropic Enterprise, Azure OpenAI Service y Mistral La Plateforme sobre Zero Data Retention y residencia UE
