Escala Semántica: siete niveles para asignar cada tarea al mecanismo adecuado
Cada herramienta es una respuesta a una pregunta. Usar la respuesta equivocada cuesta dinero real.
El coste por millón de tokens entre un modelo frontera y un modelo ligero se mueve en un factor de 30x a 100x según proveedor y ventana de contexto. Un mismo flujo empresarial puede facturar 40 000 euros al mes o 400, en función de qué tarea se asigna a qué mecanismo. No es una cuestión de proveedor, ni de negociar tarifas, ni de esperar a que Anthropic o OpenAI bajen precios. Es una cuestión de diseño.
La mayoría de las arquitecturas de IA que se ven en empresas de servicios tienen el mismo defecto: usan el modelo más caro para todas las tareas del flujo, incluidas las que se resolverían con veinte líneas de Python. Se paga el razonamiento multipaso de un modelo frontera para validar que un IBAN empieza por ES y tiene 24 caracteres. Se paga por leer un PDF entero para extraer una fecha que estaba en el nombre del fichero. Se paga por generar una clasificación que ya existe en una tabla estática de 300 filas.
La Escala Semántica es un método para asignar cada tarea del flujo al nivel de mecanismo que necesita, ni uno más. Siete niveles, del código determinista puro a la decisión humana pura. Cada nivel resuelve un tipo de problema y tiene un coste por consulta distinto en varios órdenes de magnitud.
No es teoría. Es la única forma de bajar la factura sin recortar funcionalidad.
Los siete niveles, uno a uno
Los niveles no se ordenan por sofisticación técnica. Se ordenan por grado de indeterminación admitida en la entrada. Cuanto más rígida sea la entrada y más previsible el resultado, más abajo. Cuanto más ambigua sea la entrada o más difícil de codificar el criterio, más arriba.
Nivel 1: código determinista puro
Regex, validaciones de formato, aritmética, comparación de cadenas, hashing. Entrada estructurada, salida predecible, coste computacional despreciable. Ejemplos: validar dígito de control de un NIF español, comprobar que un IBAN cumple el estándar ISO 13616, calcular el 21% de IVA sobre una base imponible, sumar líneas de una factura.
Coste por consulta: prácticamente cero. Latencia: microsegundos. Auditabilidad: total. Riesgo de error: nulo si el código está bien escrito y probado.
Regla: si una tarea se puede describir con un patrón formal o con una fórmula cerrada, no sube de nivel 1. Nunca.
Nivel 2: reglas y tablas de lookup
Diccionarios, taxonomías, árboles de decisión codificados, mapas de traducción. Sigue siendo determinismo, pero con conocimiento de dominio empaquetado en datos. Ejemplos: mapear un código CNAE a su sector, un código postal a su provincia, un IBAN a su banco emisor, un código LEI a la razón social de la empresa.
La lógica es idéntica al nivel 1. La diferencia es que la respuesta no se calcula, se busca en una tabla previamente construida. Coste por consulta: microsegundos si la tabla está en memoria, milisegundos si está en disco o base de datos.
Ejemplo: una gestoría procesa 4 000 facturas al mes. El 78% de los proveedores ya están en su base. Cruzar el NIF de la factura contra esa tabla resuelve categoría de gasto, cuenta contable y centro de coste sin tocar un solo token de LLM. Solo el 22% restante sube al siguiente nivel.
Nivel 3: modelos clásicos de machine learning
Clasificadores entrenados (regresión logística, random forest, gradient boosting), embeddings más búsqueda vectorial, OCR estándar, detección de duplicados por similitud. Requieren entrenamiento previo y datos etiquetados, pero la inferencia es barata y rápida.
Ejemplos: clasificar un email entrante en 12 categorías con un modelo entrenado sobre 6 000 emails históricos, extraer texto de un PDF escaneado con OCR abierto, encontrar el proveedor más parecido a "Suminstros Herrera SL" (con la errata) en una base de 12 000 proveedores usando embeddings.
Coste por consulta: entre 0,001 y 0,01 céntimos de dólar en modelos autoalojados. Latencia: decenas de milisegundos. La calidad depende del dataset de entrenamiento y se degrada si la distribución de entrada cambia.
Nota crítica: el nivel 3 tiene mala prensa en 2026 porque parece "menos moderno" que un LLM. Es un error. Un clasificador entrenado sobre datos propios suele ser más preciso, más barato y más rápido que un LLM ligero para la misma tarea de clasificación cerrada.
Nivel 4: LLM ligero
Modelos pequeños optimizados para tareas de baja complejidad y alta velocidad. En 2026 la categoría incluye Claude Haiku, GPT-4o mini, Gemini Flash, Mistral Small, Llama 3.1 8B. Coste típico de entrada: 0,15 a 0,50 dólares por millón de tokens. Coste típico de salida: 0,60 a 2,50 dólares por millón de tokens.
Bien empleados, resuelven extracción estructurada de documentos poco variables, clasificación con prompt cuando no compensa entrenar un modelo propio, resumen de párrafos, reescritura de correos, generación de campos JSON a partir de texto libre.
Ejemplo: extraer los diez campos habituales de una factura (fecha, número, base imponible, IVA, total, NIF emisor, NIF receptor, concepto, forma de pago, vencimiento) a partir del OCR ya hecho en nivel 3. El LLM ligero devuelve un JSON validado por esquema. Coste real por factura procesada: entre 0,04 y 0,10 céntimos de dólar.
Nivel 5: LLM frontera
Modelos grandes con capacidad de razonamiento multipaso, contexto largo, código no trivial y comprensión de instrucciones complejas. Claude Opus, GPT-5, Gemini Ultra. Coste típico de entrada: 3 a 15 dólares por millón de tokens. Coste típico de salida: 15 a 75 dólares por millón de tokens.
Se justifica cuando la tarea exige:
- Razonamiento no lineal. Detectar una anomalía en una serie de asientos contables que no se aprecia mirando un solo asiento.
- Redacción compleja con criterio. Un pliego técnico, un informe de auditoría, un dictamen jurídico borrador.
- Código de más de 50 líneas con dependencias entre funciones.
- Comprensión de contexto largo por encima de 50 000 tokens, donde los ligeros se pierden.
Si la tarea no encaja en ninguno de esos supuestos, subir al nivel 5 es tirar dinero.
Nivel 6: LLM frontera con revisión humana obligatoria
Mismo motor que el nivel 5, pero el output no se ejecuta ni se comunica al cliente hasta que una persona lo firma. La revisión no es un adorno: es un control de responsabilidad legal, contractual o clínica.
Ejemplos: un borrador de contrato generado por LLM que un abogado revisa y modifica antes de enviarlo, un informe médico redactado por LLM que el facultativo aprueba y firma, una respuesta a una reclamación de consumidor que el responsable de atención al cliente valida antes de que salga con el logo de la empresa.
Coste por consulta: coste del nivel 5 más el tiempo humano de revisión (entre 3 y 45 minutos según complejidad, a coste hora del profesional).
Nivel 7: decisión humana pura
Sin IA en la ruta crítica. La persona decide con su criterio, su experiencia y la información que estime relevante. La IA puede aparecer como asistente informativo previo, pero la decisión no queda registrada como generada por un modelo, ni se automatiza, ni se delega.
Ejemplos: despedir a un empleado, aceptar o rechazar un cliente, fijar la estrategia de precios del año, decidir si se litiga o se transige un pleito, elegir socio comercial, escribir el email a un cliente con el que hay un conflicto emocional real.
El nivel 7 no desaparece con la IA. Se estrecha, pero no desaparece. Volveremos a esto.
Un flujo real de documento mapeado a los siete niveles
El mejor modo de entender la Escala Semántica es aplicarla a un flujo concreto. Tomemos el procesamiento de facturas recibidas en una asesoría contable que gestiona 90 clientes y recibe 4 000 facturas al mes.
| Paso | Tarea | Nivel | Mecanismo concreto |
|---|---|---|---|
| 1 | Comprobar que el fichero es PDF, JPG o EML y no supera 15 MB | 1 | Validación por extensión y tamaño |
| 2 | Extraer NIF del emisor si aparece en texto plano o en el nombre del fichero | 1 | Regex [A-Z]?\d{7,8}[A-Z]? más dígito de control |
| 3 | Mapear NIF a proveedor conocido y su cuenta contable | 2 | Lookup en tabla de 12 400 proveedores del cliente |
| 4 | Si es escaneado, aplicar OCR sobre las imágenes | 3 | OCR con modelo abierto ajustado a facturas españolas |
| 5 | Extraer los diez campos estructurados de la factura | 4 | LLM ligero con prompt de extracción y validación por JSON schema |
| 6 | Categorizar el gasto según plan contable del cliente | 3 o 4 | Clasificador entrenado sobre histórico, o LLM ligero si el cliente es nuevo |
| 7 | Comprobar coherencia aritmética (base más IVA igual a total) | 1 | Aritmética directa con tolerancia de 0,02 euros |
| 8 | Detectar factura sospechosa (importe fuera de rango, concepto raro, IVA no aplicable al régimen del cliente) | 5 | LLM frontera con contexto de las últimas 24 facturas del mismo proveedor |
| 9 | Si el importe supera 3 000 euros o la anomalía es grave, escalar a revisión | 6 | Contable revisa y aprueba en la interfaz interna |
| 10 | Decidir si se abre expediente formal por posible fraude o error del proveedor | 7 | Responsable del despacho decide caso por caso |
De los diez pasos, dos usan LLM ligero, uno usa LLM frontera, uno exige revisión humana y solo el último es decisión humana pura. Los otros seis pasos se resuelven con código, tablas y modelos clásicos.
Traducción: el 60% del flujo no ve un solo token de LLM. Ese 60% es donde vive el ahorro.
Coste por consulta: nivel 4 frente a nivel 5 en un caso idéntico
Vamos al número. Tomemos el paso 5 del flujo anterior: extraer los diez campos estructurados de una factura ya digitalizada. La entrada es texto plano de la factura tras OCR, unos 2 000 tokens. La salida es un JSON de unos 300 tokens.
Escenario A: LLM ligero (nivel 4).
Con tarifa típica de 0,25 dólares por millón de tokens de entrada y 1,25 dólares por millón de tokens de salida:
- Entrada: 2 000 × 0,25 / 1 000 000 = 0,000 5 dólares
- Salida: 300 × 1,25 / 1 000 000 = 0,000 375 dólares
- Coste por factura: 0,000 875 dólares. Redondeando, 0,09 céntimos de dólar.
Para 4 000 facturas al mes: 3,50 dólares. Para las 48 000 facturas del año: 42 dólares.
Escenario B: LLM frontera (nivel 5).
Con tarifa típica de 15 dólares por millón de tokens de entrada y 75 dólares por millón de tokens de salida:
- Entrada: 2 000 × 15 / 1 000 000 = 0,03 dólares
- Salida: 300 × 75 / 1 000 000 = 0,022 5 dólares
- Coste por factura: 0,052 5 dólares. Redondeando, 5,25 céntimos de dólar.
Para 4 000 facturas al mes: 210 dólares. Para las 48 000 facturas del año: 2 520 dólares.
Diferencia: 60x. El modelo frontera cuesta 60 veces más para hacer exactamente lo mismo.
Ahora la pregunta importante: ¿se gana calidad? En extracción estructurada de documentos poco variables, con esquema JSON validado por código en nivel 1 (comprobación de que el importe es un número, que la fecha es válida, que la base más el IVA cuadra con el total), la diferencia de precisión entre un LLM ligero moderno y un modelo frontera es del orden del 1% al 3%. En una asesoría de 4 000 facturas mensuales, ese 1-3% son entre 40 y 120 facturas al mes que el ligero clasifica peor.
Solución: el ligero hace la extracción, el código de nivel 1 valida el resultado, y si la validación falla, solo entonces se reintenta con el frontera. En vez de pagar 210 dólares al mes, se pagan entre 4 y 15 dólares. La calidad final es equivalente porque los fallos del ligero se cazan y se reprocesan.
Esta estructura, "primero el barato, luego el caro solo cuando el barato falla", es el patrón central de la Escala Semántica. Se llama fallback ascendente y es donde vive la mayor parte del ahorro real.
Cuándo la responsabilidad obliga a subir a nivel 6
Bajar de nivel ahorra dinero. Subir de nivel cubre responsabilidad. Los dos movimientos son legítimos, pero se justifican por criterios distintos.
Un flujo automatizado se lleva al nivel 6 (revisión humana obligatoria) cuando concurre al menos uno de estos tres factores:
- Consecuencia legal directa del output. Contratos, dictámenes jurídicos, comunicaciones oficiales a la Administración, informes que van firmados. Si el texto genera obligación o extingue derecho, no puede salir sin firma humana.
- Consecuencia económica no reversible por encima de un umbral. Pagos, transferencias, aprobaciones de crédito, autorizaciones de gasto. El umbral se define por política interna, pero por debajo de 500 euros muchas empresas asumen el automatismo; por encima de 3 000 casi ninguna lo asume ya.
- Consecuencia clínica o de seguridad. Diagnóstico médico, dosificación, informe de seguridad estructural, dictamen técnico que condiciona intervención sobre un paciente o una obra. La automatización pura queda descartada por marco regulatorio, no por criterio empresarial.
Fuera de esos tres, subir al nivel 6 suele ser un exceso de precaución que consume horas de personal sin ganancia real. Un caso típico: revisar manualmente los resúmenes de emails que la IA genera para el CRM. Si el resumen es incorrecto, se corrige al leer el email original. El error no genera consecuencia. La revisión sistemática consume una hora al día del comercial. Ganancia neta: negativa.
Regla: el nivel 6 se justifica por la magnitud y la irreversibilidad de la consecuencia del error, no por el nerviosismo del arquitecto de sistemas.
También hay una ruta inversa. Muchos flujos empiezan en nivel 6 y bajan a nivel 5 cuando la organización acumula histórico suficiente para confiar. Un despacho de abogados que en los primeros seis meses revisa el 100% de los borradores generados por LLM puede pasar, con evidencia de que la tasa de error es inferior al 2% en cierto tipo de escrito, a revisar solo una muestra del 10%. La revisión no desaparece, se muestrea.
Por qué el nivel 7 no desaparece
Existe una fantasía recurrente en las presentaciones de arquitectura de IA: el flujo end-to-end sin humano en ningún nodo. El documento entra, el sistema decide, la respuesta sale, el cliente recibe. Cero fricción. Cero coste humano.
No.
El nivel 7 no desaparece por cuatro razones estructurales.
La primera: hay decisiones que la organización no puede delegar sin destruir su propia legitimidad. Contratar y despedir. Aceptar y rechazar clientes. Fijar precio estratégico. Cambiar de socio. Litigar o transigir. Estas decisiones tienen componente político, ético y relacional. Si se automatizan, la organización pierde autoridad interna y externa. Nadie firma un contrato de 200 000 euros al año con un proveedor cuya decisión de aceptarle la ha tomado un LLM sin humano detrás.
La segunda: hay decisiones que son irreversibles y de baja frecuencia. No merece la pena automatizarlas. El coste de diseñar, probar, mantener y auditar un sistema para tomar una decisión que ocurre dos veces al año supera con creces el coste de que dos personas se sienten una tarde y decidan.
La tercera: hay tareas donde el valor está en el proceso humano, no en el resultado. Una entrevista de salida a un empleado que se va. Una llamada de disculpa a un cliente enfadado. Una negociación de renovación con un socio antiguo. Si se automatiza, el resultado formal aparece, pero el valor relacional que justificaba la tarea desaparece. La tarea deja de cumplir su función.
La cuarta: hay riesgos que ninguna aseguradora cubre si el proceso es automático. Diagnóstico crítico, decisión de administrar cierto medicamento, aprobación de una intervención quirúrgica, dictamen estructural sobre un edificio con ocupación. La aseguradora exige firma humana identificable. Sin ella, no hay póliza.
Consecuencia práctica: el nivel 7 se estrecha, pero permanece. Un flujo bien diseñado no elimina las decisiones humanas puras. Las concentra en menos personas, con más contexto y mejor información previa preparada por los niveles 1 a 6. Eso es lo que baja el coste sin destruir la responsabilidad.
Checklist para diseñar la Escala Semántica en tu flujo
Este es el procedimiento operativo, condensado. Se aplica a cualquier flujo empresarial que hoy tenga IA cara y quiera bajar el coste sin perder calidad.
- Listar todas las tareas atómicas del flujo. Una tarea atómica es la unidad más pequeña que produce un output verificable. No "procesar factura", sino "extraer NIF", "validar NIF", "mapear NIF a proveedor", "extraer importe", "validar aritmética". Si una tarea del listado tiene más de una salida, no está atomizada aún.
- Para cada tarea, escribir el criterio de éxito en una frase. Si no se puede escribir en una frase, la tarea sigue sin estar bien delimitada.
- Preguntar: ¿existe un patrón formal, una fórmula o una regla cerrada que resuelva la tarea? Si la respuesta es sí, la tarea es nivel 1. Prohibido subir.
- Preguntar: ¿existe una tabla, un diccionario o un mapa de conocimiento que resuelva la tarea con un lookup? Si la respuesta es sí y la tabla se puede construir y mantener, la tarea es nivel 2.
- Preguntar: ¿tengo datos etiquetados históricos suficientes para entrenar un clasificador propio? Si la respuesta es sí y la tarea es de clasificación o similitud, la tarea es nivel 3.
- Preguntar: ¿la tarea es de extracción estructurada, clasificación con prompt, resumen corto o reescritura simple? Si es sí y el volumen justifica el coste, es nivel 4. Con fallback a nivel 5 solo cuando el nivel 4 falla la validación.
- Preguntar: ¿la tarea exige razonamiento multipaso, contexto largo, redacción compleja o código no trivial? Si es sí, nivel 5.
- Preguntar: ¿el error tiene consecuencia legal, económica irreversible o clínica? Si es sí, añadir revisión humana obligatoria al final del nivel 5, resultado nivel 6.
- Preguntar: ¿la decisión define política de la organización, relación con persona o riesgo asegurativo? Si es sí, la tarea no se automatiza. Nivel 7.
- Medir el coste real por consulta y por mes de cada tarea del flujo. No estimar, medir. Con logs de tokens si es LLM, con tiempo de ejecución si es código propio, con tiempo humano si hay revisión. Sin métrica, la escala se degrada porque nadie sabe si sube o baja.
Aplicar este checklist a un flujo existente lleva entre dos y cinco jornadas de trabajo, en función del número de tareas atómicas y del acceso a los datos de coste. El resultado típico en asesorías, despachos y empresas de servicios administrativos es una reducción del 55% al 80% de la factura de IA sin pérdida medible de calidad final.
Errores frecuentes al implementar la Escala Semántica
La teoría es simple. La ejecución tiene trampas conocidas.
- Error 1: subir al LLM por defecto porque "es más moderno". Síntoma: la primera versión del flujo usa LLM frontera para todo, incluida validación de formato. Solución: aplicar el checklist de arriba con disciplina. Ninguna tarea sube de nivel si el nivel inferior la resuelve.
- Error 2: usar LLM frontera para clasificación cerrada. Síntoma: la tarea es asignar una etiqueta de un conjunto finito (por ejemplo, categoría de gasto entre 42 opciones) y se resuelve pidiendo al LLM que elija una. Solución: si hay datos históricos etiquetados, entrenar un clasificador de nivel 3. Si no los hay aún, usar LLM ligero mientras se acumulan, y bajar a nivel 3 cuando haya 3 000 ejemplos etiquetados.
- Error 3: prompts largos con contexto que se repite en cada llamada. Síntoma: cada llamada al LLM incluye 8 000 tokens de instrucciones y ejemplos que no cambian. Solución: cache de prompts si el proveedor lo soporta (rebaja el coste de la parte cacheada al 10%-25%), o migración a un modelo con esquema JSON forzado que reduzca las instrucciones a la mitad.
- Error 4: revisar humanamente todo por precaución. Síntoma: el flujo pasa por revisión humana en todos los pasos, incluida la validación de NIF. Cansancio garantizado. Solución: aplicar el criterio de nivel 6 solo donde hay consecuencia legal, económica irreversible o clínica. En el resto, muestreo aleatorio del 5% al 10% para control de calidad, sin bloqueo del flujo.
- Error 5: no medir el coste por consulta. Síntoma: al final del mes llega la factura del proveedor de LLM y sorprende. Nadie sabe qué tarea consumió qué. Solución: instrumentar el flujo desde el primer día con contador de tokens por tarea, guardar en base de datos, revisar semanalmente. Sin métrica, la escala se degrada.
- Error 6: ignorar la latencia percibida. Síntoma: el flujo es barato pero tarda 40 segundos por documento porque encadena seis llamadas a LLM en serie. Solución: paralelizar las llamadas independientes, usar modelos ligeros para las tareas de alto volumen, dejar el modelo frontera solo para lo que exige razonamiento. La latencia baja de 40 segundos a 6 sin tocar el coste.
Preguntas frecuentes
¿Cuánto tiempo lleva rediseñar un flujo con la Escala Semántica?
Entre dos y cinco jornadas de trabajo para un flujo de 8 a 15 tareas atómicas, si hay acceso a los datos de coste y a los logs. El resultado se ve en la primera factura del proveedor de LLM tras el despliegue.
¿La Escala Semántica sirve para flujos de generación de contenido, no solo de procesamiento?
Sí. La misma lógica aplica. Un blog automatizado, por ejemplo, puede resolver la investigación de fuentes con búsqueda vectorial (nivel 3), el borrador con LLM ligero (nivel 4), la revisión estilística con LLM frontera (nivel 5) y la aprobación final con humano (nivel 6). No hace falta usar el modelo más caro en cada paso.
¿Qué modelos concretos entran en la categoría de LLM ligero en 2026?
Claude Haiku, GPT-4o mini, Gemini Flash, Mistral Small, Llama 3.1 8B y equivalentes autoalojados. La categoría se define por precio (por debajo de 1 dólar por millón de tokens de entrada) y por perfil de tarea (extracción, clasificación con prompt, resumen corto), no por proveedor.
¿Cómo se justifica ante dirección la inversión de rediseñar un flujo que ya funciona?
Con el número. Si el flujo actual gasta 8 000 euros al mes en tokens de LLM y el rediseño lo baja a 1 400 euros al mes sin pérdida de calidad medible, la inversión de rediseño (entre 6 000 y 15 000 euros según rangos habituales de mercado publicados por Vertebra Gestión y ASD Solutions) se amortiza en menos de tres meses.
¿La Escala Semántica se puede aplicar sin equipo técnico interno?
Se puede diseñar sin equipo interno; se debe implementar con alguien que sepa programar. Diseñar la escala es analizar el flujo y decidir el nivel de cada tarea. Implementarla es escribir el código de nivel 1 y 2, entrenar los modelos de nivel 3 si los hay, integrar las llamadas a LLM y montar los controles humanos. La primera parte se hace en un taller de trabajo; la segunda requiere días o semanas de desarrollo.
¿Qué pasa si un proveedor de LLM sube precios o retira un modelo?
Si la escala está bien diseñada, cambiar de proveedor de LLM ligero afecta solo al 30%-40% del flujo. El resto (código determinista, tablas, modelos clásicos, revisión humana) es independiente del proveedor. Esa es una de las razones por las que la Escala Semántica reduce riesgo, no solo coste.
Cierre
La factura de IA en las empresas de servicios no crece por culpa de los proveedores. Crece porque el diseño usa el mismo mecanismo caro para todas las tareas del flujo. Cambiar eso no exige nueva tecnología ni negociar tarifas mejores. Exige mirar cada tarea del flujo y decidir qué nivel necesita, ni uno más.
Los siete niveles no son un modelo teórico. Son una regla operativa que se aplica en dos jornadas de trabajo por flujo y baja la factura entre un 55% y un 80% en la primera facturación posterior. La calidad final no cae porque los fallos de los niveles baratos se cazan por código y se reprocesan solo cuando hace falta. La responsabilidad no se degrada porque los pasos con consecuencia legal, económica o clínica se mantienen en nivel 6 o 7. Y las decisiones humanas puras siguen ocurriendo donde deben ocurrir, con menos ruido alrededor porque los seis niveles anteriores ya han filtrado lo que no exigía juicio humano.
Si tu flujo actual con IA está en el rango de 3 000 a 40 000 euros mensuales de factura de tokens y crece sin control claro, la Escala Semántica es el camino más corto para bajarla sin perder funcionalidad. Puedes profundizar en el método en /escala-semantica o reservar una sesión de 30 minutos para revisar tu flujo actual, listar sus tareas atómicas y estimar el ahorro concreto que aplicaría en tu caso. Sin coste.
Lecturas relacionadas

