Modelos de decisión de IA: qué son y cómo usarlos

INTELIGENCIA ARTIFICIAL, BLOG.AUTOMATIZACIÓN.
Ilustración digital: líneas de puntos luminosos atraviesan una compuerta turquesa estrecha sobre un fondo oscuro y salen como tres pistas paralelas.

En resumen: Los modelos de decisión de IA responden preguntas acotadas eligiendo entre opciones predefinidas y devuelven una probabilidad en la que el software puede basarse para actuar. Sus ventajas son la velocidad y el costo. En pruebas independientes, Jev, el modelo de decisión de TypeSafe AI, respondió con una mediana de 148 ms y un costo de USD 0,11 por cada 1.000 solicitudes. Un large language model (LLM) de propósito general, medido en batches en una sola GPU, registró 3.609 ms y USD 1,18. Desde el lanzamiento de Jev, el 15 de septiembre, la categoría se convirtió en un mercado competitivo. Cuando ya existen datos etiquetados, pequeños clasificadores entrenados pueden igualarlos o superarlos, y la redacción de cada pregunta cambia las respuestas. Un modelo de decisión es una etapa en el ciclo de vida de una decisión, junto a las reglas, los clasificadores entrenados y los LLMs.

Esta guía está dirigida a las organizaciones cuyo software enruta solicitudes, clasifica documentos o marca casos para revisión humana. Aborda la velocidad y el costo de los modelos de decisión de IA y los casos en que un clasificador entrenado sigue siendo la mejor opción. También explica cómo una decisión recurrente puede pasar de un enfoque a otro a medida que madura. Una aclaración de terminología: en gestión de procesos, "modelo de decisión" ya designa un modelo en Decision Model and Notation (DMN), que expresa la lógica de decisión en tablas que una persona puede leer regla por regla. En esta guía, "modelo de decisión" se refiere al de IA, y la última sección explica cómo se relacionan.

Qué es un modelo de decisión de IA y qué no es

Un modelo de decisión de IA es un modelo diseñado para hacer un tipo concreto de evaluación dentro del software. Recibe los datos de un caso y una o varias preguntas cuyas respuestas posibles se definen de antemano. Para cada pregunta devuelve un valor tipado: una probabilidad para cada opción, una posición en una escala o la probabilidad de un sí. No genera texto ni explica su razonamiento. Lo que entrega es una respuesta que el software puede almacenar, comparar con un umbral y usar para actuar, en lugar de un texto que haya que interpretar. Por eso los modelos de decisión se adaptan a las evaluaciones acotadas y repetitivas que los procesos de negocio hacen en grandes volúmenes, como enrutar una solicitud, clasificar un documento o determinar si un caso necesita revisión humana.

TypeSafe AI, que lanzó Jev el 15 de septiembre de 2026, los llama modelos System One. El nombre viene de Daniel Kahneman, premio Nobel de Economía, quien llamó Sistema 1 (System 1) al pensamiento rápido y automático, y Sistema 2 (System 2) al pensamiento lento, que exige esfuerzo. Lo expuso en Pensar rápido, pensar despacio, su libro de 2011 sobre cómo piensan y deciden las personas.

Considere, por ejemplo, una solicitud en un proceso de onboarding de clientes. El software le envía al modelo preguntas tipadas definidas en código y un estado: los datos del caso, en este ejemplo el producto solicitado, los documentos recibidos y la nota que acompaña la solicitud. El modelo devuelve un valor por pregunta.

Los modelos de decisión admiten estos tipos de pregunta:

  • Choice: elige una de hasta 255 opciones predefinidas y asigna una probabilidad a cada una. Cada opción tiene un nombre y, de forma opcional, una descripción en lenguaje natural.

  • Score: ubica el caso en una escala de 2 a 10 niveles, descritos en la pregunta.

  • Sí/no: devuelve una sola probabilidad. La pregunta puede describir qué significan el sí y el no. La API de Jev llama a este tipo "noul".

La probabilidad está diseñada para estar calibrada: los resultados a los que se asigna una probabilidad de 0,2 deberían ocurrir cerca del 20% de las veces. TypeSafe lo presenta como una propiedad del conjunto de muchas respuestas, no como una promesa sobre cada respuesta individual, y su documentación no publica ninguna cifra medida.

Un modelo de decisión devuelve valores tipados, no texto: un siguiente paso con una probabilidad por opción, un puntaje de completitud y una probabilidad de sí/no, con valores ilustrativos
Un modelo de decisión devuelve valores tipados, no texto: un siguiente paso con una probabilidad por opción, un puntaje de completitud y una probabilidad de sí/no, con valores ilustrativos

El término System One describe lo que devuelve un modelo, no cómo está construido, y desde entonces otros proveedores han lanzado sus propios modelos de decisión. Strands Decider 2B, de AWS, es un modelo de lenguaje de 2.000 millones de parámetros cuya salida de texto se reemplaza por una capa final que califica cada opción. Laya, de Convai Innovations, construye su checkpoint en inglés (una versión entrenada del modelo) sobre ModernBERT, un modelo mucho más pequeño, de 421 millones de parámetros.

La consultora HatchWorks distingue entre una respuesta válida, una respuesta correcta y una acción autorizada, que se confunden con facilidad. Por diseño, un modelo de decisión solo puede devolver una de las opciones que recibió, así que sus respuestas son válidas. Una evaluación con los datos de la propia organización muestra si son correctas, y las políticas y las personas de la organización deciden si el sistema puede actuar con base en ellas.

Un modelo de decisión también se diferencia de un clasificador entrenado. Un clasificador entrenado aprende sus categorías de las etiquetas de una sola tarea, es decir, de casos anteriores marcados con la respuesta correcta, y hay que reentrenarlo cuando esas categorías cambian. Un modelo de decisión, en cambio, recibe sus opciones en lenguaje natural con cada solicitud y puede responder varias preguntas en una sola llamada.

Modelo de decisión vs. LLM: velocidad, costo y salida

Los modelos de decisión tienen una ventaja clara en velocidad y costo. Un equipo de investigación de Texas State University comparó Jev con un LLM de propósito general en pruebas independientes, publicadas como preprint y todavía sin revisión por pares. La comparación se hizo en clasificación de intenciones, una tarea que ordena las solicitudes según lo que quiere quien las envía. Cuando la respuesta del LLM se leyó a partir de la probabilidad que asignaba a cada opción, el LLM igualó la exactitud (accuracy) de Jev: 0,912 frente a 0,913. Sin embargo, tardó considerablemente más y costó más por solicitud. La tabla compara un modelo de decisión con un LLM:

Modelo de decisión de IA

Large language model

Qué puede responder

Solo las preguntas y opciones definidas de antemano

Preguntas abiertas, planes y texto

Qué devuelve

Un valor tipado por pregunta, entre las opciones definidas

Texto que la aplicación debe parsear, incluso en modo JSON, que restringe el formato pero sigue devolviendo texto

Confianza

Una probabilidad por opción, diseñada para estar calibrada en el conjunto de las respuestas

La declara en su respuesta si se le pide, o se obtiene de la probabilidad que asigna a cada opción

Explicación

Ninguna: no devuelve texto y no hay una regla que citar

En palabras

Velocidad en una prueba

Mediana de 148 ms, Jev a través de su API

Mediana de 3.609 ms, un modelo de 27.000 millones de parámetros medido en batches en una GPU A100

Costo en una prueba

USD 0,11 por 1.000 solicitudes, al precio de lista de Jev

USD 1,18 por 1.000 solicitudes, con una tarifa por hora supuesta para esa GPU

Cifras de velocidad y costo tomadas de esas pruebas. Las cifras del LLM se prorratean por batch: el tiempo y el costo de cada batch se reparten entre sus solicitudes. Cada columna se midió de forma distinta, así que las cifras no deben dividirse entre sí para obtener una proporción.

TypeSafe anuncia que Jev es 193,6 veces más rápido y 444,6 veces más económico que los LLMs en sus propios workflows. No identifica los modelos con los que comparó, ejecuta los LLMs a través de su propio wrapper y prevé que estas cifras se ubiquen en el extremo superior de las mejoras que se obtienen en la práctica. Kai Waehner, especialista independiente en arquitectura empresarial, espera un ahorro de costos de alrededor de un orden de magnitud en un sistema completo.

Qué modelos de decisión de IA están disponibles y cómo acceder a ellos

La tabla reúne los modelos de decisión lanzados hasta comienzos de octubre; cada uno enlaza a la página de su proveedor:

Modelo

Proveedor

Lanzamiento

Acceso

Qué lo distingue

Jev

TypeSafe AI

15 de septiembre

Early access, API alojada

USD 0,042 por millón de tokens de entrada, salida gratuita; 70–500 ms medidos por TypeSafe desde la costa oeste de Estados Unidos

Kev

Jared Palmer, quien dirigió el área de IA de Vercel

17 de septiembre; Kev 1.0, el 1 de octubre

Pesos (weights) con licencia Apache 2.0, de 800 millones a 27.000 millones de parámetros

Acepta el formato de solicitud de Jev

Laya

Convai Innovations

18 de septiembre, creación del repositorio

Pesos con licencia Apache 2.0; se aloja en infraestructura propia

Checkpoints en inglés y multilingües; de 33 a 40 ms por pregunta en una GPU Tesla T4; diseñado para ajustarse a cada tarea con fine-tuning

Decisions API

OpenAI

29 de septiembre

Preview limitada

Funciona con el modelo Luna de OpenAI; acepta texto o imágenes como contexto; sin documentación ni precios públicos en sus primeros días

Strands Decider 2B

AWS Strands Labs

1 de octubre

Descargable, con datos y scripts de entrenamiento

Mediana de unos 115 ms en una GPU RTX 3090

Clef, Clef-flash

Cloudflare

1 de octubre

Pesos con licencia Apache 2.0; alojados en Workers AI, de Cloudflare

Admite imágenes y el formato de solicitud de Jev

Un directorio de la comunidad reúne más de una docena. Todas las cifras son las que publica cada proveedor.

Kai Waehner señala que varias plataformas añadieron acceso a Jev antes del 25 de septiembre. Sin embargo, la disponibilidad no muestra si las respuestas de un modelo son correctas para un proceso de negocio concreto.

Qué determina los resultados en la práctica: datos etiquetados, calibración, diseño de las preguntas y costo

Según las mismas pruebas independientes, estos factores determinan qué tan bien funciona un modelo de decisión en un entorno empresarial. Las pruebas evaluaron modelos de decisión como Jev, Laya y Kev, aunque no todos los modelos de la tabla anterior formaron parte de ellas. Las cifras se refieren principalmente a Jev:

  1. Historial etiquetado. Cuando una tarea ya tiene historial etiquetado, pequeños clasificadores entrenados pueden ser más exactos: 0,948 y 0,940 en clasificación de intenciones, frente a 0,913 de Jev. En decisiones de workflows de negocio, la diferencia no fue significativa.

  2. Calibración. Las probabilidades que resultaron confiables en una tarea no lo fueron en otra, así que cada tarea necesita sus propios umbrales.

  3. Diseño de las preguntas. El software solo actúa según una respuesta cuando su probabilidad supera un umbral. Las solicitudes fuera del alcance son las que no encajan en ninguna de las opciones. El umbral se fijó para un 5% de errores en las solicitudes dentro del alcance, y aun así Jev aceptó el 31% de las solicitudes fuera del alcance: asignó cada una a una opción con una probabilidad superior al umbral. El rango de incertidumbre reportado para esa cifra va de 14% a 50%. Añadir una opción explícita "ninguna de las anteriores" redujo ese 31% a 19,5%. En preguntas de workflows de negocio, se intercambiaron los nombres de las opciones sí y no para que cada uno contradijera su descripción escrita, y cerca de la mitad de las respuestas cambió.

  4. Estructura de costos. Una cascada puede reducir el costo: un modelo de decisión pequeño, con fine-tuning sobre los datos etiquetados de la tarea (no un clasificador), le pasó a Jev solo los casos en que tenía dudas. La cascada igualó la exactitud de Jev con el 43% del costo de usar solo Jev. Este resultado se limita a la clasificación de intenciones y supone GPUs usadas a plena capacidad.

Los datos etiquetados y la redacción de las preguntas afectan los resultados: los clasificadores entrenados superaron a Jev en clasificación de intenciones, una cascada entrenada con etiquetas lo igualó con el 43% del costo de Jev y una opción "ninguna" redujo la aceptación de solicitudes fuera del alcance de 31% a 19,5%, en pruebas independientes con un solo benchmark
Los datos etiquetados y la redacción de las preguntas afectan los resultados: los clasificadores entrenados superaron a Jev en clasificación de intenciones, una cascada entrenada con etiquetas lo igualó con el 43% del costo de Jev y una opción "ninguna" redujo la aceptación de solicitudes fuera del alcance de 31% a 19,5%, en pruebas independientes con un solo benchmark

Dónde encajan los modelos de decisión de IA: una etapa en el ciclo de vida de una decisión

Las reglas, los clasificadores entrenados, los modelos de decisión y los LLMs pueden tomar decisiones en el software, cada uno con sus propias limitaciones:

Enfoque

Más adecuado cuando

Limitaciones

Reglas y tablas de decisión DMN

La lógica se puede poner por escrito y debe explicarse regla por regla

No pueden evaluar texto libre

Clasificador entrenado

La decisión es estable, de alto volumen y tiene historial etiquetado

Requiere etiquetas, y reentrenamiento cuando cambian las categorías

Modelo de decisión

Las opciones o sus definiciones cambian a menudo y todavía no hay etiquetas para entrenar

No hay una regla que citar; la calibración varía según la tarea

Large language model

La salida es lenguaje, un plan o una explicación

Más lento y más costoso por decisión

Resumen de la comparación de Kai Waehner.

Estos enfoques funcionan mejor como etapas del ciclo de vida de una decisión que como alternativas que compiten entre sí. Una decisión nueva empieza con un modelo de decisión, porque todavía no hay etiquetas con las que entrenar. Cada respuesta queda registrada, y las que las personas confirman o corrigen se convierten en etiquetas.

Cuando la decisión se estabiliza, sus casos rutinarios pasan a un clasificador entrenado, que es menos costoso. Un LLM se encarga de los casos en los que tanto el modelo de decisión como el clasificador tienen dudas, y las reglas asumen la lógica que ha demostrado ser fija.

Las decisiones que deben explicarse regla por regla, como las de crédito o elegibilidad, siguen en manos de una persona o de una tabla de decisión DMN.

Una decisión pasa por etapas: primero un modelo de decisión, un clasificador entrenado cuando ya hay etiquetas, un LLM para los casos inciertos y reglas para lo que resultó ser fijo
Una decisión pasa por etapas: primero un modelo de decisión, un clasificador entrenado cuando ya hay etiquetas, un LLM para los casos inciertos y reglas para lo que resultó ser fijo

Cómo verifica un modelo de decisión las acciones de un agente de IA antes de ejecutarlas

Dentro de un agente de IA, un modelo de decisión puede verificar cada acción antes de que se ejecute. Siguiendo la idea de Kahneman, el LLM cumple el papel de System Two, su Sistema 2: interpreta el objetivo, planifica y redacta. El modelo de decisión cumple el papel de System One y responde las preguntas acotadas y repetitivas.

AWS Strands Labs ilustra el patrón con un ejemplo sencillo. Antes de que un agente llame a una herramienta del clima con una ciudad que no aparece en la conversación, Strands Decider 2B verifica si los argumentos de la llamada se basan en la conversación. Así, el agente le pide a quien lo usa la información que falta, en lugar de adivinarla.

El modelo de decisión verifica y la política decide: antes de llamar a una herramienta, preguntas de sí/no determinan si el agente continúa o le pregunta a quien lo usa, en el ejemplo de AWS Strands Labs
El modelo de decisión verifica y la política decide: antes de llamar a una herramienta, preguntas de sí/no determinan si el agente continúa o le pregunta a quien lo usa, en el ejemplo de AWS Strands Labs

Cómo usar un modelo de decisión de IA

Esta sección muestra cómo ejecutar un modelo de decisión como servidor, enviarle preguntas y actuar según sus respuestas. El ejemplo usa Strands Decider 2B, de AWS, porque está disponible para descarga pública, mientras que Jev está en early access. Los equipos instalan el modelo y lo ejecutan como servidor local:

pip install strands-decider strands-agents strands-decider serve StrandsAgents/strands-decider-2B-hobson-v21 --port 8000

Las preguntas se envían al servidor por HTTP. Cada pregunta especifica un tipo (noul, choice o score) e instrucciones; las preguntas de tipo choice y score también enumeran sus opciones, en un campo llamado criteria. El formato de solicitud sigue la API pública de Jev, que Kev y Clef también aceptan, aunque AWS no ha verificado la compatibilidad con la API de Jev. AWS documenta el servidor solo para experimentos locales: no tiene autenticación, y AWS todavía no ofrece una versión alojada.

En un agente construido con el Strands Agents SDK de AWS, un handler puede revisar cada llamada a una herramienta (tool call) antes de que se ejecute y devolver una acción como Proceed, Guide, Deny o Confirm. Confirm pausa la llamada hasta que una persona la apruebe. A modo de ilustración, este es un control de activación para el onboarding:

from strands import Agent from strands.interventions import Confirm, Guide, InterventionHandler, Proceed class ActivationGate(InterventionHandler): name = "activation-gate" def before_tool_call(self, event, **kwargs): if event.tool_use["name"] != "activate_account": return Proceed() answers = ask_decider(event) # POST /v1/systemone: dos preguntas de sí/no verified = answers["documents_verified"]["noul"] outside_scope = answers["outside_scope"]["noul"] if verified >= 0.9 and outside_scope < 0.5: # umbrales ilustrativos return Proceed() if verified >= 0.5: return Confirm(prompt="¿Aprobar la activación de esta cuenta?") return Guide(feedback="Pida primero a la persona solicitante los documentos que faltan.") agent = Agent(tools=[activate_account], interventions=[ActivationGate()])

El modelo de decisión evalúa y el handler decide: la activación continúa cuando los documentos están claramente verificados, espera a una persona cuando hay dudas y vuelve a pedir los documentos cuando no lo están, con umbrales ilustrativos
El modelo de decisión evalúa y el handler decide: la activación continúa cuando los documentos están claramente verificados, espera a una persona cuando hay dudas y vuelve a pedir los documentos cuando no lo están, con umbrales ilustrativos

ask_decider representa un cliente HTTP corto; el ejemplo completo de AWS incluye uno en su repositorio. El LLM del propio agente se ejecuta en Amazon Bedrock, de AWS, lo que requiere credenciales de AWS con acceso a Bedrock. Los umbrales son ilustrativos: la documentación de AWS toma prestados los umbrales de ejemplo de Jev (actuar desde 0,9 y pedir confirmación desde 0,5) y recomienda que cada equipo mida los suyos. Al cambiar de modelo, vuelva a revisar los umbrales.

Sea cual sea el modelo que adopte una organización, la probabilidad permite decidir de antemano en qué respuestas puede basarse el software para actuar sin revisión humana:

Preguntas frecuentes

¿Qué tan rápidos son los modelos de decisión de IA y cuánto cuestan?

TypeSafe publica para Jev un precio de USD 0,042 por millón de tokens de entrada, sin costo por la salida, y un tiempo de 70 a 500 ms por llamada, medido desde la costa oeste de Estados Unidos. En pruebas independientes, Jev respondió con una mediana de 148 ms y un costo de USD 0,11 por cada 1.000 solicitudes. Un LLM de propósito general, medido en batches en una GPU A100, registró 3.609 ms y USD 1,18. Ejecutado en local, Strands Decider 2B, de AWS, responde en unos 115 ms en una GPU RTX 3090, según AWS. En un sistema completo, Kai Waehner espera un ahorro de costos de alrededor de un orden de magnitud.

¿Los modelos de decisión de IA son simplemente clasificadores?

No exactamente. Un modelo de decisión recibe sus opciones con cada solicitud, en lugar de aprenderlas de etiquetas. Cuando ya hay historial etiquetado, un pequeño clasificador entrenado puede superar a un modelo de decisión en clasificación de intenciones.

¿Los modelos de decisión reemplazan a los LLMs o a los agentes de IA?

No. Se encargan de las evaluaciones acotadas y repetitivas dentro de un agente o de un workflow, y le dejan al LLM el razonamiento, la planificación y la redacción.

¿Por qué no usar el modo JSON de un LLM?

Porque, para actuar según una respuesta, se necesita un nivel de confianza. El modo JSON y otros modos de salida estructurada (structured outputs) restringen lo que un LLM puede escribir, pero el LLM sigue produciendo texto. Un modelo de decisión devuelve una probabilidad por opción, diseñada para estar calibrada en el conjunto de las respuestas. Un LLM solo indica una probabilidad en su respuesta cuando se le pide, y su texto tiene que coincidir con lo que espera el software. En pruebas independientes, cuando se le pidió a un LLM responder en JSON, 160 de 600 respuestas no se ajustaron al formato esperado. En ambos casos, una respuesta elegida entre las opciones definidas aún puede ser incorrecta, y las pruebas con los datos de la propia organización muestran con qué frecuencia ocurre.

¿Los modelos de decisión funcionan en español?

Requieren una validación previa. Las cifras que cita esta guía provienen de datos en inglés. El checkpoint multilingüe de Laya cubre más de 100 idiomas, según su model card. Sin embargo, el equipo que desarrolló Laya encontró que el checkpoint en inglés podía mantener una confianza alta aun cuando fallaba con algunas entradas que no estaban en inglés. Para otros idiomas, Jared Palmer, quien mantiene Kev, recomienda un fine-tuning breve con las etiquetas de la propia organización.

¿Puede un modelo de decisión explicar su respuesta?

No. Devuelve un valor por pregunta y ningún texto, y su lógica es aprendida, así que no hay ninguna regla que citar.

¿Qué diferencia hay entre un modelo de decisión de IA y DMN?

Decision Model and Notation (DMN) expresa la lógica de decisión en tablas que una persona puede leer regla por regla. Un modelo de decisión, en cambio, aprende su criterio y devuelve una probabilidad.

Cómo los modelos de decisión llevan la automatización agéntica a los procesos de negocio

La pregunta para cada organización es dónde corresponde hoy cada decisión: en reglas, en un clasificador entrenado, en un modelo de decisión o en un LLM. En un proceso de negocio, un modelo de decisión de IA y una tabla DMN pueden compartir un mismo paso de decisión: el modelo interpreta la entrada no estructurada y la tabla determina qué puede desencadenar cada respuesta. Así es como la automatización tradicional de procesos se convierte en un sistema agéntico, decisión por decisión. Aplyca llama a esto gestión agéntica de procesos de negocio, o BPM agéntico: IA integrada en los procesos de negocio, dentro de los límites que define la organización y con aprobación humana en las decisiones de mayor impacto. El proceso pregunta, un modelo de decisión responde y, según la confianza de la respuesta, el motor de procesos actúa en consecuencia, pasa el caso a un LLM o lo enruta a una persona. Al precio de lista de Jev, una respuesta cuesta alrededor de una centésima de centavo de dólar, lo que hace asequible incluir una en cada paso de un proceso. Aplyca ayuda a las organizaciones a hacer esta transición y a llevar la orquestación de procesos más allá de las reglas fijas.

Hable con Aplyca sobre cómo llevar la automatización de sus procesos de las reglas a los sistemas agénticos