• Fecha de publicación
    29 de julio de 2026
  • Compartir
Ekran Resmi 2026-07-29 11.46.53.png

Separando la inteligencia probabilística de la ejecución determinista

En los últimos dos años, el desarrollo de la IA agente se ha centrado principalmente en la orquestación: la llamada a herramientas, la ejecución de flujos de trabajo, la coordinación multiagente, la gestión de memoria y la ejecución autónoma de tareas. Marcos de trabajo modernos como LangGraph, AutoGen y estándares de interoperabilidad como el Protocolo de Contexto de Modelo (MCP) están ampliando rápidamente las capacidades operativas de los sistemas de IA.

Sin embargo, a medida que estos sistemas pasan de las demostraciones a entornos empresariales regulados, se hace cada vez más evidente una limitación estructural: la mayoría de las arquitecturas de agentes actuales optimizan la generación de acciones, no la validez de las decisiones.

Los sistemas existentes son muy eficaces para producir acciones plausibles, pero aún carecen de mecanismos nativos para:

  • ejecución de decisiones deterministas,
  • aplicación de políticas en tiempo de ejecución,
  • planificación consciente de las restricciones,
  • gestión del estado del gráfico contextual,
  • y razonamiento operativo auditable.

Esta limitación se vuelve crucial en ámbitos como las finanzas, la atención médica, la energía y las operaciones empresariales con un alto componente de cumplimiento normativo, donde las decisiones deben seguir siendo reproducibles, explicables y compatibles con las políticas en condiciones que cambian constantemente.

El problema no es simplemente de inteligencia. Es arquitectónico.

Ekran Resmi 2026-07-29 11.29.53.png

Esta brecha arquitectónica pone de manifiesto una capa que falta en los sistemas de agentes modernos: una infraestructura de decisiones con restricciones de política capaz de separar la inteligencia probabilística de la ejecución determinista.

El contexto no es memoria

La mayoría de los sistemas de agentes actuales tratan el contexto principalmente como historial de conversaciones, documentos recuperados o resultados de similitud vectorial. Este enfoque funciona razonablemente bien para tareas conversacionales, pero los sistemas operativos requieren un tipo de gestión de contexto fundamentalmente diferente.

Ekran Resmi 2026-07-29 11.45.34.png

En entornos reales, las decisiones dependen no solo de la información recuperada, sino también de:

  • relaciones entre entidades,
  • estructura organizativa,
  • eventos temporales,
  • cadenas de propiedad, 
  • decisiones anteriores,
  • restricciones activas,
  • y estado operativo en continua evolución [1]. 

Un cliente no es solo un documento. Una empresa no es solo un fragmento de texto. Un evento regulatorio no es simplemente otro resultado de búsqueda. Los sistemas operativos requieren un modelo de estado en constante evolución. Aquí es donde la distinción entre memoria y contexto operativo se vuelve crucial.

La memoria almacena información. El contexto operativo mantiene el estado del sistema.

En la práctica, esto significa que el sistema debe mantener y actualizar continuamente estructuras como entidades, relaciones, cadenas de eventos temporales, vinculaciones de políticas e historial de ejecución. Esta es una de las razones por las que los enfoques basados ​​en grafos están adquiriendo cada vez más importancia en los sistemas de agentes.

Un grafo no solo es útil para la recuperación de información. Proporciona una representación en tiempo de ejecución del estado operativo. En lugar de tratar el contexto como fragmentos de texto aislados, el sistema puede razonar sobre entidades conectadas, relaciones en evolución, dependencias temporales y rutas de propagación contextual. Esto cambia por completo el papel del grafo. El grafo deja de ser una capa de almacenamiento y se convierte en:

  • memoria contextual,
  • representación estatal operativa,
  • y el contexto de ejecución para los sistemas de decisión.

    Ekran Resmi 2026-07-29 11.49.13.png

    A medida que los sistemas de agentes avanzan hacia operaciones autónomas, esta distinción se vuelve cada vez más importante. Porque la ejecución autónoma requiere no solo la recuperación de información, sino también la gestión continua del estado contextual[4].

Las políticas no pueden permanecer como documentos.

Ekran Resmi 2026-07-29 11.46.01.png

Imaginemos a un agente de disputas gestionando una solicitud de reembolso. El cliente alega que la transacción fue fraudulenta. La transacción se realizó desde un dispositivo de confianza. El comercio tiene una baja calificación de riesgo. A primera vista, el caso parece sencillo. Sin embargo, la transacción se produjo poco después de un restablecimiento de contraseña inusual, el cliente cambió de dispositivo recientemente y la política de fraude del banco exige que se derive el caso a una instancia superior cuando aparecen varias señales de alerta en un corto período de tiempo.

Llegado este punto, la política no puede seguir siendo un PDF. Debe formar parte del fundamento del razonamiento.

En un sistema de agentes operativos, las políticas no deben recuperarse únicamente como texto una vez que el LLM ya haya generado una respuesta. Deben restringir activamente la ejecución: bloqueando ciertas acciones, activando escalamientos, modificando las rutas de aprobación, exigiendo evidencia adicional o impidiendo la resolución automatizada. Esta idea está estrechamente relacionada con enfoques de planificación basados ​​en políticas anteriores, donde la ejecución se moldea continuamente por restricciones, objetivos y condiciones ambientales, en lugar de por una lógica de finalización de tareas aislada [6].

Aquí es donde el contexto operativo basado en grafos se vuelve fundamental.

El gráfico representa el estado de la disputa: cliente, cuenta, transacción, comerciante, dispositivo, evento de restablecimiento de contraseña, indicadores de fraude, decisiones previas, reglas de política e historial de ejecución. Las políticas se conectan a este gráfico como restricciones ejecutables, no como documentos aislados. En muchos sentidos, esto se asemeja a la evolución de los entornos de ejecución multiagente, donde las entidades inteligentes se coordinan a través de un estado operativo compartido continuamente en lugar de intercambios de mensajes aislados [4].

Una capa de razonamiento puede operar sobre este grafo utilizando mecanismos basados ​​en reglas o lógica derivados de sistemas de programación lógica y bases de datos deductivas anteriores [8]. Por ejemplo, una regla similar a Datalog puede indicar que una disputa debe escalarse si una transacción disputada sigue a un restablecimiento de contraseña, involucra un nuevo dispositivo y supera un umbral de riesgo; un enfoque conceptualmente alineado con los sistemas de razonamiento deductivo clásicos y los motores de lógica de bases de datos [9].

El LLM puede interpretar el caso, explicar la decisión e interactuar con los usuarios, pero la condición de la política en sí se evalúa de forma determinista sobre el grafo.

Ekran Resmi 2026-07-29 11.34.57.png

En esta arquitectura, el motor gráfico se convierte en el sustrato operativo, mientras que la capa de razonamiento evalúa las restricciones, obligaciones, permisos y dependencias sobre el estado actual. Esta separación entre el razonamiento probabilístico y la ejecución restringida también evoca modelos de agentes anteriores basados ​​en BDI, donde el comportamiento inteligente surge no solo de los objetivos, sino también de creencias, intenciones, obligaciones y restricciones de ejecución mantenidas continuamente (Rao y Georgeff, 1995).

El cambio clave 

Ekran Resmi 2026-07-29 11.36.06.png

Esto permite que un agente de resolución de disputas autónomo razone no solo sobre lo que sucedió, sino también sobre lo que está permitido, requerido, bloqueado o escalado en cada paso de la ejecución.

Canalizaciones de decisión que tienen en cuenta las restricciones

Ekran Resmi 2026-07-29 11.42.25.png

Una vez que el contexto se convierte en un estado operativo en constante evolución y las políticas se convierten en restricciones ejecutables, el siguiente desafío es la ejecución de las decisiones en sí misma.

En esta etapa, el problema ya no radica en la recuperación de información, sino en el control de decisiones en tiempo de ejecución. La mayoría de los sistemas de agentes actuales siguen funcionando como sistemas de generación de acciones: recuperan el contexto, razonan sobre él, generan una acción y ejecutan el resultado. Sin embargo, los sistemas operativos requieren una capa adicional entre el razonamiento y la ejecución: una cadena de decisiones con restricciones.

Esta distinción es fundamental porque los entornos operativos rara vez contienen una sola acción válida. En cambio, contienen:

  • acciones factibles,
  • acciones prohibidas,
  • acciones intensificadas,
  • acciones demoradas,
  • y acciones permitidas bajo ciertas condiciones.

Por lo tanto, la función del sistema no es solo generar acciones, sino también filtrarlas y validarlas continuamente bajo restricciones de tiempo de ejecución. Un flujo de trabajo simplificado se parece cada vez más a esto: 

Ekran Resmi 2026-07-29 11.38.11.png

Esto modifica la función de varios componentes de la pila. El grafo ya no se utiliza únicamente para la recuperación de datos, sino que se convierte en el estado operativo del sistema en tiempo de ejecución. 

Las políticas ya no son documentación estática. Se convierten en restricciones ejecutables que se evalúan durante la generación de decisiones. El planificador ya no se limita a secuenciar tareas. Se hace responsable de generar acciones operativamente viables bajo restricciones activas.

Esta distinción es importante porque muchos fallos operativos no se originan por falta de información, sino por la selección de acciones incorrectas en condiciones cambiantes.

Por ejemplo:

  • una acción puede violar un límite de autoridad,
  • conflicto con una norma de cumplimiento vigente,
  • desencadenar una secuencia de proceso no válida,
  • o generar riesgos operativos posteriores.

En estos casos, el problema no radica en un fallo de inteligencia, sino en un fallo de restricciones. Por eso, la planificación con restricciones cobra cada vez más importancia en los sistemas autónomos.

En lugar de ejecutar directamente las acciones generadas, el sistema debe:

  • evaluar la viabilidad,
  • podar rutas no válidas,
  • aplicar restricciones de tiempo de ejecución,
  • detectar conflictos,
  • y generar rutas de ejecución alternativas cuando sea necesario.

Conceptualmente, esto acerca los sistemas de agentes modernos a los sistemas de planificación clásicos más que las arquitecturas de IA conversacional tradicionales.

Enfoques como:

  • GraphPlan,
  • sistemas de satisfacción de restricciones,
  • búsqueda heurística,
  • Variantes A*,
  • y algoritmos de replanificación dinámica

Volverán a ser relevantes una vez que los sistemas operen bajo condiciones de ejecución que cambian continuamente.

Ekran Resmi 2026-07-29 11.42.51.png

Sin embargo, a diferencia de los planificadores clásicos, los sistemas operativos modernos también contienen interpretación semántica probabilística, entradas no estructuradas, contexto gráfico en evolución y políticas que cambian dinámicamente.

Como resultado, la arquitectura emergente no es ni puramente simbólica ni puramente probabilística. Se convierte en un modelo de ejecución híbrido donde los modelos de lógica descriptiva interpretan, los grafos mantienen el estado operativo, las restricciones definen los límites de ejecución y los planificadores generan acciones factibles dentro de esos límites.

Esta separación es importante porque permite que los sistemas autónomos mantengan su flexibilidad sin perder el control operativo. El objetivo no es eliminar la inteligencia probabilística.

El objetivo es evitar que el razonamiento probabilístico controle directamente la ejecución operativa sin capas de validación deterministas a su alrededor.

Hacia sistemas autónomos confiables

Una vez que el contexto operativo, las restricciones ejecutables y la planificación restringida se integran en el propio entorno de ejecución, la ejecución autónoma deja de ser un simple problema de orquestación. El sistema opera continuamente en un estado operativo cambiante: las entidades evolucionan, las relaciones cambian, las restricciones se activan o expiran, y la viabilidad de la ejecución varía con el tiempo.

En estas condiciones, la ejecución ya no puede depender únicamente de los resultados generados. El sistema debe reevaluar continuamente el contexto, validar las restricciones, adaptar los planes y mantener la coherencia operativa ante las condiciones cambiantes.

Esto cobra aún mayor importancia a medida que los sistemas de agentes evolucionan, pasando de flujos de trabajo efímeros a operaciones de larga duración orientadas a objetivos. En estos entornos, los objetivos persisten, múltiples agentes interactúan, los límites organizativos son relevantes y las rutas de ejecución evolucionan dinámicamente durante el tiempo de ejecución.

Como resultado, la planificación deja de ser una tarea puntual para convertirse en un proceso operativo continuo. Es aquí donde el estado operativo basado en grafos, las políticas ejecutables y la planificación que tiene en cuenta las restricciones comienzan a converger en una nueva arquitectura de ejecución para sistemas autónomos.

Y con el tiempo, es probable que esta arquitectura introduzca una nueva generación de artefactos operativos:

  • objetivos persistentes inspirados en enfoques de ingeniería de requisitos orientados a objetivos como KAOS [10],
  • roles y responsabilidades organizativas ejecutables similares al modelo organizativo orientado a roles de Gaia para sistemas multiagente [11],
  • estructuras de coordinación adaptativas que se asemejan a enfoques MAS organizacionales como MOISE+ [12],
  •  y patrones organizativos en tiempo de ejecución para sistemas multiagente de largo horizonte explorados en la investigación de lógica organizativa y sistemas multiorganizacionales adaptativos [13][14].

Por lo tanto, la próxima generación de sistemas de IA empresariales podría definirse no por la cantidad de acciones que puedan generar, sino por la fiabilidad con la que puedan mantener un comportamiento coordinado y orientado a objetivos bajo restricciones en constante cambio.

Referencias

1. Hogan, A., Blomqvist, E., Cochez, M., et al. Grafos de conocimiento. ACM Computing Surveys, 2021.

2. Edge, D., et al. De lo local a lo global: un enfoque GraphRAG para la generación de resúmenes centrados en consultas. arXiv, 2024.

3. Nii, HP. El modelo de pizarra para la resolución de problemas y la evolución de las arquitecturas de pizarra. Revista AI, 1986.

4. Wooldridge, M. Introducción a los sistemas multiagente. Wiley, 2009.

5. Ferber, J. Sistemas multiagente: una introducción a la inteligencia artificial distribuida. Addison-Wesley, 1999.

6. Myers, KL. Hacia un marco para la planificación y ejecución continuas. AAAI, 1999.

7. Rao, AS, Georgeff, MP Agentes BDI: De la teoría a la práctica. ICMAS, 1995.

8. Ceri, S., Gottlob, G., Tanca, L. Programación lógica y bases de datos. Springer, 1990.

9. Abiteboul, S., Hull, R., Vianu, V. Fundamentos de bases de datos. Addison-Wesley, 1995.

[10]. van Lamsweerde, A. (2001). Ingeniería de requisitos orientada a objetivos: un recorrido guiado.

[11] Wooldridge, M., Jennings, NR, & Kinny, D. (2000). La metodología Gaia para el análisis y diseño orientado a agentes.

[12] Hannoun, M., Sichman, JS, Boissier, O. y Sayettat, C. (2000). MOISE: un modelo organizativo para sistemas multiagente.

[14] Dignum, V., & Dignum, F. (2018). El papel de los modelos organizacionales en los sistemas de agentes.

[15] Tamersoy, M., Ekinci, EE, Erdur, RC, & Dikenelli, O. (2017). Un modelo de requisitos para sistemas multiorganizacionales adaptativos. SASO 2017.