• Date de publication
    29 juillet 2026
  • Share
Ekran Resmi 2026-07-29 11.46.53.png

Séparer l'intelligence probabiliste de l'exécution déterministe

Ces deux dernières années, le développement de l'IA agentielle s'est principalement concentré sur l'orchestration : appel d'outils, exécution de flux de travail, coordination multi-agents, gestion de la mémoire et exécution autonome des tâches. Les frameworks modernes tels que LangGraph et AutoGen, ainsi que les normes d'interopérabilité comme le protocole MCP (Model Context Protocol), étendent rapidement les capacités opérationnelles des systèmes d'IA.

Cependant, à mesure que ces systèmes passent du stade de démonstration à celui d'environnement d'entreprise réglementé, une limitation structurelle devient de plus en plus visible : la plupart des architectures d'agents actuelles optimisent la génération d'actions, et non la validité des décisions.

Les systèmes existants sont très efficaces pour produire des actions plausibles, mais ils manquent encore de mécanismes natifs pour :

  • exécution déterministe des décisions,
  • application des politiques en temps réel,
  • planification tenant compte des contraintes,
  • Gestion de l'état du graphe contextuel,
  • et un raisonnement opérationnel vérifiable.

Cette limitation devient cruciale dans des domaines tels que la finance, la santé, l'énergie et les opérations d'entreprise fortement soumises à des exigences de conformité, où les décisions doivent rester reproductibles, explicables et compatibles avec les politiques en vigueur dans des conditions en constante évolution.

Le problème n'est pas simplement d'ordre intellectuel. Il est architectural.

Ekran Resmi 2026-07-29 11.29.53.png

Cette lacune architecturale révèle une couche manquante dans les systèmes multi-agents modernes : une infrastructure de décision contrainte par des politiques, capable de séparer l’intelligence probabiliste de l’exécution déterministe.

Le contexte n'est pas la mémoire

La plupart des systèmes d'agents actuels traitent le contexte principalement sous forme d'historique de conversation, de documents récupérés ou de résultats de similarité vectorielle. Cette approche fonctionne assez bien pour les tâches conversationnelles, mais les systèmes opérationnels nécessitent une gestion du contexte fondamentalement différente.

Ekran Resmi 2026-07-29 11.45.34.png

Dans des environnements réels, les décisions dépendent non seulement des informations recueillies, mais aussi de :

  • relations entre entités,
  • structure organisationnelle,
  • événements temporels,
  • chaînes de propriété, 
  • décisions antérieures,
  • contraintes actives,
  • et un état opérationnel en constante évolution [1]. 

Un client n'est pas qu'un document. Une entreprise n'est pas qu'un simple extrait de texte. Un événement réglementaire n'est pas un simple résultat de recherche. Les systèmes opérationnels nécessitent un modèle d'état en constante évolution. C'est là que la distinction entre mémoire et contexte opérationnel devient cruciale.

La mémoire stocke les informations. Le contexte opérationnel maintient l'état du système.

Concrètement , cela signifie que le système doit constamment maintenir et mettre à jour des structures telles que les entités, les relations, les chaînes d'événements temporels, les liaisons de politiques et l'historique d'exécution. C'est l'une des raisons pour lesquelles les approches basées sur les graphes prennent une importance croissante dans les systèmes multi-agents.

Un graphe n'est pas seulement utile pour la recherche d'informations. Il fournit une représentation dynamique de l'état opérationnel. Au lieu de traiter le contexte comme des fragments de texte isolés, le système peut raisonner sur des entités connectées, des relations évolutives, des dépendances temporelles et des chemins de propagation contextuelle. Cela change complètement le rôle du graphe. Le graphe cesse d'être une couche de stockage et devient :

  • mémoire contextuelle,
  • représentation de l'état opérationnel,
  • et le contexte d'exécution des systèmes de décision.

    Ekran Resmi 2026-07-29 11.49.13.png

    À mesure que les systèmes d'agents évoluent vers des opérations autonomes, cette distinction devient de plus en plus importante. En effet, l'exécution autonome requiert non seulement la récupération d'informations, mais aussi une gestion continue de l'état contextuel[4].

Les polices d'assurance ne peuvent pas rester de simples documents.

Ekran Resmi 2026-07-29 11.46.01.png

Imaginez un agent de résolution des litiges traitant une demande de remboursement. Le client affirme qu'une transaction était frauduleuse. La transaction a été effectuée depuis un appareil de confiance. Le commerçant présente un faible score de risque. À première vue, le cas semble simple. Mais la transaction a eu lieu peu après une réinitialisation de mot de passe inhabituelle, le client a récemment changé d'appareil et la politique antifraude de la banque exige une remontée d'information lorsque plusieurs signaux faibles apparaissent simultanément dans un court laps de temps.

À ce stade, la politique ne peut plus rester un simple document PDF. Elle doit devenir partie intégrante du raisonnement.

Dans un système d'agents opérationnels, les politiques ne doivent pas se limiter à être récupérées sous forme de texte une fois que le LLM a déjà formulé une réponse. Elles doivent contraindre activement l'exécution : bloquer certaines actions, déclencher des escalades, modifier les circuits d'approbation, exiger des preuves supplémentaires ou empêcher la résolution automatisée. Cette idée est étroitement liée aux approches de planification basées sur des politiques antérieures, où l'exécution est continuellement façonnée par des contraintes, des objectifs et des conditions environnementales plutôt que par une logique d'exécution de tâches isolée [6].

C’est là que le contexte opérationnel basé sur les graphes devient crucial.

Le graphe représente l'état du litige : client, compte, transaction, commerçant, appareil, événement de réinitialisation de mot de passe, indicateurs de fraude, décisions antérieures, règles de politique et historique d'exécution. Les politiques sont ensuite liées à ce graphe sous forme de contraintes exécutables, et non comme des documents isolés. À bien des égards, cela ressemble à l'évolution des environnements d'exécution multi-agents, où des entités intelligentes se coordonnent via un état opérationnel partagé en continu plutôt que par des échanges de messages isolés [4].

Une couche de raisonnement peut opérer sur ce graphe à l'aide de mécanismes basés sur des règles ou sur la logique, dérivés de la programmation logique et des systèmes de bases de données déductives [8]. Par exemple, une règle de type Datalog peut indiquer qu'un litige doit être escaladé si une transaction contestée fait suite à une réinitialisation de mot de passe, implique un nouvel appareil et dépasse un seuil de risque — une approche conceptuellement alignée sur les systèmes de raisonnement déductif classiques et les moteurs logiques de bases de données [9].

Le LLM peut interpréter le cas, expliquer la décision et interagir avec les utilisateurs, mais la condition de politique elle-même est évaluée de manière déterministe sur le graphe.

Ekran Resmi 2026-07-29 11.34.57.png

Dans cette architecture, le moteur graphique constitue le substrat opérationnel, tandis que la couche de raisonnement évalue les contraintes, les obligations, les permissions et les dépendances relatives à l'état actuel. Cette séparation entre le raisonnement probabiliste et l'exécution contrainte fait également écho aux modèles d'agents antérieurs basés sur l'interaction de type BDI, où le comportement intelligent émerge non seulement des objectifs, mais aussi des croyances, intentions, obligations et contraintes d'exécution maintenues en permanence (Rao & Georgeff, 1995).

Le changement de clé 

Ekran Resmi 2026-07-29 11.36.06.png

Cela permet à un agent de règlement des différends autonome de raisonner non seulement sur ce qui s'est passé, mais aussi sur ce qui est autorisé, requis, bloqué ou faisant l'objet d'une escalade à chaque étape de l'exécution.

Pipelines de décision tenant compte des contraintes

Ekran Resmi 2026-07-29 11.42.25.png

Une fois que le contexte devient un état opérationnel en constante évolution et que les politiques deviennent des contraintes exécutables, le défi suivant est l'exécution de la décision elle-même.

À ce stade, le problème n'est plus la récupération des informations, mais le contrôle des décisions en temps réel. La plupart des systèmes multi-agents actuels fonctionnent encore comme des systèmes de génération d'actions : récupération du contexte, raisonnement sur celui-ci, génération d'une action, exécution du résultat. Or, les systèmes opérationnels nécessitent une couche supplémentaire entre le raisonnement et l'exécution : un pipeline de décision contraint.

Cette distinction est essentielle car les environnements opérationnels contiennent rarement une seule action valide. Ils contiennent plutôt :

  • actions réalisables,
  • actions interdites,
  • actions intensifiées,
  • actions retardées,
  • et les actions autorisées sous conditions.

Le rôle du système n'est donc pas seulement de générer des actions, mais aussi de les filtrer et de les valider en continu en fonction des contraintes d'exécution. Un pipeline simplifié ressemble de plus en plus à ceci : 

Ekran Resmi 2026-07-29 11.38.11.png

Cela modifie le rôle de plusieurs composants de la pile. Le graphe ne sert plus uniquement à la récupération des données ; il devient l’état opérationnel du système en cours d’exécution. 

Les politiques ne sont plus de simples documents statiques. Elles deviennent des contraintes d'exécution, évaluées lors de la prise de décision. Le planificateur ne se contente plus d'ordonner les tâches ; il doit désormais générer des actions opérationnellement réalisables, en tenant compte des contraintes actives.

Cette distinction est importante car de nombreuses défaillances opérationnelles ne proviennent pas d'un manque d'informations. Elles proviennent d'un choix d'action inapproprié dans des conditions changeantes.

Par exemple :

  • une action peut enfreindre une limite d'autorité,
  • conflit avec une règle de conformité active,
  • déclencher une séquence de processus invalide,
  • ou créer un risque opérationnel en aval.

Dans ces cas-là, le problème ne réside pas dans une défaillance de l'intelligence, mais dans une défaillance liée aux contraintes. C'est pourquoi la planification sous contraintes revêt une importance croissante dans les systèmes autonomes.

Au lieu d'exécuter directement les actions générées, le système doit :

  • évaluer la faisabilité,
  • supprimer les chemins invalides,
  • appliquer les contraintes d'exécution,
  • détecter les conflits,
  • et générer des chemins d'exécution alternatifs si nécessaire.

Conceptuellement, cela rapproche davantage les systèmes d'agents modernes des systèmes de planification classiques que les architectures d'IA conversationnelle traditionnelles.

Des approches telles que :

  • GraphPlan,
  • systèmes de satisfaction de contraintes,
  • recherche heuristique,
  • variantes A*,
  • et des algorithmes de replanification dynamique

redeviennent pertinentes une fois que les systèmes fonctionnent dans des conditions d'exécution en constante évolution.

Ekran Resmi 2026-07-29 11.42.51.png

Cependant, contrairement aux planificateurs classiques, les systèmes opérationnels modernes contiennent également une interprétation sémantique probabiliste, des entrées non structurées, un contexte graphique évolutif et des politiques changeant dynamiquement.

De ce fait, l'architecture émergente n'est ni purement symbolique ni purement probabiliste. Elle devient un modèle d'exécution hybride où les modèles linéaires logiques interprètent, les graphes maintiennent l'état opérationnel, les contraintes définissent les limites d'exécution et les planificateurs génèrent des actions réalisables à l'intérieur de ces limites.

Cette séparation est importante car elle permet aux systèmes autonomes de rester flexibles sans perdre le contrôle opérationnel. L'objectif n'est pas d'éliminer l'intelligence probabiliste.

L'objectif est d'empêcher que le raisonnement probabiliste ne contrôle directement l'exécution opérationnelle sans couches de validation déterministes autour.

Vers des systèmes autonomes fiables

Dès lors que le contexte opérationnel, les contraintes d'exécution et la planification contrainte sont intégrés à l'environnement d'exécution lui-même, l'exécution autonome cesse d'être un simple problème d'orchestration. Le système fonctionne en permanence dans un état opérationnel évolutif : les entités évoluent, les relations changent, les contraintes s'activent ou expirent, et la faisabilité de l'exécution se modifie au fil du temps.

Dans ces conditions, l'exécution ne peut plus dépendre uniquement des résultats générés. Le système doit constamment réévaluer le contexte, valider les contraintes, adapter les plans et maintenir la cohérence opérationnelle malgré l'évolution des conditions.

Cela devient encore plus crucial à mesure que les systèmes multi-agents évoluent, passant de flux de travail éphémères à des opérations de longue durée orientées vers des objectifs précis. Dans ces environnements, les objectifs persistent, plusieurs agents interagissent, les frontières organisationnelles sont importantes et les chemins d'exécution évoluent dynamiquement en cours d'exécution.

De ce fait, la planification n'est plus une tâche ponctuelle, mais un processus opérationnel continu. C'est là que l'état opérationnel basé sur les graphes, les politiques exécutables et la planification tenant compte des contraintes convergent vers une nouvelle architecture d'exécution pour les systèmes autonomes.

Et, avec le temps, cette architecture introduira probablement une nouvelle génération d'artefacts opérationnels :

  • des objectifs persistants inspirés par des approches d'ingénierie des exigences orientées vers les objectifs telles que KAOS [10],
  • rôles et responsabilités organisationnels exécutables similaires à la modélisation organisationnelle orientée rôles de Gaia pour les systèmes multi-agents [11],
  • structures de coordination adaptatives ressemblant aux approches MAS organisationnelles telles que MOISE+ [12],
  •  et les modèles organisationnels d’exécution pour les systèmes multi-agents à long terme explorés dans la recherche sur la logique organisationnelle et les systèmes multi-organisationnels adaptatifs [13][14].

La prochaine génération de systèmes d'IA d'entreprise pourrait donc se définir non pas par le nombre d'actions qu'ils peuvent générer, mais par leur capacité à maintenir de manière fiable un comportement coordonné et orienté vers un objectif, malgré des contraintes en constante évolution.

Références

1. Hogan, A., Blomqvist, E., Cochez, M., et al. Graphes de connaissances. ACM Computing Surveys, 2021.

2. Edge, D., et al. Du local au global : une approche GraphRAG pour la synthèse axée sur les requêtes. arXiv, 2024.

3. Nii, HP. Le modèle du tableau noir pour la résolution de problèmes et l'évolution des architectures du tableau noir. AI Magazine, 1986.

4. Wooldridge, M. Introduction aux systèmes multi-agents. Wiley, 2009.

5. Ferber, J. Systèmes multi-agents : une introduction à l'intelligence artificielle distribuée. Addison-Wesley, 1999.

6. Myers, KL. Vers un cadre pour la planification et l'exécution continues. AAAI, 1999.

7. Rao, AS, Georgeff, MP Agents BDI : de la théorie à la pratique. ICMAS, 1995.

8. Ceri, S., Gottlob, G., Tanca, L. Programmation logique et bases de données. Springer, 1990.

9. Abiteboul, S., Hull, R., Vianu, V. Fondements des bases de données. Addison-Wesley, 1995.

[10]. van Lamsweerde, A. (2001). Ingénierie des exigences orientée objectifs : une visite guidée.

[11] Wooldridge, M., Jennings, NR, & Kinny, D. (2000). La méthodologie Gaia pour l'analyse et la conception orientées agent.

[12] Hannoun, M., Sichman, JS, Boissier, O. et Sayettat, C. (2000). MOISE : Un modèle organisationnel pour les systèmes multi-agents.

[14] Dignum, V., & Dignum, F. (2018). Le rôle des modèles organisationnels dans les systèmes d'agents.

[15] Tamersoy, M., Ekinci, EE, Erdur, RC, & Dikenelli, O. (2017). Un modèle d'exigences pour les systèmes multi-organisationnels adaptatifs. SASO 2017.