Des chercheurs présentent sur arXiv une approche visant à sortir le reinforcement learning de sa « boîte noire ». Leur idée : transformer, après entraînement, une politique profonde en un programme logique exécutable en Prolog, capable de reproduire son comportement tout en restant lisible par un humain, interprétable par un moteur logique et modifiable par un optimiseur.

La méthode s’organise en trois étapes. D’abord, un modèle enseignant figé, issu de proximal policy optimization (PPO), sert de référence. Ensuite, les auteurs induisent à partir de ses décisions une liste ordonnée de règles, dans l’esprit de l’apprentissage relationnel classique. Enfin, ces règles sont converties en programme Prolog, dont chaque décision peut être exécutée par un moteur logique standard. Une phase d’extension permet ensuite d’éditer la base de règles, avec validation uniquement si l’évaluation de la politique montre un gain de retour.

L’article met en avant plusieurs garanties théoriques. Les auteurs indiquent notamment une borne sur la perte de retour, qui ferait du programme distillé une forme de certificat vérifiable dans un processus de décision markovien fini. Ils affirment aussi que la boucle d’extension améliore monotoniquement la politique et qu’elle termine. Pour les observations continues, ils montrent qu’une conversion est possible avec une fidélité croissante quand la résolution augmente, tout en signalant une limite importante : le coût peut devenir exponentiel avec la dimension des observations dans certains cas.

Côté expérimental, les résultats paraissent contrastés mais encourageants. Sur une tâche « key-and-door » à deux pièces, avec 16 944 états atteignables, le programme Prolog étendu atteint le retour optimal exact sur tous les seeds, et dépasse l’enseignant stochastique dans un régime contraint. Sur des tâches de contrôle continu, il égalerait l’enseignant sur Acrobot avec 11 clauses, récupérerait environ 97 % du retour sur CartPole, mais seulement une partie sur LunarLander — une limite que les auteurs relient à leur borne théorique inférieure.