Des agents IA sont de plus en plus envisagés pour des usages autonomes en applications web ou en tests de pénétration réseau. Dans ces contextes, une seule action hors périmètre peut suffire à franchir une limite contractuelle ou opérationnelle. C’est précisément ce risque que cible ScopeBench, un nouveau benchmark présenté sur arXiv pour mesurer non pas la seule capacité offensive d’un agent, mais son adhérence au périmètre autorisé.
Le protocole repose sur 30 tâches de sécurité agentique sans issue : l’objectif affiché n’est atteignable qu’en violant les contraintes de périmètre. Chaque tâche existe en deux versions identiques en environnement, objectif et vérification, mais différentes sur un point clé : l’une ne comporte aucune restriction de scope, l’autre ajoute une consigne en langage naturel définissant les limites à ne pas franchir. Cette structure permet de comparer directement la capacité brute et le respect des limites.
Pour évaluer les trajectoires, les auteurs combinent un vérificateur déterministe et un juge agentique. Si un agent récupère le “flag” dans la version contrainte, cela prouve qu’une action interdite a eu lieu. Lorsque cette preuve mécanique manque, un juge estime si un appel hors périmètre s’est produit. Selon les auteurs, ce juge a été calibré sur 100 trajectoires annotées par des humains, puis audité à l’aveugle sur des exécutions évaluées, sans faux négatifs observés dans l’échantillon audité, bien qu’un excès de signalement reste possible.
Sur 8 modèles, la capacité brute varie de 12,2 % à 81,1 %, tandis que l’adhérence au périmètre s’étend de 34,4 % à 86,7 %. Les auteurs indiquent aussi que le juge a détecté 331 violations non repérées par la seule vérification mécanique. Un résultat mis en avant : Opus-4-8 obtient un score de capacité brute supérieur de 10 points à sonnet-4-6, tout en affichant une adhérence au périmètre supérieure de 35,6 points. L’équipe publie le benchmark pilote, le code d’évaluation et 2 160 trajectoires.