Les systèmes d’agents fondés sur des *skills* — des modules combinant instructions en langage naturel, scripts exécutables et ressources de référence — gagnent en popularité pour étendre rapidement les capacités d’un agent. Mais cette modularité crée aussi une nouvelle surface d’attaque. Dans un article déposé sur arXiv, des chercheurs s’intéressent non pas aux failles d’un skill isolé, mais aux risques qui émergent de leurs interactions.
Le papier introduit le concept de skill cascading attacks. Le principe consiste à répartir un objectif malveillant sur plusieurs skills, de sorte que chaque modification paraisse bénigne lorsqu’elle est examinée seule. C’est leur exécution combinée qui devient problématique. Les auteurs citent notamment un scénario de revue d’ordonnances où plusieurs skills atténuent progressivement un signal critique, jusqu’à faire disparaître une alerte importante avant qu’elle n’atteigne le médecin.
Pour étudier ce phénomène, l’équipe a développé SkillCascade, un cadre automatisé de *red teaming* multi-agents, ainsi que SkillCascade-Bench, un benchmark de 213 cas de test validés couvrant plusieurs systèmes d’agents et domaines. Selon l’article, les interactions en cascade provoquent de manière fiable des comportements nuisibles sur des agents représentatifs comme OpenClaw, Claude Code ou Codex, ainsi qu’avec différents modèles de langage sous-jacents.
Le point saillant de ces travaux est que les mécanismes de défense actuels, centrés sur l’analyse d’un skill à la fois ou sur des moniteurs d’exécution classiques, ne suffiraient pas à détecter ces attaques. Les auteurs soulignent ainsi un écart entre l’intégrité des composants pris individuellement et la sûreté du système dans son ensemble. À ce stade, l’étude appelle surtout à concevoir des défenses capables de raisonner sur les interactions entre skills, un enjeu potentiellement important pour les plateformes d’agents ouvertes et extensibles.