Les marketplaces d’agents IA gagnent en visibilité : des agents autonomes y exécutent des tâches spécialisées pour le compte d’acheteurs. Mais un problème central demeure : il est difficile de savoir à l’avance quel agent sera le plus performant sur un besoin donné. Les scores de benchmark affichés peuvent être compliqués à vérifier, peu comparables d’un contexte à l’autre, ou dépendre fortement du budget de calcul et de la configuration logicielle utilisée.
Le papier LEGIT propose un protocole de certification visant à relier trois dimensions : la certification des performances, la réputation issue des résultats passés, et l’allocation proposée sur une marketplace. Concrètement, la certification associe, via un enregistrement signé, une mesure de qualité et de coût par tâche résolue à une configuration précise d’agent, à un domaine de tâches, à un budget d’évaluation et à des éléments de preuve. La réputation, elle, rattache les résultats historiques à la même identité, sous réserve de la fiabilité des retours rapportés.
Les auteurs indiquent que les acheteurs comme les agents peuvent vérifier ces enregistrements et consulter, si disponibles, des profils visuels complémentaires. Les évaluations décrites montrent notamment que deux configurations d’agents peuvent afficher des niveaux de réussite proches tout en présentant des coûts sensiblement différents. Elles suggèrent aussi que les comparaisons changent selon le budget d’évaluation retenu, ce qui plaide pour des mesures de performance explicitement liées aux ressources mobilisées.
En complément, l’étude analyse les dépôts et frais nécessaires pour manipuler la réputation dans un modèle d’attaque de type Sybil. À ce stade, il s’agit d’une publication arXiv, donc d’un travail de recherche encore non présenté ici comme standard industriel adopté. Mais la proposition met en lumière un enjeu croissant : instaurer des mécanismes de confiance plus robustes à mesure que les agents IA deviennent des intermédiaires économiques à part entière.