Les interfaces graphiques mobiles deviennent un terrain d’évaluation central pour les agents IA capables d’agir de façon autonome. Dans ce contexte, des benchmarks comme AndroidWorld ou MobileWorld ont déjà posé des bases solides, mais selon les auteurs de cette étude, ils ne couvrent pas encore toute la diversité des usages réels sur smartphone.

Le papier introduit GMA (*General Mobile Assistants*), un nouveau benchmark destiné à tester des assistants mobiles généralistes dans des scénarios jugés plus exigeants. L’environnement s’appuie sur sept applications issues de projets open source, couvrant notamment des cas d’usage liés au partage de contenus de vie quotidienne ou à la planification de voyages. Au total, 300 tâches sont proposées, réparties en quatre niveaux de difficulté, depuis des actions élémentaires jusqu’à des workflows complexes en plusieurs étapes.

Les auteurs indiquent avoir évalué huit modèles de pointe sur ce cadre. Leur principal constat est que les performances chutent nettement à mesure que la complexité des tâches augmente. Autrement dit, si certains agents peuvent réussir des actions simples, ils restent encore loin d’une exécution robuste et fiable lorsque les demandes utilisateur deviennent plus réalistes, ambiguës ou séquentielles.

L’étude examine aussi l’impact du design du harness agentique, c’est-à-dire la manière d’orchestrer le modèle dans l’environnement de test. Des variantes comme la rétention de contexte ou le suivi explicite de l’état semblent pouvoir améliorer les résultats, en particulier sur les workflows les plus difficiles. Les auteurs précisent toutefois que l’efficacité de ces choix varie selon les modèles de base.

En pratique, GMA se positionne comme un complément aux benchmarks existants, avec une couverture applicative plus large et des tâches plus proches d’un usage réel. Pour l’écosystème, ce travail souligne surtout un point clé : au-delà du modèle lui-même, l’architecture d’exécution pourrait jouer un rôle déterminant dans la fiabilité des assistants mobiles IA.