Des chercheurs analysent un écueil méthodologique dans les modèles du monde compacts utilisés pour relier langage et perception spatiale. Leur point de départ est simple : un système peut paraître comprendre une instruction comme « mettre le bloc rouge à gauche du bloc bleu » grâce à quelques points de référence explicites, sans pour autant réellement percevoir la scène. Selon l’article, une forte performance sur la lecture de relations spatiales peut en réalité provenir d’une transcription de l’instruction, et non d’un ancrage perceptif authentique.

Le signal d’alerte est net dans leurs expériences. Un prédicteur conditionné par l’objectif atteint environ 0,90 de précision sur la lecture de la relation, mais cette performance s’effondre à 0,27 lorsque l’objectif textuel est retiré, soit un niveau proche du hasard d’après les auteurs. Plus frappant encore, lorsqu’une instruction contrefactuelle est fournie, les ancres prédites suivent la fausse instruction dans 94,5 % des cas, contre 2,3 % pour la scène réelle sur un échantillon de 256 cas.

Les auteurs testent ce phénomène dans trois configurations ainsi qu’avec une ablation intra-tâche. Leur thèse centrale est que la fuite d’instruction apparaît lorsque la quantité évaluée peut être directement déduite du texte, indépendamment de la qualité prédictive des autres entrées. Ils observent cette fuite sur leur environnement de table et sur le benchmark BabyAI, tandis qu’un modèle de dynamique avant sur Language-Table n’en souffrirait pas tant que l’instruction ne nomme pas explicitement la direction spatiale.

La recommandation est claire : retirer l’objectif du modèle de dynamique et réserver cette information au coût du planificateur, tout en supervisant séparément le chemin de lecture. Cette modification permettrait, selon l’article, de retrouver un ancrage spatial stable, avec une performance annoncée à 0,88, identique avec ou sans objectif. Au-delà de ce cas, le protocole proposé pourrait servir à auditer plus largement les modèles conditionnés par instruction lorsque le texte contient déjà la réponse attendue.