Des chercheurs décrivent sur arXiv une plateforme d’évaluation destinée aux systèmes d’entretien psychiatrique assistés par IA. L’objectif est très opérationnel: donner aux établissements de santé un cadre de contrôle qualité capable de comparer différents styles d’entretien, de limiter la charge pour les cliniciens et de mesurer des performances réellement utiles en pratique.

Le dispositif repose sur InterviewPlayground, un simulateur de patients enrichi par mémoire pour des entretiens ouverts. Les auteurs indiquent avoir créé des patients interactifs à partir de vignettes rédigées par des experts, puis construit une plateforme simulée d’admission psychiatrique avec plusieurs modalités d’évaluation jugées pertinentes pour ce contexte clinique.

Dans un pilote impliquant 6 cliniciens sur une évaluation de 25 minutes, les résultats rapportés montrent qu’un interviewer d’admission fondé sur un LLM de type GPT a récupéré une plus grande part des éléments cliniquement pertinents intégrés aux vignettes: 88,0 %, contre 38,9 % pour les cliniciens. En revanche, le système d’IA a aussi produit davantage d’inférences cliniques non fondées sur l’entretien: 56,8 % contre 27,8 %. Il a également moins souvent correctement caractérisé les signaux de sécurité identifiés, avec 33,3 % contre 66,7 %.

Ces résultats restent préliminaires et doivent être lus avec prudence, compte tenu de la taille limitée du pilote. Ils mettent néanmoins en lumière un point clé pour le secteur: en santé mentale, la performance d’une IA ne se résume pas à extraire plus d’informations. La capacité à éviter les extrapolations injustifiées et à qualifier correctement les risques apparaît tout aussi décisive pour envisager un déploiement sûr et conforme aux standards cliniques.