Des chercheurs proposent LAMAE (*Latent-Attention Masked Autoencoders*), un modèle d’apprentissage auto-supervisé visant à mieux exploiter la diversité des données utilisées en cardiologie. L’idée centrale est de ne plus traiter séparément les modalités — comme l’ECG, l’échocardiographie, la radiographie thoracique ou les variables cliniques — avant de les fusionner en aval, mais d’apprendre directement une représentation commune au niveau du patient.
L’architecture repose sur un mécanisme d’attention latente partagée qui fait circuler l’information entre modalités dans l’espace latent. Les auteurs indiquent que ce module opère selon une hiérarchie *study-view-entity*, afin de préserver la structure propre à chaque source tout en agrégeant des observations variables. Cette conception vise aussi à mieux gérer les cas où certaines modalités sont absentes, une situation fréquente dans les données hospitalières réelles.
Selon l’article, LAMAE a été préentraîné sur plus de 1,2 million de séjours hospitaliers issus de MIMIC-IV. Les résultats rapportés montrent des performances supérieures à celles de préentraînements mono-modaux ainsi qu’à plusieurs bases de comparaison contrastives et vision-langage sur des tâches multimodales liées au séjour hospitalier. Les tâches citées incluent notamment la mortalité intra-hospitalière, le codage ICD-10 et DRG, ainsi que la durée de séjour.
Les auteurs soulignent également que les gains restent visibles même lorsqu’une seule modalité est disponible au moment de l’inférence, ce qui suggère une meilleure robustesse des représentations apprises. À ce stade, il s’agit toutefois d’un préprint arXiv, donc d’un travail encore non évalué par les pairs. Si ces résultats se confirment, LAMAE pourrait renforcer l’intérêt des fondations multimodales en santé, en particulier pour des environnements cliniques où les données sont hétérogènes et incomplètes.