Les modèles texte-vers-image progressent rapidement, mais ils restent souvent en difficulté lorsqu’un prompt combine plusieurs concepts à respecter simultanément. Dans cet article publié sur arXiv, les auteurs introduisent **TILT**, une méthode de guidage à l’inférence conçue pour améliorer cette génération dite compositionnelle, sans nécessiter de réentraînement du modèle de base.

L’idée centrale consiste à interpréter certains échecs compositionnels comme des zones de recouvrement imparfaites entre la distribution conjointe de plusieurs concepts et celles de concepts pris isolément. À partir de cette lecture, TILT définit une **récompense intrinsèque** qui favorise les échantillons où tous les concepts demandés sont présents ensemble. Point notable : cette récompense ne dépend ni d’un modèle de récompense externe, ni d’une supervision additionnelle.

Sur le plan méthodologique, les auteurs formulent un objectif contraint par divergence de Kullback-Leibler, avec une distribution cible « inclinée » en forme fermée, puis en déduisent des étapes de guidage pour l’échantillonnage des modèles de diffusion. Le papier indique que l’interaction entre les distributions de concepts conduit naturellement à **deux stratégies de guidage distinctes**. Une approche hybride, combinant leurs avantages respectifs, serait celle qui obtient les meilleurs résultats.

D’après le résumé, les expériences menées sur des prompts issus de **T2ICompBench** montrent une amélioration de l’alignement compositionnel tout en préservant la qualité visuelle des images par rapport à plusieurs bases de comparaison. Comme souvent à ce stade, les détails complets sur l’ampleur des gains, les limites éventuelles ou la robustesse sur d’autres benchmarks devront être examinés dans le papier lui-même. Mais la proposition s’inscrit clairement dans une tendance forte : rendre les modèles génératifs plus fiables à l’usage, directement au moment de l’inférence.