Les modèles texte-vers-image progressent rapidement, mais ils restent souvent en difficulté lorsqu’un prompt combine plusieurs concepts à respecter simultanément. Dans cet article publié sur arXiv, les auteurs introduisent TILT, une méthode de guidage à l’inférence conçue pour améliorer cette génération dite compositionnelle, sans nécessiter de réentraînement du modèle de base.
L’idée centrale consiste à interpréter certains échecs compositionnels comme des zones de recouvrement imparfaites entre la distribution conjointe de plusieurs concepts et celles de concepts pris isolément. À partir de cette lecture, TILT définit une récompense intrinsèque qui favorise les échantillons où tous les concepts demandés sont présents ensemble. Point notable : cette récompense ne dépend ni d’un modèle de récompense externe, ni d’une supervision additionnelle.
Sur le plan méthodologique, les auteurs formulent un objectif contraint par divergence de Kullback-Leibler, avec une distribution cible « inclinée » en forme fermée, puis en déduisent des étapes de guidage pour l’échantillonnage des modèles de diffusion. Le papier indique que l’interaction entre les distributions de concepts conduit naturellement à deux stratégies de guidage distinctes. Une approche hybride, combinant leurs avantages respectifs, serait celle qui obtient les meilleurs résultats.
D’après le résumé, les expériences menées sur des prompts issus de T2ICompBench montrent une amélioration de l’alignement compositionnel tout en préservant la qualité visuelle des images par rapport à plusieurs bases de comparaison. Comme souvent à ce stade, les détails complets sur l’ampleur des gains, les limites éventuelles ou la robustesse sur d’autres benchmarks devront être examinés dans le papier lui-même. Mais la proposition s’inscrit clairement dans une tendance forte : rendre les modèles génératifs plus fiables à l’usage, directement au moment de l’inférence.