La génération d’images à partir de texte repose souvent sur un principe simple : produire plusieurs visuels à partir d’un même prompt pour laisser l’utilisateur choisir. Mais en pratique, deux objectifs entrent rapidement en tension. Chaque image doit d’une part bien correspondre aux préférences de l’utilisateur, mesurées ici par un score de récompense appris, et d’autre part se distinguer des autres pour préserver la diversité du lot.

Les auteurs estiment que les méthodes existantes traitent mal ce compromis. Soit elles optimisent séparément la récompense et la diversité, soit elles les fusionnent dans un score global, avec un risque : une forte diversité peut alors compenser des images de faible qualité ou peu satisfaisantes. Leur proposition consiste à reformuler le problème en termes de « satisficing » : chaque image doit dépasser un seuil minimal de récompense, tandis que l’ensemble du lot doit aussi respecter un niveau minimal de diversité.

Cette formulation fait émerger une frontière de Pareto entre satisfaction et diversité. Pour la parcourir, l’article introduit SatisDive, une méthode appliquée au moment de l’inférence, sans phase d’entraînement additionnelle. Concrètement, SatisDive utilise un seuil de récompense relatif au lot pour séparer les candidats les moins satisfaisants des meilleurs. L’algorithme cherche alors à améliorer prioritairement la récompense des images sous le seuil, tout en renforçant la diversité parmi celles qui le dépassent.

Les résultats rapportés sur le jeu de données Pick-a-Pic suggèrent des gains sur la pire image du lot, à diversité comparable mesurée par DreamSim. Les auteurs indiquent notamment une amélioration pouvant atteindre 0,43 face à FK steering avec FLUX.1-dev et HPSv3, et jusqu’à 0,70 avec SANA-1.6B et ImageReward. Plus largement, ils avancent que la courbe satisfaction-diversité de SatisDive domine celle de FK steering sur les plages DreamSim communes, ce qui en ferait une piste prometteuse pour des systèmes de génération plus contrôlables.