Les systèmes de génération d’images à partir de texte s’appuient souvent sur des garde-fous dits *training-free*, conçus pour filtrer les requêtes problématiques sans réentraîner le modèle. Dans ce travail, les auteurs examinent une hypothèse fréquente : l’existence d’un signal global d’« insécurité », représenté par une direction ou un sous-espace toxique réutilisable pour tous les prompts. Leur analyse géométrique suggère que cette approche atteint rapidement ses limites.

Selon le résumé de l’article, un compromis récurrent apparaît entre couverture et sélectivité. Un sous-espace compact ne couvrirait pas correctement la diversité des contenus jugés dangereux, tandis qu’une agrégation plus large tendrait à dégrader des prompts bénins mais proches de zones sensibles. Autrement dit, plus le filtre global cherche à couvrir de cas, plus il risque d’altérer des usages légitimes adjacents.

Pour répondre à ce problème, les chercheurs proposent CALM (*Counterfactual Adaptive Local Modulation*), une méthode également sans entraînement. Plutôt que d’appliquer une suppression uniforme, CALM effectuerait une correction locale et contrefactuelle, adaptée au prompt analysé. L’approche s’appuie sur des ancres appariées entre cas bénins et non sûrs, identifie les catégories actives, puis modifie de façon minimale uniquement les représentations de tokens considérées comme en infraction, tout en réduisant certains résidus alignés sur des composantes dangereuses.

D’après les auteurs, les évaluations montrent une meilleure suppression des contenus non sûrs tout en conservant davantage l’utilité sur les prompts bénins. À ce stade, ces résultats proviennent d’un dépôt arXiv et doivent donc être lus avec prudence en l’absence d’informations détaillées ici sur les jeux de tests ou les métriques. L’article met néanmoins en avant une piste claire : dans la sûreté des modèles génératifs, une intervention locale et contextuelle pourrait s’avérer plus efficace qu’un filtrage global uniforme.