Des chercheurs présentent sur arXiv une méthode d’adaptation de Vision Transformers (ViT) à la reconnaissance automatique de cibles (ATR) sur données de synthetic aperture sonar (SAS). L’enjeu est important pour les usages navals, mais le domaine reste contraint par le faible volume d’images de cibles, le bruit de fond et la nécessité d’une validation humaine. L’équipe s’appuie sur DINOv3, un modèle préentraîné sur des images naturelles, puis l’adapte au contexte acoustique sous-marin.

Le cadre proposé comporte trois étapes. La première repose sur LoRA (Low-Rank Adaptation), qui permet d’ajuster le modèle sans réentraîner l’ensemble du backbone ViT. Les deux suivantes visent à raffiner la séparation entre cibles et faux positifs : d’abord via du hard-negative mining face à des imitateurs acoustiques comme des roches ou formations sédimentaires, puis via de l’apprentissage contrastif supervisé (SupCon).

Le principal résultat vient clairement de la première étape. Selon les auteurs, LoRA fait progresser l’AUPRC de 0,300 à 0,679 ± 0,027, tout en n’entraînant que 0,26 % des poids avec un rang 4. L’évaluation est menée sur des données SAS collectées en mer, avec une séparation géographique au niveau mission, des comparaisons à 85 % de rappel test, et une répétition sur trois graines aléatoires.

En revanche, les deux raffinements additionnels n’apportent pas de gain mesurable par rapport à leurs contrôles. Le hard-negative mining modifie l’AUPRC de -0,0045 ± 0,0119, tandis que SupCon change la métrique de +0,0002 ± 0,0096. Les auteurs en concluent qu’une seule étape d’adaptation efficace suffit, et que l’empilement de techniques supplémentaires ne produit pas nécessairement de bénéfice lorsque l’encodeur a déjà capturé l’essentiel de la géométrie entre cibles et clutter.