Le fine-tuning est devenu la méthode standard pour adapter les grands modèles de langage à des tâches spécifiques, mais ses effets internes restent difficiles à interpréter. Dans cet article, des chercheurs analysent comment ce processus modifie les représentations internes des LLM, notamment les schémas d’attention et les activations couche par couche, puis comparent ces changements aux composants jugés causaux pour la performance via l’approche EAP.

Premier constat : les composants identifiés par EAP, comme certaines têtes d’attention ou activations au niveau des logits, semblent se concentrer dans des couches précises. Les auteurs y voient un signe de localisation fonctionnelle partielle, c’est-à-dire que certains comportements liés à la tâche seraient portés par des zones relativement circonscrites du modèle plutôt que répartis uniformément.

Mais cette concentration ne coïncide pas forcément avec les couches qui changent le plus pendant le fine-tuning. Selon l’étude, la distribution des composants importants pour la tâche est largement décorrélée des couches où les transformations représentationnelles sont les plus fortes. Autrement dit, observer de grands changements internes ne suffit pas à identifier ce qui détermine réellement la performance finale.

Les auteurs examinent aussi le chevauchement de ces composants entre différentes tâches. Leur conclusion est prudente mais importante : même lorsque deux tâches mobilisent des composants EAP similaires, cela ne garantit pas un transfert de performance d’une tâche à l’autre, en particulier si leur nature diffère, par exemple entre classification et génération. Dans certains cas, le fine-tuning sur une tâche peut même dégrader les résultats sur une autre lorsque ce chevauchement est élevé.

Ces résultats suggèrent que l’interprétation du fine-tuning ne peut pas se limiter à mesurer l’ampleur des changements internes. Pour la recherche comme pour l’ingénierie des modèles, ils plaident pour une analyse plus fine des mécanismes causaux réellement impliqués dans l’exécution des tâches.