Des chercheurs présentent sur arXiv une étude consacrée à l’adaptation de systèmes de reconnaissance automatique de la parole (ASR) à des communications radio de police diffusées dans des conditions très bruitées. L’enjeu est important : les performances limitées des modèles généralistes compliquent l’analyse de ces échanges et, par extension, l’étude des processus de décision policiers. Les auteurs se concentrent sur deux corpus issus de Baltimore et Chicago.

Le travail évalue l’usage du pseudo-labeling, une approche non supervisée qui consiste à générer automatiquement des transcriptions pour ensuite affiner un modèle sans recourir à une annotation humaine coûteuse. Les expériences portent sur deux modèles de base, Whisper et Qwen3-ASR. Selon les auteurs, les métriques de confiance internes habituelles, comme les log-probabilités ou les scores STAR, distinguent mal les pseudo-labels de bonne et de mauvaise qualité dans ce contexte très dégradé.

Pour contourner cette limite, l’étude introduit un mécanisme de filtrage externe fondé sur un LLM utilisé comme juge. L’idée est d’écarter les transcriptions jugées peu plausibles sur le plan contextuel. D’après le résumé, ce filtrage se montre plus strict que les métriques internes et permet de réduire significativement le taux d’erreur sur les jeux d’entraînement pseudo-annotés, sur les deux corpus étudiés.

Les auteurs soulignent toutefois qu’un écart important subsiste par rapport à un filtre « oracle », c’est-à-dire une sélection idéale. Ils proposent aussi une piste complémentaire : le pseudo-labeling croisé entre modèles, où un système est affiné à partir des pseudo-labels produits par un autre. Cette approche est présentée comme prometteuse, mais elle semble encore relever d’une direction de recherche à approfondir plutôt que d’une solution aboutie.