À l'écoute des cétacés : comment l'IA fait progresser la surveillance acoustique passive

Les populations de cétacés font face à de multiples menaces anthropiques : collisions avec les navires, pollution sonore, captures accidentelles dans les engins de pêche et dégradation de leur habitat. Surveiller efficacement leur présence est crucial. Pour les protéger, il est indispensable de savoir où ils se trouvent et à quel moment. Les suivis visuels ne permettent pas de répondre à cet enjeu à grande échelle. En revanche, la surveillance acoustique passive (PAM) offre un suivi fiable et non invasif. Les hydrophones permettent d'enregistrer et de suivre les mammifères marins en continu pendant des mois ou des années, et non pas seulement quelques heures. Cependant, cela génère une explosion massive de données extrêmement difficile à analyser. Le défi consiste à développer des outils de classification qui font gagner un temps considérable aux experts, afin de constituer des bases de données fiables et structurées, socle indispensable à une IA capable d'analyser l'ensemble des enregistrements.
En réalité, l'océan ne produit jamais exactement le même son deux fois : selon la région, le rythme circadian, les marées et d'autres paramètres biotiques et abiotiques, chaque enregistrement possède sa propre signature acoustique. Les vocalisations de cétacés ne représentent qu'une faible partie de ce paysage sonore dense, où elles se mêlent au trafic maritime, à la géophonie et à l'ensemble des autres bruits. Un modèle d'IA entraîné sur des données issues d'une seule région perd rapidement en fiabilité ailleurs : pour fonctionner partout, il doit apprendre à partir d'exemples annotés couvrant cette diversité de sites, de saisons et de moments de la journée. Néanmoins, il est impossible d'annoter l'ensemble des enregistrements à la main. C'est pourquoi les outils de labellisation sont utiles : ils permettent aux experts de concentrer leurs efforts sur les segments les plus informatifs. Ces annotations doivent avoir une valeur biologique : une simple détection de pic d'énergie ne suffit pas ; la donnée ne devient exploitable que lorsque l'espèce, le type de vocalisation et le contexte ont été identifiés.
Dans un premier temps, nous définissons ce que nous enregistrons, à plusieurs niveaux : présence ou absence d'un signal, espèce, type de vocalisation (clic, sifflement, chant, coda) et parfois contexte comportemental. Certaines vocalisations très stéréotypées servent de références idéales. Chez la baleine bleue (Balaenoptera musculus), les « ciels A » et « ciels B » (A-calls et B-calls) sont des signaux tonaux basse fréquence décrits depuis longtemps dans la littérature et émis selon des séquences régulières, ce qui les rend facilement identifiables sur un spectrogramme. Les chants de la baleine à bosse (Megaptera novaeangliae) présentent une structure hiérarchique : des unités sonores sont assemblées en phrases, elles-mêmes répétées pour former des thèmes. Cela permet une annotation à plusieurs échelles, de l'unité individuelle au chant complet. Chaque site, chaque saison et chaque population possède son propre paysage sonore. Cette variabilité bien documentée est ce qui confère leur robustesse aux jeux de données et permet aux modèles de s'appliquer à n'importe quel écosystème.
En pratique, le travail commence par la visualisation des données sous forme de spectrogramme, sur lequel l'expert détoure les signaux en temps et en fréquence. L'annotation peut être réalisée à l'aide d'un outil de labellisation. Chez Ezako, nous utilisons naturellement notre outil Upalgo Sound Labeling. Upalgo Labeling accélère le processus grâce à une pré-annotation réalisée par un modèle avec correction par l'expert, de l'apprentissage actif pour prioriser les exemples les plus informatifs et de l'apprentissage semi-supervisé pour tirer parti des données non étiquetées. La fiabilité des labels repose sur de bonnes pratiques : un protocole d'annotation écrit, une taxonomie prédéfinie, une double annotation sur un échantillon et la mesure de l'accord inter-annotateurs. Cette méthode permet l'annotation rapide de grands jeux de données et aboutit à une base de données structurée et fiable sur laquelle entraîner des modèles d'IA pour la détection sonore. Ces modèles faciliteront ensuite l'identification des espèces, avec des applications en conservation et écologie, recherche scientifique et gestion des pêches. De cette manière, chaque heure de données enregistrées devient une donnée biologique exploitable qui bénéficie aux cétacés.