Que faire de vos séries temporelles ?

Ce que sont les séries temporelles, d’où elles viennent, comment le machine learning les exploite, et quel retour en attendre.

Trois séries de capteurs de tempéraments différents, un évènement encadré dans chacune.

Une série temporelle est une suite de mesures ordonnées dans le temps : la vibration d’un roulement échantillonnée mille fois par seconde, la température d’un satellite toutes les dix secondes, la pression d’une conduite chaque minute. Ce qu’on peut en faire dépend moins de l’algorithme que des labels : avec des évènements nommés et marqués par des gens qui connaissent la machine, une série peut être fouillée, classée, surveillée et prédite. Sans eux, elle ne peut être que décrite.

Ce qu’est une série temporelle

Chaque ligne est un instant et une ou plusieurs valeurs. L’échantillonnage est régulier quand les instants sont également espacés, irrégulier sinon ; la série est multivariée quand plusieurs capteurs sont lus à chaque instant. Quatre lignes d’une série à deux capteurs :

InstantCourant (A)Vibration (g)
2026-09-22T08:00:01Z120,2
2026-09-22T08:00:02Z130,1
2026-09-22T08:00:03Z160,3
2026-09-22T08:00:04Z140,4

La fréquence d’échantillonnage décide de ce qu’on peut voir. Un signal échantillonné fs fois par seconde ne montre rien au-dessus de fs/2 (Shannon, 1949) : une température lue chaque minute ne peut pas montrer une vibration à 50 Hz, et un enregistrement audio à 200 kHz est une série temporelle comme les autres, seulement bien plus rapide. Les enregistrements acoustiques, les enregistrements radio et la détection acoustique distribuée sont tous des séries temporelles à haute cadence, et les mêmes questions s’y posent.

D’où elle vient

Presque toute machine qui tourne en produit une : les capteurs d’un moteur au banc d’essai, la télémesure d’un satellite, le courant et la vibration d’une pompe, les hydrophones d’un mouillage, la déformation le long d’une fibre optique. Les volumes sont grands et les parties intéressantes rares : sur un banc, quelques observations anormales dans des heures de signal à haute fréquence ; sur un site radio, un défaut parmi des milliers de mesures normales.

Cinq choses qu’on peut en faire

TâcheLa questionCe qu’il faut
LabélisationOù sont les évènements, et que sont-ils ?Une taxonomie, des spécialistes, un jeu de données relu
Détection d’anomaliesOù la série cesse-t-elle de se comporter comme elle le devrait ?Des exemples du normal, et des anomalies quand elles sont connues
ClassificationDe quelle sorte d’évènement s’agit-il ?Des évènements labélisés de chaque sorte
Recherche de similaritéOù ce motif apparaît-il ailleurs ?Un exemple labélisé et une distance : la déformation temporelle dynamique (Sakoe et Chiba, 1978) ou le matrix profile (Yeh et al., 2016)
Prévision, durée de vie restanteQue vient-il ensuite, et combien de temps avant la panne ?Des séries enregistrées jusqu’à la panne, comme les moteurs C-MAPSS de la NASA (Saxena et al., 2008)

La première tâche nourrit les quatre autres. La recherche de similarité est le raccourci : à partir d’un seul évènement marqué par un analyste, les plages qui lui ressemblent sont trouvées dans les autres séries et relues une à une, et c’est ainsi qu’un jeu de données d’évènements rares passe d’un exemple à des centaines.

Ce qu’il faut pour commencer

  1. Des données lisibles. Un CSV avec une colonne d’horodatage ISO 8601 et une colonne par capteur suffit. Les unités et les fréquences d’échantillonnage sont notées ; une série répartie en fichiers par machine ou par jour est réunie par un identifiant.
  2. Les évènements, nommés. Une courte taxonomie de ce qui compte : le défaut, le transitoire, la dérive, l’artefact du banc. Elle s’écrit avec les gens qui font tourner la machine.
  3. Un premier échantillon labélisé. Quelques enregistrements labélisés et relus, assez pour fouiller le reste par similarité et juger un premier détecteur.
  4. Des colonnes calculées. Une dérivée, un filtre passe-bas, une normalisation, ou le temps restant avant le prochain évènement labélisé, qui est la cible d’un modèle de durée de vie restante.
  5. Des partitions et des versions. Des jeux d’entraînement, de validation et de test fixés une fois, et le jeu de données figé dans une version à laquelle un modèle peut être rattaché.

Où Ezako l’applique

Ezako a travaillé sur les séries de capteurs à haute fréquence des essais de développement de moteurs avec Safran Aircraft Engines (2021), sur la télémesure de satellites pour le CNES (2020), sur l’ordonnancement des contrôles de plus de 76 000 sites radio avec l’ANFR (2020), et sur la détection de défauts sur un microcontrôleur au sein du projet DeepGreen piloté par le CEA (2023). Upalgo Labeling Timeseries est l’application de bureau construite pour ce travail : des fichiers CSV de 1 000 séries au plus chacun, des évènements en plages ou en points, la recherche de similarité entre séries, des candidats de labels proposés à partir des motifs rares, et des colonnes calculées, le tout sur le poste de travail. Le logiciel et la page d’application donnent le détail.

Sources

Publié en juin 2022 ; réécrit en septembre 2026 autour des labels, des cinq tâches, de ce par quoi un projet commence et des projets menés. Le décompte non sourcé des capteurs dans le monde a été retiré.