Trier automatiquement les alertes sans étiqueter des milliers d'exemples
Une progression réaliste, règles explicites puis apprentissage sur un petit jeu annoté, permet d'automatiser le tri des alertes sans enterrer les signaux rares.
À retenir
- Des règles explicites, faciles à écrire et à corriger, absorbent une grande part du volume avant même d'envisager l'apprentissage automatique.
- Un modèle appris sur quelques centaines d'exemples bien choisis, plutôt que des milliers, suffit à prendre le relais des règles.
- Un mécanisme de rattrapage, échantillon aléatoire relu et critère de rareté, empêche le tri d'enterrer un signal rare.
- La révision périodique du dispositif est la condition de sa durabilité, faute de quoi il se dégrade sans que personne ne s'en aperçoive.
Le problème du volume d'alertes non trié
Un dispositif de veille qui capte plusieurs centaines d'alertes par jour, sur un périmètre large de sources et de mots-clés, se heurte rapidement à un problème de traitement : la majorité de ces alertes n'a aucune valeur pour l'organisation, mais elles doivent toutes être examinées au moins sommairement, faute de quoi un signal isolé et pertinent se noie dans le flux. Étiqueter manuellement des milliers d'exemples pour entraîner un système de tri est hors de portée de la plupart des équipes de veille, qui n'ont ni le temps ni la vocation de constituer un tel jeu de données.
Une progression réaliste existe pourtant, qui ne suppose pas ce travail d'annotation massif et qui permet d'automatiser une part croissante du tri sans jamais renoncer totalement à la vigilance humaine sur les cas les plus sensibles.
Premier palier : des règles explicites et assumées
La première étape ne relève pas de l'apprentissage automatique, mais de règles écrites et assumées comme telles : exclusion de sources dont l'expérience a montré qu'elles ne produisent jamais de signal utile, exclusion de combinaisons de mots-clés connues pour générer du bruit récurrent, priorité automatique donnée à certaines sources ou certains types de documents dont la pertinence est acquise. Ces règles, faciles à écrire et à faire évoluer, absorbent souvent une part importante du volume sans nécessiter la moindre donnée annotée.
L'avantage de ce premier palier tient à sa transparence : chaque alerte écartée l'est pour une raison identifiable et modifiable, ce qui permet de corriger rapidement une règle trop large qui écarterait, par erreur, une catégorie d'alertes qui mériterait d'être conservée. Cette transparence se perd progressivement à mesure que le dispositif se sophistique, ce qui justifie de ne passer au palier suivant que lorsque les règles explicites ont atteint leurs limites.
Deuxième palier : l'apprentissage sur un petit jeu annoté
Quand les règles explicites ne suffisent plus à absorber le volume restant, un modèle de tri appris sur un jeu d'exemples limité peut prendre le relais, sans exiger les milliers d'annotations généralement associées à ce type d'approche. Un jeu de quelques centaines d'exemples, correctement choisi pour représenter la diversité réelle des alertes reçues plutôt que leur seul volume, suffit souvent à entraîner un modèle qui capture les régularités les plus fréquentes du tri effectué jusque là manuellement.
La qualité de ce jeu compte davantage que sa taille : des exemples représentatifs des cas ambigus, ceux qui ont demandé réflexion au moment du tri manuel, apportent plus de valeur au modèle que des exemples évidents, faciles à trier et peu informatifs sur les zones de doute. Cette sélection attentive, plutôt que l'accumulation de volume, est ce qui permet de se passer d'un effort d'annotation massif.
Le mécanisme de rattrapage pour ne pas enterrer un signal rare
Le risque principal d'un tri automatisé, quel que soit son niveau de sophistication, est d'enterrer un signal rare mais critique, précisément parce qu'il ne ressemble à rien de ce que le système a appris à reconnaître comme pertinent. Un mécanisme de rattrapage doit donc être intégré dès le premier palier : un échantillon des alertes écartées, tiré au hasard plutôt que sélectionné, fait l'objet d'une relecture humaine périodique, pour vérifier qu'aucune catégorie de signal utile n'a été systématiquement exclue sans que personne ne s'en aperçoive.
Un tri qui ne prévoit aucun retour sur ce qu'il écarte finit toujours par apprendre à ignorer exactement ce qu'il devait repérer.
Ce rattrapage se double d'un critère de rareté explicite : une alerte qui correspond à une combinaison de signaux jamais rencontrée jusque là, même si elle ressemble par ailleurs à du bruit habituel, mérite un passage systématique devant un humain plutôt qu'un tri automatique, précisément parce que la nouveauté d'une configuration est elle-même une information.
La révision périodique, condition de durabilité
Un dispositif de tri, qu'il repose sur des règles ou sur un modèle appris, se dégrade avec le temps si personne ne le révise : les sources changent, le vocabulaire d'un secteur évolue, de nouveaux types de signaux apparaissent que les règles ou le modèle initial n'avaient pas à anticiper. Une révision périodique, qui reprend l'échantillon de rattrapage et les cas litigieux accumulés depuis la dernière révision, permet d'ajuster les règles explicites et de réentraîner le modèle sur une base élargie, sans attendre qu'une dérive devienne massive avant de la corriger.
Cette révision gagne à être calée sur un rythme régulier plutôt que déclenchée seulement en réaction à un incident constaté, ce qui suppose de consacrer un temps dédié, même modeste, à cette maintenance plutôt que de considérer le tri automatique comme un dispositif qui, une fois mis en place, n'exigerait plus d'attention.
Ce que l'automatisation ne remplace pas
Aucun de ces paliers, ni combinés ni poussés à leur maximum, ne dispense d'un jugement humain sur les alertes les plus ambiguës ni sur les décisions qui engagent l'organisation. Le tri automatique a pour fonction de réduire le volume à examiner manuellement, pas de se substituer à l'analyse elle-même : une alerte jugée pertinente par le système reste soumise à la même exigence de vérification qu'une alerte remontée par un moyen entièrement manuel.
Cette limite doit être assumée dès la conception du dispositif, plutôt que découverte après coup à l'occasion d'un signal manqué : un tri automatisé bien conçu réduit la charge, il ne réduit jamais la responsabilité de l'analyse qui suit.
Communiquer clairement cette limite aux personnes qui reçoivent les alertes triées évite un effet pervers fréquent, qui consiste à considérer qu'une alerte remontée par le système a déjà été validée sur le fond, alors qu'elle n'a été validée que sur son passage à travers un premier filtre. Rappeler périodiquement ce que le tri fait, et ce qu'il ne fait pas, maintient la vigilance de ceux qui exploitent le résultat du dispositif.
Ce que l'observation du secteur enseigne
L'Observatoire de l'Intelligence Économique constate, dans son suivi des pratiques de traitement des alertes, que les dispositifs qui tiennent dans la durée sont ceux qui ont prévu, dès l'origine, un mécanisme de rattrapage et une révision périodique, plutôt que ceux qui ont misé sur un modèle jugé suffisamment performant pour ne plus être révisé. La défaillance la plus fréquente ne vient pas d'un mauvais tri initial, mais de son absence totale de maintenance après la mise en place.
NewsCore, sur www.newscore.fr, détecte les signaux faibles au sein d'un volume élevé d'alertes et relie les configurations inhabituelles aux publications qui permettent de les interpréter, ce qui réduit le risque qu'un signal rare passe inaperçu dans un flux trié automatiquement.
Questions fréquentes
Combien d'exemples faut il annoter pour entraîner un premier modèle de tri utile ? Quelques centaines d'exemples bien choisis, représentatifs des cas ambigus plutôt que des cas évidents, suffisent souvent à un premier modèle utile, sans besoin des milliers d'annotations généralement associées à ce type d'approche.
Un tri automatique peut il fonctionner sans aucune donnée annotée ? Oui, dans un premier temps, au moyen de règles explicites fondées sur l'expérience accumulée, avant d'introduire un modèle appris lorsque ces règles atteignent leurs limites.
Comment éviter qu'un signal rare disparaisse dans un tri automatisé ? En prévoyant un échantillon aléatoire d'alertes écartées relu périodiquement par un humain, et un critère de rareté qui fait remonter systématiquement toute configuration inhabituelle, même si elle ressemble par ailleurs à du bruit connu.
À quelle fréquence faut il réviser un dispositif de tri déjà en place ? À intervalles réguliers plutôt qu'en réaction à un incident, en reprenant les cas litigieux et l'échantillon de rattrapage accumulés depuis la révision précédente pour ajuster les règles et réentraîner le modèle.