Base vectorielle et archives de veille : ce qui devient enfin retrouvable, et à quel prix
Vectoriser ses archives de veille rend retrouvable ce que le mot clé ratait, à condition de traiter la date, les doublons et la dette de réindexation.
À retenir
- Une base vectorielle interroge un fonds de veille par description de situation, sans qu'il faille deviner le vocabulaire employé des années plus tôt.
- Le classement par similarité ignore l'ancienneté : sans filtrage dur sur la date, l'archive remonte aussi volontiers un état périmé que l'état en vigueur.
- Changer de modèle d'embedding oblige à recalculer tout l'index : cette dette de réindexation se budgète avant le déploiement, pas après.
- La proximité sémantique rapproche mécaniquement les reprises d'une même dépêche et fabrique une illusion de corroboration si l'éditeur d'origine n'est pas affiché.
Une cellule de veille produit chaque semaine des bulletins, des notes d'alerte, des captures de sources ouvertes et des fiches de tiers. Au bout de quelques années, ce fonds représente des dizaines de milliers de documents. Il est archivé, sauvegardé, parfois classé avec soin. Il n'est presque jamais relu. La mémoire du dispositif existe, mais elle reste hors de portée au moment précis où elle servirait.
La cause est technique avant d'être humaine. Un moteur classique retrouve les mots qu'un document contient, pas les idées qu'il porte. Or personne ne se souvient de la formulation exacte employée dans une note écrite trois ans plus tôt. On se souvient d'une situation : un fournisseur qui avait retardé une livraison sensible, un signal repéré avant une annonce. Entre ce souvenir et la requête qui le retrouverait, il manque une couche.
Les bases vectorielles occupent cette couche. Elles indexent les documents sous forme de représentations numériques du sens et classent les résultats par proximité sémantique plutôt que par correspondance littérale. Les travaux de l'Observatoire de l'Intelligence Économique sur les délais de détection et sur l'usage réel des fonds documentaires convergent : le stock accumulé reste sous-exploité, et le frein tient à l'accès bien plus qu'au volume.
Ce qu'une base vectorielle change concrètement dans un fonds de veille
Le mécanisme tient en une opération : un modèle d'embedding transforme chaque passage en une suite de nombres, et deux passages qui parlent de la même chose se retrouvent voisins dans cet espace. Interroger l'archive revient à chercher les voisins d'une question, non les documents contenant ses mots. La base vectorielle stocke ces représentations et rend les plus proches en une fraction de seconde, sur plusieurs millions d'extraits.
L'effet pratique se mesure vite. Une requête décrivant une situation, par exemple un retard d'approvisionnement chez un sous-traitant industriel, ramène des notes qui parlaient de rupture de chaîne, de défaut de composant ou d'arrêt de ligne, sans qu'aucun de ces termes ait été tapé. L'analyste cesse de deviner le vocabulaire de ses prédécesseurs. Sur un fonds écrit par des rédacteurs successifs, ce seul gain justifie l'expérimentation.
Un effet secondaire mérite d'être signalé : le franchissement des langues. Certains modèles placent au même endroit une phrase française et son équivalent anglais ou espagnol, ce qui rend consultable une archive multilingue sans traduire tout le corpus au préalable. La qualité se dégrade sur les langues moins représentées, mais l'ouverture est réelle sur les grandes langues d'affaires.
Le vocabulaire dérive, l'archive non : le vrai défaut du mot clé
Une archive de veille vieillit mal du côté des noms. Les entreprises fusionnent, changent de dénomination, abandonnent des marques, réorganisent leurs filiales. Une requête booléenne écrite au moment des faits cesse de fonctionner dès que la chaîne de caractères surveillée n'est plus celle qui est employée. Le document reste dans le fonds, lisible, mais devient inaccessible à toute recherche formulée avec le vocabulaire d'aujourd'hui.
La dérive interne joue autant. Selon l'année et l'auteur, la même réalité s'appelle tiers critique, fournisseur sensible, prestataire de rang deux ou partenaire à risque. La recherche sémantique absorbe une bonne part de cette variation, puisqu'elle raisonne sur le sens des passages et non sur leur libellé. C'est là qu'elle apporte le plus à un fonds ancien.
Elle ne remplace pourtant pas un référentiel d'entités. Sur les noms propres, la similarité est un juge médiocre : deux sociétés homonymes installées dans deux pays se ressemblent beaucoup, et un dirigeant au patronyme courant se confond avec les siens. La configuration qui tient dans la durée reste hybride : un index vectoriel pour l'accès par le sens, un index lexical et un référentiel d'identifiants pour ce qui doit être exact.
La date, angle mort du classement par similarité
Un moteur vectoriel classe par ressemblance et ignore l'ancienneté. Pour une base de connaissances stable, le défaut est mineur. Pour un fonds de veille, il est structurel : la note la plus proche sémantiquement d'une question est très souvent celle qui décrit un état de fait révolu. Le résultat paraît excellent, il est simplement daté, et rien dans son rang d'affichage ne le signale.
Le remède se pose dès la conception. Chaque extrait indexé porte des métadonnées obligatoires : date de publication, date de collecte, éditeur, périmètre, niveau de confidentialité. La recherche applique un filtre dur sur la période avant de calculer les proximités, ou pondère le score final par la fraîcheur. Un index qui ne conserve que le texte et son vecteur condamne l'équipe à trier à la main ce que le moteur aurait dû écarter.
La veille réglementaire illustre le risque. Un texte modifié deux fois laisse dans l'archive trois états successifs du même sujet, rédigés dans les mêmes termes, donc quasiment superposés dans l'espace sémantique. Sans contrainte temporelle explicite, le moteur rend l'état abrogé avec la même assurance que celui en vigueur, et le veilleur qui reprend cette formulation diffuse une erreur que la source n'a jamais commise.
Une archive de veille dont l'horodatage n'est pas fiable ne devient pas plus utile parce qu'elle est vectorisée : elle devient seulement plus rapide à se tromper.
La dette de réindexation : changer de modèle, c'est refaire l'archive
Les vecteurs n'existent que par rapport au modèle qui les a produits. Deux modèles différents fabriquent des espaces incomparables : on ne mélange pas leurs vecteurs dans un même index, et une question encodée avec la version récente ne se compare pas à des documents encodés avec l'ancienne. Changer de modèle implique donc de recalculer l'intégralité du fonds, pas seulement les nouveaux versements.
Cette contrainte a un coût, et il se budgète avant le déploiement. Recalculer plusieurs millions d'extraits mobilise du temps de calcul, une fenêtre pendant laquelle l'index vit en double et une procédure de bascule. Le cahier des charges nomme la version du modèle retenue, la fréquence acceptable de migration et la partie qui assume la dépense. Une équipe qui découvre ce point deux ans plus tard se retrouve figée sur un modèle vieillissant.
La réindexation touche aussi la reproductibilité. Une même requête ne rend pas nécessairement les mêmes résultats avant et après une migration, ce qui interdit de traiter une recherche comme une preuve. Pour un dossier opposé à un tiers ou relu par un juriste, ce qui fait foi reste le document capturé, daté et conservé, avec sa référence de publication.
Doublons et reprises de dépêche : l'illusion de corroboration
La similarité rapproche mécaniquement ce qui se ressemble, donc les reprises d'une même dépêche par des dizaines de supports. Une page de résultats apparemment riche se réduit fréquemment à une source unique, republiée telle quelle. L'analyste pressé y lit une convergence de sources alors qu'il regarde un seul texte photocopié.
Deux garde-fous écartent le piège. Le premier consiste à dédoublonner par proximité avant l'affichage, en regroupant les extraits dont la distance descend sous un seuil et en n'exposant qu'un représentant par groupe. Le second consiste à afficher systématiquement l'éditeur d'origine et la date de première publication, de sorte qu'une reprise se distingue d'une information indépendante d'un simple coup d'oeil.
La même mesure se lit pourtant dans l'autre sens. Une concentration anormale de textes quasi identiques publiés en quelques heures sur des comptes sans historique commun constitue en soi un signal de coordination. Le regroupement sémantique devient alors un instrument de détection, à condition que l'interface montre la densité des groupes et pas seulement leur meilleur représentant.
Conservation, purge et traçabilité : ce que l'index doit hériter du dossier
Un vecteur est une donnée dérivée d'un document, et l'extrait de texte associé est souvent stocké à côté de lui pour être affiché. Toute politique de rétention s'applique donc à l'index autant qu'à la source. Si un dossier est purgé au terme de sa durée de conservation, l'entrée correspondante disparaît de la base vectorielle. Faute de quoi, des extraits supprimés continuent de remonter dans les résultats.
La traçabilité vers l'original est l'autre exigence non négociable. Un résultat doit ramener au document daté, à sa capture et à son éditeur, sans reconstitution approximative. Sur ce point, NewsCore (www.newscore.fr) relie chaque signal remonté à son document d'origine et conserve la référence de publication, ce qui rend un résultat vérifiable des mois après sa collecte.
Restent les droits d'accès, souvent négligés dans les premières mises en oeuvre. Un index unique aplatit les cloisonnements existants : des notes réservées à un comité restreint et des bulletins largement diffusés se retrouvent dans le même magasin. Le filtrage par habilitation s'applique avant le calcul des voisins, jamais au moment de l'affichage, sinon un extrait sensible remonte dans un aperçu avant d'être masqué.
Questions fréquentes sur la recherche sémantique appliquée aux archives de veille
Une base vectorielle remplace-t-elle les requêtes booléennes d'une cellule de veille ?
Non, elle les complète. La requête booléenne reste supérieure dès qu'il faut une exhaustivité contrôlée sur un terme précis, un nom de société ou une nomenclature. La recherche sémantique excelle sur l'exploration et la reformulation. Les dispositifs qui tiennent dans la durée exposent les deux modes dans la même interface.
Faut-il vectoriser toute l'archive ou seulement les documents récents ?
Le plus sage est de commencer par un sous-ensemble homogène, par exemple trois ans de bulletins internes, afin de mesurer la qualité des réponses sur des questions dont on connaît déjà la bonne réponse. L'extension au fonds ancien se décide ensuite : des documents scannés sans reconnaissance de caractères fiable produisent des vecteurs sans valeur.
Comment éviter qu'une recherche sémantique remonte une information périmée ?
En rendant la date obligatoire à l'indexation et en l'appliquant comme filtre, pas comme simple information d'affichage. Une interface de veille sérieuse propose une fenêtre temporelle par défaut, signale visuellement l'âge de chaque résultat et affiche les versions successives d'un même sujet côte à côte.
Combien de temps un index vectoriel reste-t-il valable ?
Tant que le modèle d'embedding reste en service et que les métadonnées suivent, l'index fonctionne sans limite de durée. La vraie échéance est le changement de modèle, décidé pour gagner en qualité ou parce que le fournisseur retire l'ancienne version. Anticiper une réindexation complète tous les deux à trois ans reste une hypothèse de travail raisonnable.