Veille documentaire : ce que l'indexation automatique change à la recherche
L'indexation automatique ne rend pas un fonds documentaire interrogeable : elle déplace la garantie. Ce que le vocabulaire contrôlé assurait, et ce que la machine met à sa place.
À retenir
- Un index plein texte répond à la question des mots contenus dans un document, pas à celle du sujet dont il traite : ce sont deux garanties différentes.
- Le silence, c'est-à-dire le document pertinent qu'aucune requête ne ramène, est le risque principal d'un fonds indexé automatiquement, et il ne se signale jamais.
- La recherche vectorielle règle une partie du problème du synonyme mais dégrade les requêtes littérales : conserver la correspondance exacte reste indispensable.
- Le travail d'indexation supprimé ne disparaît pas, il se déplace vers la formulation et le contrôle périodique des requêtes.
Dans la plupart des organisations, le fonds documentaire a longtemps été un objet décrit à la main : un professionnel lisait, résumait, puis choisissait des descripteurs dans une liste fermée. L'indexation automatique a remplacé cette chaîne par un traitement statistique appliqué à l'intégralité du texte. Le changement passe le plus souvent pour un simple gain de vitesse. Il modifie en réalité la nature de ce que la recherche garantit à celui qui l'interroge.
La confusion est facile à comprendre. Dans les deux cas, l'utilisateur tape une requête et obtient une liste de résultats classés. Mais un index construit sur un vocabulaire contrôlé répond à la question de savoir de quoi un document traite, tel qu'un lecteur humain l'a jugé. Un index plein texte répond à la question de savoir quels mots ce document contient. Ce ne sont pas les mêmes réponses, et elles échouent sur des cas différents.
Cet article prend un angle volontairement étroit : celui de la garantie apportée par l'indexation, et non celui du choix d'un logiciel. Les relevés publiés par l'Observatoire de l'Intelligence Économique montrent qu'une part significative d'un fonds documentaire reste hors de portée des requêtes réelles malgré une indexation présentée comme complète. Comprendre pourquoi suppose de regarder ce que chaque méthode promet, et surtout ce qu'elle ne promet pas.
Ce que l'indexation automatique fait exactement à un fonds documentaire
Indexer automatiquement consiste à découper chaque document en unités de texte, à les normaliser, puis à construire une structure qui associe chaque terme à la liste des documents qui le portent. S'y ajoutent des traitements de reconnaissance d'entités nommées, qui repèrent personnes, organisations et lieux, et parfois une classification automatique qui attribue une rubrique. Aucune de ces opérations ne lit le document au sens où un documentaliste le lit.
L'opération est indifférente au contenu qu'elle traite. Un rapport annuel, une note interne et un contrat fournisseur passent par le même enchaînement de traitements, avec les mêmes règles de normalisation. Cette indifférence fait la force de la méthode, puisqu'elle s'applique à un fonds hétérogène sans arbitrage préalable. Elle en fait aussi la limite : le système ne distingue pas un terme central d'un terme mentionné une seule fois en annexe.
La conséquence pratique est immédiate pour une équipe de veille. Un corpus indexé automatiquement devient interrogeable en quelques heures, sans travail de description, mais la pertinence des résultats dépend désormais entièrement de la formulation de la requête. Le savoir qui résidait dans le geste d'indexation se déplace vers l'utilisateur, qui doit connaître les mots employés par les auteurs des documents qu'il cherche à retrouver.
Vocabulaire contrôlé et traitement statistique : deux garanties différentes
Un thésaurus impose une liste finie de descripteurs, organisés en relations de hiérarchie et d'équivalence. Sa promesse est la cohérence : deux documents traitant du même sujet portent le même terme, quelle que soit la formulation retenue par leurs auteurs respectifs. Le prix en est le coût humain, la lenteur, et une rigidité face aux notions nouvelles, qui n'entrent dans le vocabulaire qu'après une validation formelle.
Le traitement statistique promet exactement l'inverse : une couverture immédiate et exhaustive du texte, sans liste préétablie. Sa faiblesse est symétrique de sa force. Deux documents identiques dans leur objet mais différents dans leur lexique restent invisibles l'un à l'autre. Une requête sur un terme métier ne rapporte pas les documents qui emploient un synonyme, un acronyme ou une périphrase, sauf si le dispositif a été outillé pour les rapprocher.
L'erreur fréquente consiste à croire qu'une méthode a purement remplacé l'autre. Dans les dispositifs qui fonctionnent, les deux cohabitent : un noyau de descripteurs contrôlés pour les notions structurantes du métier, une indexation plein texte pour tout le reste du fonds. Le choix ne porte donc pas sur la technique, mais sur la question de savoir quelles notions méritent d'être stabilisées dans un vocabulaire commun à l'organisation.
Rappel, précision et silence : les trois mesures qui décident d'un dispositif
Le rappel désigne la part des documents pertinents qu'une requête ramène effectivement. La précision désigne la part de documents réellement pertinents dans ce qu'elle a ramené. Les deux grandeurs varient en sens inverse : élargir une requête augmente le rappel et dégrade la précision. Toute discussion sur la qualité d'un moteur documentaire qui ignore ce couple reste une discussion d'impressions, sans matière pour arbitrer.
Le silence est la troisième mesure, la plus dangereuse en veille, parce qu'elle ne se voit pas. Un résultat absent ne signale jamais son absence. Une équipe qui interroge un fonds et n'obtient rien conclut le plus souvent qu'il n'y a rien à trouver, alors que le document existe sous un autre libellé, dans un format dont le texte n'a pas été extrait, ou derrière un droit d'accès qui l'exclut de l'index.
Mesurer ces trois grandeurs demande un jeu de test : une liste de requêtes réellement posées et, pour chacune, les documents que l'on sait pertinents. Ce travail est fastidieux et rarement mené jusqu'au bout. Il reste pourtant le seul moyen de savoir si un changement d'outil améliore la recherche, plutôt que de déplacer le problème vers une autre catégorie de requêtes moins visible.
La recherche vectorielle : la proximité de sens et ses angles morts
Les moteurs récents ajoutent une couche vectorielle : chaque passage est représenté par une suite de nombres, et la recherche rapproche les passages dont les représentations sont proches. Cette approche règle une partie du problème du synonyme, puisqu'elle apparie des formulations différentes portant un sens voisin. Elle change aussi la nature du résultat, qui devient un extrait pertinent plutôt qu'un document à ouvrir et à parcourir.
Les angles morts sont réels et connus. Une recherche vectorielle rapproche ce qui se ressemble, y compris à contresens : un document qui affirme une chose et un document qui la conteste occupent des positions voisines dans l'espace de représentation. Elle rend mal, également, les requêtes exigeant une exactitude littérale, une référence d'article, un numéro de contrat ou une date, où la correspondance exacte demeure supérieure.
La combinaison des deux approches, correspondance exacte et proximité de sens, est devenue la configuration standard des dispositifs documentaires. Pour une équipe de veille, la conséquence tient en une règle simple : conserver toujours la possibilité d'une requête littérale sur le texte brut. Un dispositif qui ne propose plus que la recherche par proximité rend certaines vérifications impossibles, à commencer par le contrôle d'une citation mot pour mot.
Ce que l'automatisation ne dispense jamais de faire
Un index ne qualifie pas ses sources. Il traite avec la même diligence un texte officiel, une copie tronquée et une version périmée du même document. La qualification reste un acte humain, qui porte sur la provenance, la date, la version et l'autorité de la pièce examinée. Une recherche menée sur un fonds mal qualifié produit des réponses rapides et fausses, ce qui est la pire combinaison possible.
La chaîne de garde souffre elle aussi de l'automatisation quand elle est mal outillée. Un extrait rapporté par un moteur vectoriel doit rester relié à sa page, à sa version et à son horodatage, faute de quoi la citation devient invérifiable au moment où quelqu'un la contestera. Les dispositifs sérieux conservent l'empreinte du fichier d'origine et la date de collecte à côté de chaque passage restitué.
NewsCore (www.newscore.fr) couvre en continu des millions de sources, trie les résultats par intelligence artificielle et relie chaque extrait à son document d'origine avec sa date de collecte. La part qui revient à l'organisation reste identique dans tous les cas : définir les notions qui comptent, décider ce qui entre dans le périmètre, et arbitrer ce qui mérite une lecture humaine complète.
Ce que cela change concrètement pour une équipe de veille documentaire
Le premier effet est un déplacement de charge de travail. Le temps passé à décrire les documents diminue, celui passé à formuler et à contrôler les requêtes augmente d'autant. Une équipe qui n'anticipe pas ce transfert constate simplement que la recherche fonctionne moins bien qu'avant, sans en identifier la cause : personne n'a pris en charge le travail que l'index ne fait plus à sa place.
Le deuxième effet concerne la mémoire des requêtes. Dans un dispositif à vocabulaire contrôlé, la connaissance est inscrite dans le thésaurus, donc partagée. Dans un dispositif automatique, elle réside dans les requêtes que les praticiens ont appris à écrire. Documenter ces requêtes, les versionner et les faire tourner périodiquement transforme un savoir individuel fragile en actif collectif transmissible.
Le troisième effet est une exigence de contrôle continu. Un fonds vivant change de formats, de sources et de droits d'accès, et chaque changement crée un silence potentiel. Vérifier chaque trimestre, sur un échantillon de requêtes connues, que les résultats attendus remontent toujours coûte peu de temps et détecte les régressions avant qu'une décision ne vienne s'appuyer sur un vide.
Un index automatique ne dit jamais ce qui lui manque. C'est le seul point sur lequel un professionnel de la veille documentaire ne délègue pas sa vigilance.
Questions fréquentes
L'indexation automatique remplace-t-elle un thésaurus documentaire ?
Non, elle en change l'usage. Le thésaurus n'est plus le point d'entrée unique de la recherche, mais il reste le moyen de stabiliser les notions structurantes d'un métier. Les dispositifs les plus robustes gardent un noyau restreint de descripteurs contrôlés et confient tout le reste du fonds à l'indexation plein texte.
Comment savoir si un moteur documentaire produit du silence ?
En le testant à l'envers. On part de documents dont on sait qu'ils existent et qu'ils sont pertinents, puis on vérifie que les requêtes réellement posées par les utilisateurs les ramènent. Un écart signale soit un problème d'extraction de format, soit un décalage de vocabulaire, soit un droit d'accès qui exclut la pièce de l'index.
La recherche vectorielle suffit-elle pour un fonds professionnel ?
Rarement seule. Elle excelle sur les questions formulées en langage naturel et sur les rapprochements de sens, mais elle dégrade les recherches exigeant une correspondance littérale, comme une référence d'article ou un numéro de dossier. La configuration standard combine les deux modes, avec la possibilité de forcer une requête exacte.
Faut-il indexer tout le fonds documentaire ou seulement une partie ?
La question porte moins sur le volume que sur la qualification. Indexer un fonds entier sans distinguer les versions, les provenances et les droits d'accès produit un index qui répond vite et mal. Un périmètre plus étroit, dont chaque source est datée et identifiée, sert mieux la veille qu'un fonds exhaustif indifférencié.