mercredi 7 octobre 2026
Technologies

Web intelligence : les briques d'une collecte à grande échelle

Découverte, collecte, normalisation, déduplication, enrichissement, restitution : six briques, six modes de défaillance propres qu'un tableau de bord ne montre jamais.

La rédaction21 août 20268 min de lecture

À retenir

  • La web intelligence ne désigne pas la collecte mais la chaîne complète qui transforme des pages en corpus interrogeable.
  • La brique de découverte décide de ce qui existe pour le dispositif : tout ce qu'elle ignore est définitivement absent des analyses.
  • La déduplication fait passer du volume au corpus ; sans elle, la reprise automatisée domine tous les comptages.
  • L'enrichissement automatique fabrique du sens et des erreurs à la même vitesse, ce qui impose un taux d'erreur mesuré et publié.

Le terme web intelligence circule beaucoup et désigne rarement la même chose. Pour un éditeur, il vend une capacité à extraire de la donnée du web à grande échelle. Pour une direction, il promet une connaissance des marchés. Entre les deux se trouve une chaîne technique de six briques, dont chacune a son propre mode de défaillance et sa propre facture.

Cette chaîne mérite d'être décrite pour une raison très concrète : les erreurs d'un dispositif de collecte à grande échelle ne se manifestent presque jamais là où elles se produisent. Une découverte incomplète ressemble à un marché calme. Une déduplication absente ressemble à une actualité intense. Une extraction défaillante ressemble à un changement de vocabulaire du secteur. Cette dissociation entre la cause et le symptôme explique que des dispositifs coûteux tournent des mois sur un corpus dont personne ne conteste les résultats.

Ce qui suit délimite chacune de ces six briques et le type d'erreur qu'elle produit, en s'appuyant sur les observations de l'Observatoire de l'Intelligence Économique relatives à la part réellement indexée et interrogeable d'un fonds de sources. L'objectif est de rendre lisible ce qu'un chiffre de couverture veut dire quand un fournisseur l'annonce.

Web intelligence : ce que le terme recouvre au-delà de la collecte

La web intelligence désigne la chaîne complète qui transforme des pages hétérogènes en corpus interrogeable et daté. La collecte n'en est qu'un maillon, et pas le plus déterminant. Une organisation qui aspire beaucoup et structure peu détient un entrepôt de fichiers, pas un dispositif de renseignement, et son coût de stockage progresse plus vite que sa capacité d'analyse.

La distinction avec la veille classique tient à l'échelle et à l'objet. La veille suit un flux sélectionné de sources identifiées et connues. La web intelligence traite un volume dont l'inventaire n'est pas connu à l'avance et où la découverte fait partie du travail. Ce déplacement change les métiers requis autant que l'outillage.

La conséquence est budgétaire avant d'être technique. Un projet de web intelligence dépense classiquement plus en normalisation et en qualification qu'en collecte, alors que les devis présentent l'inverse. Un dispositif qui découvre cette répartition en cours de route arbitre dans l'urgence, en général au détriment de la qualification, c'est-à-dire de ce qui produit la valeur. Retenir cette répartition avant de signer évite l'arbitrage le plus destructeur d'un projet de web intelligence, celui qui sacrifie la qualification pour financer du volume.

Découverte : la brique qui décide de ce qui existe

La découverte constitue et entretient la liste des adresses à visiter. Elle combine des sources d'amorçage, un suivi des liens sortants, des annuaires sectoriels et parfois des requêtes sur moteurs. Elle décide de ce qui existe pour le dispositif : une source que la découverte ignore n'apparaîtra dans aucune analyse, et son absence ne déclenche aucune alerte.

C'est la brique la plus sous-investie et la plus discrètement biaisée. Un amorçage constitué de grands médias oriente durablement la découverte vers les grands médias, puisque les liens sortants reproduisent la structure du point de départ. Les publications professionnelles, les sites institutionnels locaux et les forums spécialisés restent hors champ sans que rien ne le signale. Le biais est d'autant plus tenace qu'il produit un corpus cohérent et abondant, donc rassurant pour qui regarde des volumes plutôt que des manques.

Le contrôle passe par un test simple et régulier : constituer à la main une liste de trente sources que le domaine considère comme importantes, puis vérifier combien la découverte a trouvées seule. Le taux de recouvrement obtenu vaut mieux que n'importe quel chiffre de couverture annoncé, parce qu'il est mesuré sur le périmètre qui intéresse l'organisation.

Collecte : le débit n'est pas la performance

La collecte récupère les documents et se mesure habituellement en pages par heure. Cet indicateur est le plus trompeur de la chaîne. Une collecte rapide qui ignore les pages dynamiques, échoue sur les contenus chargés par script ou se fait limiter par les hébergeurs remplit des logs flatteurs et un corpus troué à des endroits qu'aucun total ne révèle.

Les indicateurs utiles sont ailleurs : taux de réussite par domaine, part des pages récupérées complètes, délai médian entre publication et collecte, part des domaines qui limitent activement l'accès. Ces quatre mesures disent où le dispositif est aveugle. Elles figurent rarement dans les interfaces, parce qu'elles décrivent des échecs plutôt que des volumes. Les réclamer explicitement lors d'un appel d'offres révèle en quelques minutes le degré de maturité réelle d'une solution de collecte.

La politesse technique appartient à cette brique et conditionne sa durabilité. Un débit modéré, le respect des en-têtes de limitation et l'espacement des requêtes aux heures de charge évitent le blocage, qui reste la première cause de trou dans un corpus. Une collecte agressive obtient beaucoup pendant deux semaines, puis plus rien, sans prévenir personne.

Normalisation et déduplication : le passage du volume au corpus

La normalisation extrait d'une page ce qui constitue le document : titre, corps, date de publication, auteur, langue. Ce travail paraît trivial et concentre une part importante des erreurs d'un dispositif. Une date de publication mal extraite déplace un document dans le temps, et un document mal daté fausse toute analyse de séquence, qui est précisément l'apport de la veille. Les pages dépourvues de date explicite, très courantes sur les sites institutionnels, obligent à choisir entre une estimation assumée et une exclusion du corpus.

La déduplication fait passer du volume au corpus. Sans elle, un communiqué repris par des dizaines de sites d'agrégation pèse des dizaines de documents, et les comptages reflètent l'intensité de la syndication plutôt que celle de l'attention. Les observations citées plus haut sur la part réellement exploitable d'un fonds convergent sur ce point : le volume brut surestime largement la matière utile.

Trois niveaux de traitement existent : l'empreinte exacte, qui n'attrape que les copies strictes ; la similarité approchée, qui regroupe les quasi-doublons ; et la remontée à la source primaire, qui identifie le premier document publié et rattache les autres. Le troisième niveau coûte le plus cher et reste le seul qui rende les comptages comparables dans le temps.

Enrichissement et qualification : la couche qui fabrique du sens et des erreurs

L'enrichissement ajoute au document ce qui le rend interrogeable : entités nommées, secteur, thème, tonalité, rattachement à une organisation connue. C'est la couche qui transforme un texte en donnée et celle qui fabrique le plus d'erreurs invisibles, parce qu'une étiquette fausse ne ressemble pas à une erreur : elle ressemble à une information.

Deux difficultés dominent. L'homonymie d'abord : une raison sociale courante rattache à une entreprise des documents qui concernent une homonyme, un lieu ou une personne. Le contexte ensuite : une tonalité calculée sur un extrait manque l'ironie, la citation et la reprise critique, trois figures très fréquentes dans les corpus de presse et de conversation.

La seule réponse robuste est la mesure. Un échantillon de deux à trois cents documents relus à la main donne un taux d'erreur par étiquette, qui se publie à côté des résultats. Cette mesure coûte deux jours par an et vaut plus que n'importe quelle promesse de précision, car elle porte sur le corpus réel de l'organisation. Publier ce taux plutôt que le taire renforce paradoxalement la confiance dans les résultats, puisqu'il montre que l'incertitude est connue et bornée.

Index, restitution et retour à la source primaire

La dernière brique rend le corpus interrogeable et ramène l'analyste au document d'origine. Un index qui répond vite sur des mots-clés et mal sur des combinaisons de critères oblige à ressortir la donnée pour la retraiter ailleurs, ce qui annule une partie de l'investissement consenti sur les briques précédentes.

La traçabilité est le critère décisif de cette couche. Chaque résultat affiché doit conserver l'adresse d'origine, la date de collecte et une empreinte du contenu, afin qu'un analyste vérifie sans reconstituer. Sans ce retour possible à la source primaire, un dispositif produit des chiffres que personne n'est en mesure de défendre lors d'une contestation. Le retour à la source primaire est aussi ce qui sépare un livrable de veille d'une note d'opinion, aux yeux d'un auditeur comme d'un juge.

Assembler ces six briques en interne reste possible et rarement rentable en dessous d'une certaine échelle. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, industrialise la normalisation et le tri par intelligence artificielle et conserve le lien vers chaque publication d'origine, ce qui donne aux équipes un corpus traçable dès le premier jour.

Les erreurs d'une collecte à grande échelle ne se voient jamais là où elles se produisent : une découverte incomplète ressemble à un marché calme, et un corpus non dédoublonné à une actualité intense.

Questions fréquentes

Qu'est-ce que la web intelligence ?

C'est la chaîne complète qui transforme des pages web hétérogènes en corpus daté et interrogeable : découverte des sources, collecte, normalisation, déduplication, enrichissement, restitution. La collecte n'en constitue qu'un maillon, et l'essentiel du coût se concentre dans la structuration qui vient après elle.

Quelle différence avec la veille classique ?

La veille suit un flux de sources identifiées et choisies à l'avance. La web intelligence traite un volume dont l'inventaire n'est pas connu, ce qui fait de la découverte des sources une partie du travail. L'écart d'échelle change les compétences requises autant que l'outillage nécessaire.

Que vaut un chiffre de couverture annoncé par un fournisseur ?

Peu de chose sans le périmètre auquel il se rapporte. La mesure utile s'obtient en dressant une liste de trente sources que le domaine juge importantes, puis en vérifiant combien l'outil en trouve seul. Ce taux de recouvrement, mesuré sur le périmètre de l'organisation, vaut mieux qu'un total global.

Comment contrôler la qualité des étiquettes automatiques ?

Par un échantillon de deux à trois cents documents relus manuellement, qui donne un taux d'erreur par type d'étiquette. Cette mesure se refait une fois par an et se publie à côté des résultats, car elle porte sur le corpus réel de l'organisation et non sur un jeu de test générique.

À la source

Pour approfondir