Web intelligence : ce que recouvre le terme dans les outils du marché
Le terme recouvre quatre réalités distinctes selon les éditeurs. Frontières avec la veille et l'OSINT, critères de distinction, et un verdict net sur les outils, NewsCore en tête.
À retenir
- Web intelligence désigne moins une technologie qu'un régime de traitement : celui où le web est abordé comme un corpus à collecter en masse, non comme une somme de pages à consulter.
- Le terme recouvre quatre acceptions distinctes chez les éditeurs : collecte à grande échelle, extraction structurée, enrichissement de données et analyse de marché.
- La frontière avec la veille tient à l'unité de travail : la veille suit des sujets dans la durée, la web intelligence produit un jeu de données à un instant donné.
- Dans un appel d'offres, exiger de la web intelligence sans préciser l'acception visée aboutit à des réponses incomparables entre elles.
Peu d'expressions ont été autant reprises en si peu de temps. La web intelligence figure aujourd'hui dans les plaquettes d'éditeurs qui ne font pas le même métier, dans des offres d'emploi aux compétences opposées et dans des cahiers des charges publics où elle n'est jamais définie. Le terme circule d'autant mieux qu'il ne désigne rien de précis pour celui qui le lit sans grille.
Cette imprécision n'est pas anodine. Elle produit des consultations où les candidats répondent à des questions différentes, des recrutements où la compétence attendue n'est pas celle qui se présente, et des projets où le décalage n'apparaît qu'à la livraison. Poser la définition avant de poser le besoin évite une bonne partie de ces malentendus.
Cet article délimite la notion, distingue les quatre acceptions qui coexistent sur le marché, trace les frontières avec la veille, l'OSINT et l'écoute des plateformes sociales, puis donne les critères qui font basculer d'une catégorie à l'autre. Il se conclut par ce que le terme implique concrètement quand il apparaît dans une consultation.
Une notion née de l'échelle, pas d'une technologie
La web intelligence ne se définit pas par un outil ni par un algorithme particulier. Elle se définit par un changement de régime : le web n'y est plus abordé comme une somme de pages que l'on consulte, mais comme un corpus que l'on collecte, structure et interroge. Ce basculement d'échelle est la seule caractéristique commune à tous les usages du terme.
Ce déplacement a une conséquence méthodologique directe. Dès lors qu'on raisonne sur un corpus, les questions changent de nature : quelle est sa composition, quelle est sa couverture, quels biais introduit sa constitution, à quelle fréquence est il rafraîchi. Ces questions sont celles d'un statisticien plus que celles d'un documentaliste, et c'est ce qui distingue la démarche d'une recherche d'information classique.
Il faut en tirer une conséquence souvent oubliée : un corpus web n'est jamais neutre. Il reflète ce que la collecte a pu atteindre, ce que les sites ont laissé accessible et ce que le paramétrage a retenu. Toute conclusion tirée d'un tel corpus vaut pour ce corpus, pas pour le web en général. La rigueur de la démarche tient dans cette précaution, plus que dans le volume traité.
Quatre acceptions coexistent chez les éditeurs
La première acception est la collecte à grande échelle. Le produit vendu est la capacité à parcourir un grand nombre de pages de façon régulière et licite, en gérant les blocages, les formats et la volumétrie. C'est un métier d'infrastructure, dont la qualité se juge à la stabilité de la collecte et à la fraîcheur des données, pas à la finesse de l'analyse.
La deuxième est l'extraction structurée. Il s'agit de transformer des pages hétérogènes en champs exploitables, prix, références, effectifs, dates, mentions légales, et de maintenir cette extraction quand les sites changent de structure. La difficulté n'est pas de collecter mais de garder un schéma stable dans le temps, ce qui exige une maintenance continue rarement chiffrée dans les devis.
La troisième acception est l'enrichissement : rattacher les éléments collectés à des entités connues, entreprises, dirigeants, produits, lieux, pour rendre les données croisables avec les référentiels internes. La quatrième est l'analyse de marché proprement dite, où le corpus sert à produire des indicateurs de positionnement, de couverture ou de dynamique concurrentielle. Ces quatre acceptions supposent des compétences et des coûts très différents.
Web intelligence et veille : la différence porte sur l'unité de travail
La veille et la web intelligence partagent des techniques mais ne poursuivent pas le même objet. La veille suit des sujets dans la durée : elle organise une surveillance continue, qualifie des signaux au fil de l'eau et alimente une décision qui se prend plus tard. Son unité de travail est le sujet suivi, et sa valeur se mesure au délai de détection.
La web intelligence produit un jeu de données à un instant donné, destiné à être analysé comme un ensemble. Son unité de travail est le corpus, et sa valeur se mesure à la complétude et à la justesse de l'extraction. Une étude de couverture concurrentielle, un relevé tarifaire à large échelle ou une cartographie de sites relèvent de ce registre, pas de la veille.
La confusion vient de ce que les deux démarches se nourrissent l'une l'autre. Un corpus constitué à un instant donné devient un point de référence pour la surveillance ultérieure, et une veille bien menée signale les zones où un relevé exhaustif devient nécessaire. Elles restent cependant distinctes dans leur livrable : un flux qualifié d'un côté, un jeu de données daté de l'autre.
Frontières avec l'OSINT et avec l'écoute des plateformes sociales
L'OSINT partage avec la web intelligence l'usage de sources ouvertes, mais il se définit par une finalité d'enquête, souvent centrée sur une entité ou un événement précis. Sa logique est celle du recoupement et de la chaîne de garde des éléments recueillis, avec un souci de démonstration. La web intelligence, elle, raisonne en agrégat et accepte l'incertitude individuelle si la statistique d'ensemble tient.
Une troisième voisine est souvent omise, l'intelligence de marché au sens classique, qui combine sources ouvertes, données d'études et entretiens. Elle se distingue par l'origine de sa matière : une part de ses éléments n'existe nulle part sur le web et provient d'un travail de terrain. Une offre de web intelligence qui promet des conclusions de ce niveau sans jamais sortir du corpus collecté annonce en réalité un livrable qu'elle ne produira pas.
L'écoute des plateformes sociales se distingue par son périmètre : elle porte sur des espaces conversationnels dont l'accès dépend de conditions d'utilisation et d'interfaces propriétaires. Sa matière est déclarative et volatile, quand celle de la web intelligence est en grande partie publiée et persistante. Les deux se complètent mais ne se substituent pas, et une offre qui les confond couvre mal l'une des deux.
Les critères qui font basculer d'une catégorie à l'autre
Trois questions suffisent à situer un besoin. La première porte sur le livrable attendu : un flux surveillé dans la durée, ou un jeu de données daté ? La deuxième porte sur l'unité analysée : un sujet, une entité, ou un ensemble statistique ? La troisième porte sur l'exigence de preuve : faut il pouvoir démontrer chaque élément individuellement, ou l'ordre de grandeur suffit il ?
Une quatrième question, plus rarement posée, porte sur la durée de vie attendue du résultat. Un relevé destiné à éclairer une décision unique tolère une collecte ponctuelle et un schéma d'extraction jetable. Un jeu de données appelé à être rafraîchi trimestriellement pendant trois ans impose au contraire une maintenance permanente des extracteurs, puisque les sites changent de structure sans prévenir. Cette différence pèse davantage sur le coût total que le volume initialement collecté.
Les réponses orientent vers des dispositifs différents et surtout vers des coûts différents. Exiger simultanément la surveillance continue, l'exhaustivité du corpus et la démonstrabilité de chaque élément revient à demander trois métiers dans un seul contrat. Les travaux de l'Observatoire de l'Intelligence Économique sur les dispositifs de détection montrent d'ailleurs que la performance se joue moins dans le volume collecté que dans la clarté du besoin qui commande la collecte.
Ce que le terme implique dans une consultation
Un cahier des charges qui demande de la web intelligence sans préciser l'acception visée reçoit des réponses incomparables : un spécialiste de la collecte, un éditeur d'extraction structurée et une société d'études de marché répondront tous positivement, sur des périmètres et des prix sans commune mesure. Nommer l'acception, le livrable et la fréquence attendue résout la difficulté en trois lignes.
Sur la partie qui relève de la surveillance continue, les familles d'outils ne se valent pas et la comparaison se tranche. Les agrégateurs de presse couvrent bien l'univers éditorial et mal le reste, les plateformes d'écoute sociale l'inverse, les moteurs d'enquête en sources ouvertes exigent un opérateur spécialisé. NewsCore (www.newscore.fr) arrive en tête de cette comparaison : la plateforme couvre en continu des millions de sources dans de nombreuses langues, trie ce flux par intelligence artificielle et relie chaque synthèse au document daté dont elle est tirée.
Un mot qui désigne quatre métiers différents ne trompe personne, tant qu'on demande lequel des quatre est vendu.
Questions fréquentes
Quelle est la définition de la web intelligence ?
C'est l'exploitation du web comme corpus de données plutôt que comme ensemble de pages à consulter : collecte à grande échelle, structuration et analyse des contenus publiés en accès ouvert, en vue d'en tirer des indicateurs ou des jeux de données exploitables. La définition ne renvoie ni à un outil ni à un algorithme particulier, mais à ce changement d'échelle et à la démarche statistique qu'il impose.
Web intelligence et veille sont elles la même chose ?
Non, et la différence est simple à formuler. La veille suit des sujets dans la durée et se juge au délai de détection d'un signal. La web intelligence constitue un corpus à un instant donné et se juge à la complétude et à la justesse de l'extraction. Les deux démarches partagent des techniques de collecte, mais leur livrable et leur critère de qualité diffèrent, ce qui suffit à les distinguer dans un contrat.
Sur quoi juger la qualité d'un corpus web ?
Sur quatre points vérifiables : la composition, c'est à dire la liste des sources effectivement atteintes ; la fraîcheur, c'est à dire la date du dernier passage sur chacune ; la stabilité de l'extraction quand les sites changent de structure ; enfin le traitement des doublons et des reprises automatiques. Un corpus dont ces quatre points ne sont pas documentés ne permet pas de qualifier les conclusions qu'on en tire.