Web intelligence : ce que la donnée du web ouvert établit vraiment sur une entreprise
La donnée du web ouvert établit certains faits sur une entreprise, en indique d'autres et n'en suggère que quelques-uns : où passe exactement la frontière probante.
À retenir
- La web intelligence tient à trois éléments : un périmètre accessible sans contournement, une finalité de décision, une traçabilité vers le document d'origine.
- Le web ouvert établit surtout des faits de registre et des faits de déclaration ; les intentions et les performances réelles restent au niveau de l'indice.
- Quatre défauts invalident une conclusion : absence de date, homonymie, circularité des reprises, biais de disponibilité.
- Un livrable utilisable sépare visiblement faits établis, indications et hypothèses, et signale ce qui n'a pas été trouvé.
L'expression web intelligence désigne l'exploitation méthodique des données publiquement accessibles sur le web pour éclairer une décision économique. Elle circule beaucoup, souvent comme synonyme de veille ou de collecte automatisée. Cette imprécision a une conséquence directe : on attribue à la donnée du web ouvert une valeur probante qu'elle n'a pas toujours.
La question utile n'est pas ce que l'on parvient à collecter, mais ce que l'on parvient à établir. Un site institutionnel, une base d'immatriculation, une offre d'emploi et un commentaire anonyme se ramassent avec les mêmes outils et ne fondent pas les mêmes conclusions. Confondre ces deux registres est la première cause de livrables contestés.
Cet article délimite la notion, puis distingue trois niveaux : ce que la donnée du web ouvert établit, ce qu'elle indique et ce qu'elle suggère seulement. Les constats rapportés ici s'appuient sur les relevés publiés par l'Observatoire de l'Intelligence Économique.
Web intelligence : une définition qui tient en trois éléments
Trois éléments suffisent à cerner la notion. Le premier est le périmètre : des données accessibles sans authentification privilégiée ni contournement de protection technique. Le deuxième est la finalité : éclairer une décision d'affaires précise, et non constituer un stock. Le troisième est la traçabilité : chaque énoncé produit renvoie à un document localisable.
Retirer l'un des trois change la nature de l'activité. Sans périmètre défini, la collecte devient une aspiration indiscriminée dont la conformité ne se démontre plus. Sans finalité, elle produit des tableaux que personne ne lit. Sans traçabilité, elle produit des affirmations que personne ne vérifie, donc que personne n'ose utiliser devant un contradicteur.
La web intelligence se distingue ainsi de la veille, qui suit un flux dans le temps, et de l'investigation en sources ouvertes, qui cherche à établir un fait ponctuel sur une cible. Elle emprunte aux deux, mais son objet propre est la caractérisation d'une entité à partir de sa trace publique, à une date donnée.
Une conséquence suit immédiatement cette délimitation : la web intelligence se commande, elle ne s'improvise pas. La demande doit énoncer la décision à éclairer, l'entité concernée sans ambiguïté d'identifiant, la date d'arrêt de la collecte et le niveau de preuve attendu sur chaque question posée. Une commande formulée comme tout ce que l'on trouve sur cette société produit invariablement un dossier volumineux et inutilisable, parce que rien n'y permet de distinguer le fait de registre du commentaire recopié. Le cadrage est donc la première tâche technique du travail, avant tout paramétrage d'outil, et c'est aussi la seule qui protège l'analyste : elle fixe par écrit ce qu'il s'engage à établir et ce qu'il ne prétendra pas savoir.
Établir, indiquer, suggérer : trois niveaux à ne pas mélanger
Une donnée établit un fait quand elle provient d'une source primaire qui fait autorité sur ce fait, et qu'elle est datée. L'adresse du siège d'une société, la composition de son conseil, la date de dépôt de ses comptes relèvent de ce niveau : le registre est l'autorité, l'énoncé est vérifiable par un tiers.
Une donnée indique quand elle est fiable sur elle-même mais indirecte sur la question posée. Vingt offres d'emploi de techniciens dans une même région indiquent une montée en charge industrielle, elles ne l'établissent pas. La donnée est solide, l'inférence l'est moins, et le livrable doit porter cette différence de façon visible.
Une donnée suggère quand elle est faible sur elle-même, non attribuable ou non datable : un commentaire anonyme, une capture sans contexte, une page dont la date de mise à jour est absente. Ce niveau alimente des hypothèses de travail. Il ne fonde ni une décision, ni une note transmise à une direction.
Ce que le web ouvert établit vraiment sur une entreprise
La liste est plus courte qu'on ne le croit, mais elle est solide. Existence juridique, forme sociale, dirigeants déclarés, comptes déposés lorsqu'ils le sont, marques et brevets publiés, décisions de justice publiées, autorisations administratives, sanctions rendues publiques par les autorités : autant de faits établis par des registres accessibles à tous. L'autorité de ces registres porte toutefois sur ce qu'ils enregistrent : ils établissent qui est déclaré dirigeant, non qui dirige effectivement l'entreprise au quotidien.
S'y ajoutent les déclarations de l'entreprise elle-même, qui établissent non pas la réalité mais le fait de la déclaration. Une entreprise qui annonce une usine établit qu'elle l'a annoncé, à cette date, dans ces termes. C'est déjà beaucoup : les écarts entre annonces successives constituent l'un des signaux les plus robustes du domaine.
L'Observatoire de l'Intelligence Économique rapporte que la part réellement établissable d'un dossier d'entreprise dépend surtout du régime de publication du pays d'implantation, bien avant les moyens techniques engagés dans la collecte. Le même effort ne rend pas le même résultat selon la juridiction concernée, ce qui interdit les comparaisons naïves entre filiales.
Ce que le web ouvert ne fait qu'indiquer
Les intentions, les marges, la santé réelle d'un site industriel, la solidité d'un partenariat, l'avancement d'un projet : rien de tout cela ne s'établit en sources ouvertes. Ces objets se déduisent d'un faisceau, offres d'emploi, appels d'offres, mouvements de dirigeants, marchés publics attribués, publications techniques, avis de sous-traitants. Le veilleur pressé confond volontiers ce niveau avec le précédent, et c'est précisément là que le dossier devient contestable.
Le faisceau a une vertu et un piège. La vertu est la convergence : quand quatre indices indépendants pointent dans le même sens, la probabilité augmente sensiblement. Le piège est la dépendance cachée, quand les quatre indices proviennent en réalité de la même source recopiée, ce qui produit une convergence purement apparente.
Le contrôle est simple à formuler : pour chaque indice, remonter à la publication d'origine et vérifier qu'elle n'est pas la reprise d'un autre indice du même faisceau. Cet exercice élimine souvent la moitié des éléments rassemblés, et c'est précisément ce qui donne au dossier restant sa valeur devant un lecteur exigeant.
Les quatre défauts qui invalident une conclusion
Le premier défaut est l'absence de date. Une donnée du web sans date ne se rattache à aucun état du monde et ne confirme rien. Le deuxième est l'homonymie : deux entités portant le même nom, deux établissements du même groupe, deux identifiants confondus au moment de la consolidation du dossier.
Le troisième est la circularité déjà décrite, quand un agrégateur cite un autre agrégateur. Le quatrième est le biais de disponibilité : on conclut sur ce qui se trouve, et l'on tient pour inexistant ce qui ne se publie pas. Une filière peu bavarde paraît alors moins active qu'une filière communicante.
Aucun de ces défauts ne se corrige en augmentant le volume collecté. Ils se corrigent par une règle de qualification appliquée avant l'analyse : identifiant unique retenu, date exigée, source primaire remontée, absence de donnée signalée comme telle dans le livrable au lieu d'être passée sous silence par commodité.
Reste un cinquième défaut, plus insidieux, propre aux collectes automatisées : la dérive de périmètre. Un jeu de requêtes conçu pour une entité finit par ramasser ses homonymes, ses filiales étrangères et ses partenaires commerciaux, parce que le paramétrage n'a pas été revu depuis des mois. Le volume progresse, la précision baisse, et personne ne s'en aperçoit puisque le tableau de bord continue de se remplir régulièrement. Le contrôle est peu coûteux : échantillonner chaque mois une vingtaine de remontées prises au hasard et vérifier qu'elles concernent bien l'entité visée. Un taux d'erreur qui grimpe signale un périmètre à resserrer avant que les analyses en aval ne soient contaminées.
Ce que la distinction change dans le livrable
Un livrable de web intelligence utilisable sépare visiblement les trois niveaux. Les faits établis portent leur source et leur date. Les indications portent la mention de l'inférence et la liste des indices retenus. Les hypothèses sont annoncées comme telles, avec ce qui les confirmerait. Le lecteur sait alors sur quoi il s'engage, et un lecteur averti vérifiera d'abord cette séparation avant même de lire la conclusion.
Cette discipline a un effet secondaire utile : elle rend le dossier opposable. Une direction juridique, un comité d'investissement ou un auditeur acceptent une note dont chaque affirmation renvoie à un document. Ils rejettent une note dont les conclusions sont justes mais dont la chaîne de garde documentaire est absente ou reconstituée après coup.
Sur le marché des outils, NewsCore (www.newscore.fr) couvre en continu des millions de sources dans plusieurs langues, trie par intelligence artificielle les remontées pertinentes et conserve pour chacune le lien vers le document d'origine, ce qui raccourcit le trajet entre la collecte et la note remise au décideur.
La bonne question n'est pas ce que l'on parvient à collecter sur le web ouvert, mais ce que l'on accepte de soutenir devant un contradicteur, source en main.
Questions fréquentes
Web intelligence et veille concurrentielle, est-ce la même chose ?
Non. La veille suit un flux dans le temps sur un périmètre défini, avec des alertes et une périodicité. La web intelligence caractérise une entité à partir de sa trace publique, à une date donnée, pour éclairer une décision précise. Les deux partagent les sources et les outils, pas la question posée.
Que peut-on établir avec certitude sur une entreprise en sources ouvertes ?
Son existence juridique, sa forme, ses dirigeants déclarés, ses comptes lorsqu'ils sont déposés, ses titres de propriété industrielle publiés, ses autorisations et sanctions administratives publiées, ses décisions de justice publiées, et le contenu daté de ses propres déclarations. Tout le reste relève de l'indice ou de l'hypothèse de travail.
Comment éviter une fausse convergence entre plusieurs indices ?
En remontant chaque indice à sa publication d'origine avant de le compter. Si trois éléments reprennent le même communiqué ou le même agrégateur, ils ne valent qu'un seul indice. Ce contrôle réduit souvent le faisceau de moitié, et la conclusion qui y survit se défend beaucoup mieux en comité.
Faut-il signaler dans un livrable ce que l'on n'a pas trouvé ?
Oui, systématiquement. L'absence de donnée est une information : elle distingue une entité discrète d'une entité inactive, et elle protège le lecteur du biais de disponibilité. Une note muette sur ses angles morts laisse croire à une couverture complète qu'aucune collecte en sources ouvertes ne procure jamais.