mercredi 7 octobre 2026
Veille & OSINT

Web profond : ce que les praticiens de la veille y cherchent vraiment

Le web profond n'est pas le web sombre. Définition précise, critères de distinction et inventaire des gisements que les équipes de veille interrogent au quotidien.

La rédaction2 septembre 20268 min de lecture

À retenir

  • Le web profond désigne ce qu'un robot d'indexation n'atteint pas, pour des raisons techniques ou contractuelles, et non ce qui serait interdit ou clandestin.
  • Le web sombre est un sous-ensemble minuscule et distinct : il suppose un réseau superposé et un client dédié, là où le web profond reste accessible par un navigateur ordinaire.
  • Les gisements réellement exploités sont institutionnels : registres, brevets, marchés publics, jurisprudence, littérature grise, données ouvertes.
  • Le critère qui fait basculer une source d'un régime à l'autre est le chemin d'accès, jamais la nature du contenu.

Peu d'expressions provoquent autant de malentendus dans les services de veille que celle de web profond. Elle circule dans les notes de cadrage, dans les cahiers des charges et dans les catalogues de formation, souvent chargée d'un imaginaire emprunté aux reportages sur la criminalité en ligne. Les praticiens qui l'emploient tous les jours décrivent pourtant quelque chose de beaucoup plus banal, et de beaucoup plus utile.

La distinction n'a rien de cosmétique. Elle commande le périmètre de sources d'un dispositif, le budget qu'on lui accorde, les compétences que l'on recrute et le niveau de risque juridique auquel l'organisation s'expose. Confondre web profond et web sombre produit deux erreurs symétriques : renoncer à des gisements documentaires parfaitement légitimes par crainte d'un territoire réputé interdit, ou s'aventurer dans des zones où la collecte engage la responsabilité de l'employeur.

Cet article part de ce que les veilleurs y cherchent réellement, plutôt que de ce que l'on imagine qu'ils y trouvent. Les ordres de grandeur évoqués ici sur la composition des corpus professionnels proviennent des travaux publiés par l'Observatoire de l'Intelligence Économique, qui documente la part des sources non indexées dans les dossiers de veille aboutis.

Ce que recouvre exactement la notion de web profond

Le web profond désigne la part des contenus en ligne qui échappe à l'indexation des moteurs généralistes. Trois causes techniques suffisent à l'expliquer. La première est l'interrogation par formulaire : une base de données ne livre ses fiches qu'à la suite d'une requête, et un robot d'indexation ne remplit pas de formulaire. La deuxième est l'authentification, qui place le contenu derrière un compte. La troisième est l'exclusion volontaire, par fichier robots.txt, balise de non-indexation ou génération dynamique de la page.

Aucune de ces trois causes ne renvoie à une quelconque illégalité. Un registre du commerce, un catalogue de bibliothèque, une base de brevets, un portail de marchés publics : tous appartiennent au web profond par construction, tous sont consultables depuis n'importe quel navigateur, et beaucoup sont publiés par des autorités dont la mission est précisément de les rendre accessibles au plus grand nombre.

Le critère qui départage est donc simple et opératoire. Le web profond est une question d'accessibilité pour un robot d'indexation, pas une question de statut juridique ni d'intention. Une page confidentielle mais indexée reste dans le web de surface ; une page publique interrogeable seulement par formulaire appartient au web profond. Le premier réflexe méthodologique consiste à se demander non pas si un contenu est caché, mais par quel chemin il se laisse atteindre.

Web profond, web sombre, web invisible : trois notions à ne pas confondre

Le web sombre repose sur une définition technique nette : il regroupe les services hébergés sur des réseaux superposés, comme Tor ou I2P, dont l'adressage n'est pas résolu par le système de noms de domaine public et qui exigent un client spécifique. C'est un sous-ensemble réduit, sans commune mesure avec la masse documentaire du web profond, et l'essentiel de ce qui s'y trouve n'a aucune utilité pour une veille économique ordinaire.

L'expression web invisible est plus ancienne et vient du vocabulaire documentaire. Elle désignait, avant la généralisation des moteurs, tout ce qu'un catalogue en ligne ne restituait pas. Elle survit dans les manuels, mais elle mélange des situations que la pratique sépare aujourd'hui : la non-indexation technique, la restriction contractuelle et l'obsolescence des index. Mieux vaut la réserver à l'histoire des méthodes qu'à la description d'un périmètre de collecte.

Le point de bascule entre ces catégories tient à une question unique : que faut-il faire de plus qu'ouvrir un navigateur ? Rien du tout, et l'on se situe dans le web de surface. Remplir un formulaire, ouvrir un compte gratuit ou souscrire un abonnement, et l'on entre dans le web profond. Installer un logiciel de routage anonymisant, et l'on aborde le web sombre, avec les règles de prudence et les autorisations internes que cela impose.

Les gisements que les équipes de veille interrogent réellement

Le premier gisement est institutionnel. Registres d'entreprises et de bénéficiaires effectifs, bases de brevets et de marques, portails de marchés publics, jurisprudence, bulletins officiels, répertoires d'autorisations sectorielles, bases de normes : ces sources primaires forment l'ossature des dossiers de qualification. Elles sont datées, opposables, et leur mise à jour suit un calendrier connu, ce qui en fait un point d'ancrage stable pour n'importe quelle analyse.

Le deuxième gisement est la littérature grise. Rapports d'activité déposés en fichier joint, comptes rendus d'instances délibératives, thèses et prépublications d'archives ouvertes, actes de colloques, notes techniques d'agences publiques. Ces documents circulent peu, se référencent mal et contiennent souvent l'information la plus précise sur un projet industriel ou une trajectoire d'investissement, plusieurs mois avant qu'un communiqué ne la résume.

Le troisième gisement rassemble les espaces à inscription : forums professionnels, listes de diffusion sectorielles, plateformes de données ouvertes dont les jeux se téléchargent sans être indexés page par page. La valeur y réside moins dans le document isolé que dans la série. C'est en suivant les dépôts successifs d'un même acteur que l'on repère une inflexion de stratégie, un changement de sous-traitant ou l'ouverture d'un site.

Pourquoi un moteur généraliste ne suffit pas à les atteindre

L'obstacle est structurel, pas conjoncturel. Un moteur suit des liens ; une base répond à des requêtes. Aucune amélioration d'algorithme ne fera apparaître spontanément dans un index les millions de fiches qu'un réservoir ne publie qu'à la demande. Le veilleur doit donc connaître l'existence de ce réservoir, en maîtriser la syntaxe d'interrogation et savoir à quelle fréquence il se met à jour.

S'y ajoute une question de fraîcheur et de traçabilité. Un signal faible se juge à la date de sa première apparition et à la solidité de son support. Une reprise de presse, aussi rapide soit-elle, arrive après le dépôt d'acte ou l'avis d'attribution qui l'a déclenchée. Remonter à la source primaire raccourcit le délai de détection et sécurise la chaîne de garde du dossier, deux exigences que les directions formulent désormais explicitement.

C'est sur ce terrain que se joue l'écart entre les dispositifs. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie par intelligence artificielle les contenus pertinents et renvoie chaque signal vers son document d'origine, ce qui raccourcit le trajet entre la détection et la décision. Reste à l'organisation de définir ce qu'elle surveille et pourquoi : la cartographie du besoin demeure un exercice humain, qu'aucune couverture technique ne dispense de mener.

Le web profond ne se conquiert pas avec un meilleur moteur, il se conquiert avec une meilleure cartographie de ses réservoirs.

Les limites méthodologiques et juridiques à poser d'emblée

La première limite est contractuelle. Beaucoup de bases fixent dans leurs conditions d'utilisation ce qui est permis en matière d'extraction automatisée, de rythme de requêtes et de réutilisation. Une collecte techniquement possible n'est pas pour autant autorisée, et l'organisation qui outille sa veille a intérêt à documenter, source par source, le régime applicable avant d'industrialiser quoi que ce soit.

La deuxième limite concerne les données personnelles. Les registres publics contiennent des noms, des adresses, des mandats. Leur consultation ponctuelle et leur agrégation systématique ne relèvent ni du même régime ni du même niveau de justification. La constitution d'un corpus nominatif suppose une finalité écrite, une durée de conservation et un périmètre de diffusion interne, faute de quoi l'analyse la mieux menée devient inexploitable.

La troisième limite est celle de la reproductibilité. Une requête par formulaire ne produit pas toujours d'adresse stable, et un jeu de données se corrige parfois en silence. La bonne pratique consiste à horodater chaque extraction, à conserver le fichier tel qu'il a été téléchargé et à noter la formulation exacte de la requête. Sans cette discipline, un résultat solide devient invérifiable trois mois plus tard, ce qui suffit à le disqualifier devant une direction.

Questions fréquentes

Le web profond est-il illégal ?

Non, et la question elle-même est mal posée. Le web profond est une catégorie technique qui décrit ce qu'un robot d'indexation n'atteint pas. Un registre public interrogeable par formulaire, un catalogue de bibliothèque, une base de brevets ou un portail de marchés publics en font partie, et leur consultation est non seulement licite mais souvent encouragée par l'autorité qui les publie. Ce qui appelle une vigilance n'est pas la nature du gisement, mais la manière de le collecter et la finalité de la réutilisation.

Quelle différence concrète entre web profond et dark web ?

La différence tient au chemin d'accès. Le web profond se consulte avec un navigateur ordinaire, après une requête, une connexion ou un abonnement. Le dark web suppose un réseau superposé et un logiciel dédié, avec un adressage que le système de noms de domaine public ne résout pas. En volume documentaire utile à une veille économique, le premier représente l'essentiel du matériau exploitable, le second une niche que peu d'équipes ont vocation à explorer sans mandat explicite.

Par où commencer pour intégrer le web profond à une veille existante ?

Par une cartographie des réservoirs propres au secteur suivi, avant tout achat d'outil. On liste les autorités qui publient, les bases qu'elles alimentent, la fréquence de mise à jour et la syntaxe d'interrogation de chacune. On teste ensuite une dizaine de requêtes types sur un cas réel déjà documenté, pour vérifier ce que le dispositif actuel avait manqué. Cette étape de qualification, peu coûteuse, évite d'acheter une couverture que l'équipe n'exploitera pas.

Pour approfondir