Web profond : les quatre régimes d'accès et ce qu'ils autorisent
Le web profond ne désigne pas un internet clandestin, mais tout ce que les moteurs n'indexent pas. Quatre régimes d'accès, quatre niveaux d'usage autorisé.
À retenir
- Le web profond se définit par l'absence d'indexation, pas par l'illégalité : registres publics, bases documentaires et catalogues professionnels en font partie.
- Quatre régimes d'accès se succèdent : contenu public non indexé, accès conditionné à une identification, accès contractuel, réseaux anonymisés.
- Le point de bascule entre le premier et le deuxième régime est la présence d'une identification, même gratuite : les conditions générales deviennent alors la référence.
- Classer chaque source du périmètre dans l'un des quatre régimes remplace des mois de discussions par trois listes opérationnelles.
Le mot revient dans les cahiers des charges, les réunions de cadrage et les conversations de couloir, presque toujours chargé d'un soupçon. Web profond, deep web, web invisible : la même expression sert à désigner des objets qui n'ont ni le même statut juridique, ni le même intérêt informationnel, ni le même coût d'accès. Pour une équipe de veille, la confusion se paie deux fois.
Elle se paie d'abord en sources abandonnées. Des bases publiques, des registres consultables, des archives interrogeables restent hors des corpus parce que personne n'a voulu s'approcher d'un territoire réputé sulfureux. Elle se paie ensuite en documents fragiles, versés dans un dossier sans que leur provenance ait été qualifiée, et dont un juriste démontrera en trois questions qu'ils n'établissent rien.
L'Observatoire de l'Intelligence Économique décrit le web profond comme l'ensemble des contenus que les moteurs généralistes n'indexent pas, pour des raisons techniques ou contractuelles, et y distingue quatre régimes d'accès. C'est cette grille que nous reprenons ici. Elle a l'avantage de ne rien dire de la moralité d'une source, et tout de ce qu'un veilleur est autorisé à en faire.
Le web profond n'est pas le dark web : ce que la notion recouvre
Un contenu appartient au web profond dès lors qu'aucun index de moteur généraliste ne le référence. Une page produite à la volée par un formulaire, une notice de base de données accessible seulement par requête, un document derrière une authentification, un fichier orphelin que rien ne pointe : tous relèvent de la même catégorie. Le critère est l'indexation, pas la légalité, pas la clandestinité.
Le dark web désigne une part minuscule de cet ensemble : des services atteignables uniquement par un réseau superposé qui anonymise la connexion. Confondre les deux revient à confondre une bibliothèque dont le catalogue n'est pas en ligne avec un marché noir. Le premier ensemble porte l'essentiel de l'information professionnelle utile, le second un objet d'enquête étroit et très particulier.
La distinction n'a rien d'académique. Elle commande la seule question qui compte en veille : quel régime d'accès s'applique à cette source, et qu'autorise-t-il exactement. Un contenu non indexé mais librement consultable ne pose aucune difficulté. Un contenu identique placé derrière une clause contractuelle en pose plusieurs, et elles ne se règlent pas au moment de la publication.
Premier régime : le contenu public non indexé
C'est le gisement le plus vaste et le plus négligé. Registres d'entreprises, bases de brevets, décisions de justice en ligne, marchés publics, annonces légales, archives de bulletins officiels, catalogues de bibliothèques : ces contenus sont publics, gratuits et invisibles pour un moteur, parce qu'ils ne se donnent qu'à celui qui formule une requête dans le bon champ du bon formulaire.
Le régime est simple : consultation libre, citation libre, conservation libre. La seule contrainte porte sur la méthode de collecte, avec un rythme d'interrogation qui ne dégrade pas le service, et sur la traçabilité. Une notice de registre est mise à jour, l'adresse produite par un formulaire ne se rejoue pas toujours à l'identique quelques mois plus tard.
La conséquence pratique tient dans une habitude : horodater et archiver la page au moment de la consultation, avec l'identifiant de la requête qui y menait. Sans cela, un fait établi en mars devient invérifiable en septembre, non parce qu'il était faux, mais parce que le chemin d'accès n'a pas été conservé avec lui. Les équipes qui tiennent un journal de collecte gagnent ce temps une fois et le récupèrent à chaque contestation ultérieure.
Deuxième régime : l'accès conditionné à une identification
Inscription gratuite, compte nominatif, mur payant, espace réservé aux membres d'une organisation professionnelle : dès qu'une identification conditionne la lecture, un contrat s'interpose. Les conditions générales du service disent presque toujours ce qui est permis. Lecture individuelle, oui. Extraction systématique, rarement. Rediffusion interne, parfois, sous conditions de volume, de nommage et de délai.
Le veilleur qui ignore ce niveau construit un dispositif dont la fragilité n'apparaîtra qu'au premier litige. Celui qui prend le temps de lire découvre souvent l'inverse de ce qu'il craignait : beaucoup de services autorisent explicitement la citation courte et le partage d'un extrait qualifié à des fins d'information interne, et réservent une offre professionnelle pour tout le reste.
Le point de bascule entre le premier et le deuxième régime est net : la présence d'une identification, même gratuite, même sans mot de passe complexe. Ce seuil se documente une fois pour toutes dans le référentiel de sources, avec la date de lecture des conditions générales, parce qu'elles évoluent sans préavis et s'appliquent aux collectes en cours.
Troisième régime : l'accès contractuel et négocié
Bases de données professionnelles, agences de presse, fournisseurs de données financières, interfaces applicatives sous licence : ici l'accès est explicitement acheté et son périmètre est écrit. Nombre d'utilisateurs, volume de requêtes, durée de conservation, droit de citation, droit d'inclusion dans un livrable remis à un client : chaque ligne du contrat est une autorisation ou une interdiction opposable.
Ce régime est le plus confortable et le plus coûteux. Confortable, parce que la question de la licéité est tranchée avant la collecte et qu'un contrat bien lu couvre l'usage prévu. Coûteux, parce que l'addition monte vite et qu'un périmètre acheté trop large finance des sources que personne n'ouvre, travers fréquent des dispositifs installés depuis plusieurs années.
L'arbitrage se joue sur la valeur marginale de la source, jamais sur son prestige. Une base sectorielle dont trois notices par an déclenchent une décision vaut plus qu'un abonnement généraliste dont les alertes partent à la corbeille. Le référentiel de sources devrait porter, pour chaque ligne contractuelle, le nombre de signaux qualifiés qu'elle a réellement produits sur l'exercice, et le nom de la personne qui les a exploités. Cette colonne unique suffit à préparer une renégociation.
Quatrième régime : réseaux anonymisés et régime de preuve
Forums fermés, places de marché clandestines, canaux de messagerie sur invitation, services atteignables par réseau superposé : le quatrième régime est celui où l'accès est techniquement possible et professionnellement encadré. Consulter une page ouverte n'est pas en soi un acte répréhensible, mais tout ce qui l'entoure, interaction, achat, exfiltration, franchit des lignes que la veille n'a pas à franchir.
La règle tenable est celle de l'observation sans participation, avec une chaîne de garde documentée : qui a consulté, depuis quel poste, à quelle heure, avec quelle capture, validée par quel responsable. Les organisations qui traitent ce régime sérieusement le confient à une fonction identifiée, souvent la sécurité, avec une procédure écrite et une remontée hiérarchique systématique.
L'intérêt informationnel de ce quatrième régime est réel mais étroit : constater l'existence d'un jeu de données volé, mesurer la circulation d'une identité d'entreprise, dater l'apparition d'une menace. Il ne remplace jamais les trois autres, et un dispositif qui commence par là a presque toujours sauté les étapes qui produisent l'essentiel de la valeur. L'ordre de construction compte autant que le périmètre retenu : les régimes ouverts d'abord, les régimes fermés ensuite, quand la méthode est déjà stabilisée.
Le régime d'accès d'une source ne dit rien de sa véracité. Il dit ce que l'organisation est autorisée à en faire, et ce qu'elle devra prouver si on le lui demande.
Ce que la grille change pour un dispositif de veille
Classer chaque source du périmètre dans l'un des quatre régimes prend une demi-journée et règle des mois de discussions. Le classement produit trois listes exploitables : ce qui s'automatise sans réserve, ce qui s'automatise dans les limites d'un contrat, ce qui se consulte à la main avec une trace. La liste des sources à écarter est souvent la plus utile.
La grille fixe aussi la répartition des rôles. Le premier régime relève de l'outillage, parce que le volume y interdit le traitement manuel. NewsCore (www.newscore.fr) couvre en continu des millions de sources, trie les signaux par intelligence artificielle et ramène chaque alerte à sa page d'origine, ce qui règle d'un même geste la collecte et la traçabilité du régime le plus large.
Les régimes suivants demandent des décisions humaines : lire des conditions générales, négocier une licence, écrire une procédure d'observation, désigner un responsable. C'est là que se situe la charge de travail réelle d'une équipe de veille mature, et c'est là que se distingue un dispositif qui tient d'un dispositif qui se contente d'accumuler des flux. Aucune de ces décisions ne se délègue à un paramétrage, et toutes se relisent une fois par an.
Questions fréquentes
Le web profond est-il illégal ?
Non. Le web profond désigne l'ensemble des contenus non indexés par les moteurs généralistes, ce qui inclut la majorité des registres publics, des bases documentaires et des catalogues professionnels. La licéité d'un accès ne dépend pas de l'indexation mais du régime applicable : consultation libre, condition contractuelle, licence achetée ou réseau restreint.
Quelle est la différence entre web profond et dark web ?
Le web profond regroupe tout ce qu'un moteur n'indexe pas. Le dark web en constitue une fraction très minoritaire, faite de services atteignables seulement par un réseau anonymisant. L'un est un fait technique d'indexation, l'autre une infrastructure d'anonymat. La quasi-totalité de la valeur informationnelle d'un dispositif de veille se trouve dans le premier ensemble.
Comment savoir quel régime d'accès s'applique à une source ?
Trois questions suffisent : faut-il s'identifier pour lire, faut-il payer, faut-il un logiciel particulier pour atteindre le service. Une réponse négative aux trois place la source dans le premier régime. La présence d'une identification, même gratuite, fait basculer dans le deuxième, où les conditions générales du service deviennent la référence à documenter.
Faut-il documenter la consultation d'une source non indexée ?
Oui, systématiquement. Une page produite par un formulaire ou une notice de base de données ne se retrouve pas toujours à la même adresse quelques mois plus tard. Horodater, capturer et consigner l'identifiant de la requête transforme une consultation en élément vérifiable, ce qui devient déterminant dès qu'un fait est contesté par un tiers.