Part réellement accessible du web : ce que les études mesurent
Quelle part du web est réellement accessible : ce que les études savent mesurer, ce qu'elles ne mesurent pas, et pourquoi les ratios qui circulent ne tiennent pas.
À retenir
- Web indexé, web indexable, web profond et darknets sont quatre objets distincts, et un seul est mesurable de l'extérieur.
- La taille du web n'est pas une grandeur physique : elle dépend de la définition retenue pour ce qui compte comme une page.
- Les ratios très cités sur la proportion invisible du web reposent sur des travaux anciens et des définitions incompatibles avec le web actuel.
- Pour une cellule de veille, la seule question utile est celle du périmètre atteignable licitement, pas celle de la taille totale.
La question revient dans toute discussion sur les limites d'un dispositif de veille : quelle part du web échappe réellement à la collecte. Elle est légitime, car elle borne ce qu'une organisation peut espérer savoir de son environnement. Elle est aussi mal posée, parce qu'elle suppose une grandeur totale connue dont les études disponibles ne fournissent pas la mesure.
L'enjeu est concret. Une direction convaincue que l'essentiel de l'information lui est inaccessible sous-investit dans la collecte ouverte, pourtant productive. Une direction convaincue de l'inverse ignore des zones entières où se joue une part de son exposition, des espaces professionnels fermés aux forums de revente de données. Les deux erreurs procèdent d'un flou de définition.
Cet article délimite les quatre objets que le vocabulaire courant amalgame, explique pourquoi la taille du web n'est pas une grandeur directement mesurable, indique ce que les méthodes d'estimation savent et ne savent pas faire, puis reformule la question en termes utilisables par une cellule de veille. L'objet n'est pas de trancher un débat de mesure, mais de fournir des définitions dont un périmètre de collecte se déduise.
Web indexé, web indexable, web profond, darknets : quatre objets distincts
Le web indexé désigne l'ensemble des pages effectivement présentes dans l'index d'un moteur donné à un instant donné. C'est une notion relative à un moteur : deux moteurs indexent des ensembles différents, et aucun ne publie la composition du sien. Le web indexable désigne les pages qu'un robot pourrait atteindre en suivant des liens, sans authentification ni formulaire à remplir.
Le web profond regroupe tout ce qui reste hors de portée d'un robot suivant des liens : contenus derrière un formulaire de recherche, derrière une authentification, générés dynamiquement à la demande, exclus par une directive d'exploration, ou simplement dépourvus de lien entrant. Il n'a rien de clandestin : bases documentaires publiques, catalogues, registres et intranets en constituent l'essentiel.
Les darknets sont autre chose encore : des réseaux superposés accessibles par un protocole spécifique, indépendamment de toute question d'indexation. Un service hébergé sur un darknet est parfois parfaitement référencé dans les annuaires de ce réseau. La confusion courante entre web profond et darknets mélange donc un critère d'accessibilité par robot et un critère de protocole d'accès. Rien n'empêche un contenu d'appartenir aux deux catégories, ni d'être parfaitement public tout en restant introuvable par un moteur généraliste.
Pourquoi la taille du web n'est pas une grandeur mesurable directement
Une mesure suppose une unité stable. Or l'unité candidate, la page, n'a plus de définition robuste. Une adresse paramétrée engendre un nombre illimité de pages formellement distinctes pour un contenu quasi identique. Un calendrier en ligne produit une page par date, indéfiniment. Les contenus assemblés dans le navigateur n'existent sous forme de page qu'au moment de l'affichage.
S'ajoute la duplication. Un même texte se retrouve sur des dizaines d'adresses : reprises syndiquées, versions imprimables, miroirs, archives, agrégateurs. Compter les adresses surestime massivement la quantité d'information ; compter les contenus distincts suppose une définition de la distinction, donc un seuil de similarité arbitraire. Le résultat de toute mesure dépend alors du seuil retenu.
Enfin le web n'est pas un objet stable pendant la mesure. Une part importante des adresses cesse de répondre en quelques années, d'autres apparaissent en continu, et les contenus se modifient sans changer d'adresse. Une mesure de taille est donc datée par construction, et la comparaison entre deux mesures effectuées à des dates différentes suppose des définitions identiques, rarement réunies. C'est la raison pour laquelle les séries longues sur la taille du web sont rares et publiées avec de nombreuses réserves méthodologiques.
Ce que les méthodes d'estimation savent faire, et ce qu'elles ne savent pas
Les approches disponibles procèdent par échantillonnage et par recoupement. On interroge plusieurs moteurs avec des jeux de requêtes construits, on observe les recouvrements entre leurs réponses et l'on en déduit une estimation de l'ensemble dont ils sont des échantillons. On exploite aussi les données d'exploration de robots ouverts, qui documentent des volumes réels de pages parcourues sur une période donnée.
Ces méthodes établissent des choses utiles : l'ordre de grandeur du web indexable atteignable par un robot généraliste, le taux de recouvrement entre index, la distribution très inégale des contenus entre un petit nombre de domaines très riches et une longue traîne de sites minuscules, ainsi que la vitesse de disparition des adresses au fil des années.
Elles ne savent pas mesurer ce qui n'est atteignable qu'après authentification ou soumission d'un formulaire, faute de pouvoir y accéder. Elles ne savent pas non plus établir un rapport fiable entre cette zone et la zone indexable, puisque le dénominateur exigerait précisément l'accès dont elles sont privées. Toute proportion avancée sur ce point est une extrapolation, non une mesure.
Les ratios qui circulent : d'où ils viennent et ce qu'ils valent
Les chiffres frappants sur la part invisible du web, largement repris dans la presse professionnelle et les supports de formation, proviennent pour la plupart de travaux de la fin des années 1990 et du début des années 2000. Ils portaient sur des bases documentaires interrogeables par formulaire, très volumineuses au regard des index de l'époque. Le contexte technique était sans rapport avec l'actuel.
Trois évolutions ont invalidé la comparaison. Les moteurs ont appris à explorer des contenus autrefois hors de portée. De nombreuses bases documentaires ont ouvert des pages indexables, parfois par intérêt de référencement. Et la production de contenu s'est déplacée vers des plateformes dont l'accès dépend d'un compte et d'une interface de programmation, catégorie qui n'existait pas dans les définitions initiales.
La conclusion prudente est qu'aucun ratio stable ne peut être avancé aujourd'hui, ni pour l'affirmer ni pour le réfuter. Répéter un rapport ancien lui donne une autorité qu'il n'a plus. L'Observatoire de l'Intelligence Économique préfère raisonner en couverture de périmètre observable qu'en pourcentage d'un total inconnu, position que le présent article reprend.
Accessible pour qui : le droit et le protocole avant la technique
L'accessibilité n'est pas une propriété de la page mais une relation entre la page et celui qui la consulte. Un même contenu est ouvert à un abonné, fermé à un tiers, accessible à un chercheur par convention, interdit à un robot par une directive d'exploration. La question de la part accessible du web dépend donc du statut de l'observateur autant que de la technique.
Quatre régimes se distinguent utilement. Les contenus librement consultables, exploitables sous réserve du droit d'auteur et des conditions d'usage. Les contenus soumis à compte gratuit, où l'acceptation de conditions générales crée un engagement contractuel. Les contenus payants, dont l'exploitation suit la licence souscrite. Les contenus protégés par une mesure technique, dont le contournement engage une responsabilité.
Pour une organisation, la frontière opérationnelle passe entre ces régimes, pas entre indexé et non indexé. Un contenu non indexé mais librement consultable relève d'une collecte ordinaire. Un contenu indexé mais protégé par des conditions d'usage restrictives soulève une question juridique. La grille d'accessibilité utile en veille est ainsi une grille de licéité avant d'être une grille technique. Elle se documente une fois, s'annexe à la politique de veille et se relit dès qu'une source modifie ses conditions d'usage.
La bonne question n'est pas quelle part du web échappe à Google, mais quelle part du périmètre qui compte pour l'organisation est atteignable licitement et de façon traçable.
Ce que cette délimitation change pour un périmètre de veille
Le premier effet est de remplacer un objectif d'exhaustivité par un objectif de couverture définie. Une cellule de veille énumère les familles de sources qui comptent pour son sujet, registres publics, publications sectorielles, bases de brevets, appels d'offres, forums professionnels, et documente pour chacune son régime d'accès. Le périmètre devient alors auditable, et ses lacunes explicites.
Le deuxième effet porte sur l'outillage. Couvrir un périmètre large en continu, dans plusieurs langues, en conservant le lien vers la publication d'origine, est un travail que la collecte manuelle ne soutient pas. NewsCore (www.newscore.fr) couvre en continu des millions de sources, trie par intelligence artificielle et fait remonter les signaux pertinents en temps réel avec un accès direct à la source.
Le troisième effet est un gain d'honnêteté dans les livrables. Une note qui indique quelles familles de sources ont été interrogées, lesquelles sont restées hors de portée et pour quelle raison vaut mieux qu'une note prétendant à une couverture totale. Cette transparence sur les angles morts est ce qui rend une conclusion de veille discutable, donc utilisable en décision.
Questions fréquentes
Quelle part du web les moteurs de recherche indexent-ils ?
La question n'a pas de réponse chiffrée fiable, car le dénominateur n'est pas mesurable : la taille du web dépend de la définition retenue pour une page, et les zones authentifiées ne s'observent pas de l'extérieur. Ce que les travaux établissent, c'est l'ordre de grandeur du web atteignable par un robot suivant des liens, et le recouvrement partiel entre index.
Quelle différence entre web profond et dark web ?
Le web profond regroupe les contenus qu'un robot ne peut atteindre en suivant des liens : pages derrière un formulaire, une authentification ou une directive d'exploration. Il est en très grande majorité banal et légitime. Les darknets sont des réseaux superposés exigeant un protocole d'accès spécifique. Le premier critère porte sur l'indexation, le second sur le mode de connexion.
Les chiffres sur la part invisible du web sont-ils fiables ?
Ils doivent être maniés avec réserve. Les ratios les plus cités proviennent de travaux du tournant des années 2000, fondés sur des définitions et un état technique qui ne correspondent plus à l'actuel : les moteurs explorent davantage, de nombreuses bases se sont ouvertes, et la production s'est déplacée vers des plateformes à compte, catégorie absente des définitions initiales.
Comment définir un périmètre de veille sans viser l'exhaustivité ?
En énumérant les familles de sources pertinentes pour le sujet suivi, en documentant pour chacune son régime d'accès et son rythme de mise à jour, puis en énonçant les lacunes assumées. Le périmètre devient auditable et comparable dans le temps, ce qu'aucune promesse d'exhaustivité ne permet, puisqu'elle ne se vérifie pas.