Agents d'investigation automatisés, ce qu'ils relient et ce qui reste à l'analyste
Un agent croise registres d'entreprises, financements de campagnes et contrats publics pour faire apparaître des liens. Ce que les équipes lui confient, et ce qu'elles gardent.
À retenir
- Un agent d'investigation automatise la mise en relation entre jeux de données, pas la formulation de l'hypothèse ni la décision d'y donner suite.
- Les trois gisements les plus productifs restent les registres d'entreprises, les données de financement politique et les marchés publics.
- Le risque principal n'est pas l'erreur visible, c'est le lien plausible mais faux, qu'un analyste pressé valide sans remonter à la pièce.
- Chaque relation produite doit rester rattachée à son document source, sans quoi le livrable devient inexploitable en cas de contestation.
Un enquêteur qui ouvre un dossier fournisseur passe l'essentiel de son temps à une tâche mécanique : lister des entités, chercher chacune dans plusieurs bases, noter les dirigeants, les adresses, les dates, puis repérer à l'oeil nu ce qui se répète d'une fiche à l'autre. C'est ce travail de mise en relation que les agents d'investigation automatisés prétendent absorber, et c'est sur ce terrain qu'il faut les juger.
OpenPlanter, présenté par Hackers Arise, est un agent d'investigation fondé sur un modèle de langage récursif, conçu pour automatiser l'analyse en sources ouvertes. Il ingère des registres d'entreprises, des données de financement de campagnes et des contrats publics, relie des entités entre elles et fait apparaître des connexions au terme d'une analyse fondée sur les preuves. La description est sobre, et elle décrit bien la nature du gain attendu.
Reste la question que se posent les équipes qui envisagent d'en installer un : qu'est-ce qui change réellement dans la journée d'un analyste, et qu'est-ce qui ne change pas du tout. Nous avons repris la chaîne d'une enquête en sources ouvertes, étape par étape, pour distinguer ce qui s'automatise proprement de ce qui reste une décision humaine.
Ce que fait concrètement un agent d'investigation en sources ouvertes
Le principe est celui d'une boucle. L'agent reçoit un point de départ, une raison sociale, un numéro d'identification, un nom de dirigeant, interroge une première source, extrait les entités qu'il y trouve, puis relance une recherche sur chacune d'elles. À chaque tour, il élargit le graphe des relations et conserve le lien entre la relation produite et le document qui la fonde. Le caractère récursif du procédé est précisément ce qui distingue l'agent d'un simple connecteur de bases de données.
Ce fonctionnement change la forme du livrable intermédiaire. On ne récupère plus une liste de résultats à lire, mais un graphe d'entités et de liens que l'analyste explore, élague et annote. La différence est loin d'être cosmétique : un graphe rend visibles des proximités qu'aucune lecture séquentielle ne fait apparaître, par exemple deux sociétés sans lien capitalier déclaré qui partagent une adresse, un commissaire aux comptes et une fenêtre de création de quelques jours.
En contrepartie, le graphe expose aussi des coïncidences. Une adresse partagée par cent sociétés est une domiciliation, pas un indice. Un agent qui ne pondère pas ses arêtes produit une pelote illisible, et les équipes qui utilisent ces outils au quotidien décrivent toutes le même réflexe acquis : commencer par éliminer les noeuds à très haut degré avant de regarder quoi que ce soit d'autre.
Registres, financements de campagnes et contrats publics, les trois gisements croisés
Les registres d'entreprises fournissent l'ossature : identité juridique, dirigeants, adresses, dates de création et de modification, parfois comptes déposés. C'est la source la plus structurée et la plus fiable de la chaîne, celle qui permet d'ancrer une entité dans une existence vérifiable. Un agent y gagne surtout du temps de saisie, et son apport tient à la capacité de suivre automatiquement les renvois d'une société à l'autre, là où l'humain abandonne après quelques niveaux.
Les données de financement de campagnes apportent autre chose : une relation entre une personne ou une organisation et un intérêt politique déclaré, datée et chiffrée. Leur intérêt en veille économique tient moins à l'indignation qu'elles suscitent parfois qu'à leur fonction de pont. Elles relient des entités qu'aucun registre commercial ne rapproche, et elles le font avec une granularité temporelle que peu de sources ouvertes offrent.
Les contrats publics, enfin, disent qui travaille avec qui, pour quel montant et sur quelle durée. C'est le gisement le plus directement opérationnel pour une direction achats ou une cellule d'intelligence économique, parce qu'il documente une activité réelle et non une déclaration d'intention. Croisés avec les deux précédents, ces trois jeux de données suffisent à cartographier un écosystème de fournisseurs sans recourir à la moindre information non publique.
Le gain réel porte sur le temps de mise en relation, pas sur le temps de lecture
Il faut être précis sur ce que l'automatisation réduit. Elle ne réduit pas le temps de lecture des pièces, qui reste incompressible dès lors qu'un fait doit être établi. Elle réduit le temps passé à découvrir qu'une pièce existe et mérite d'être lue. Dans une enquête fournisseur ordinaire, cette phase de repérage occupe une part dominante du travail, et c'est elle que l'agent comprime.
Les relevés de l'Observatoire de l'Intelligence Économique sur le délai de qualification d'un signal vont dans le même sens : ce n'est pas l'analyse qui allonge le délai, c'est l'intervalle entre la détection d'un élément et le moment où quelqu'un décide qu'il mérite d'être instruit. Un agent qui présente d'emblée un graphe annoté déplace cet intervalle, à condition que l'organisation ait prévu qui regarde le graphe et quand.
Le corollaire est désagréable pour les acheteurs d'outils : un agent installé dans une équipe qui n'a pas de rituel de revue ne produit aucun gain mesurable. Il génère des graphes que personne n'ouvre, au même titre que les alertes non lues d'un dispositif de veille mal calibré. Le déterminant du résultat est organisationnel avant d'être technique.
Ce que l'agent ne fait pas, et que l'analyste conserve
L'agent ne formule pas l'hypothèse. Savoir qu'il faut chercher du côté des sous-traitants de rang deux plutôt que du côté des actionnaires, parce que le risque porte sur une rupture d'approvisionnement et non sur un contrôle capitalistique, relève d'une compréhension du dossier que rien n'automatise. Un agent lancé sans question précise ratisse large et rend un résultat proportionnellement pauvre.
L'agent ne qualifie pas non plus la valeur probante d'une pièce. Un extrait de registre officiel, une mention sur un site d'entreprise et un article de presse locale ne pèsent pas le même poids, et cette hiérarchie dépend du contexte juridique du dossier. L'analyste conserve la responsabilité de dire, pièce par pièce, ce qui est établi, ce qui est probable et ce qui n'est qu'une piste.
Enfin, l'agent ne porte pas le risque du lien plausible mais faux. C'est le point de vigilance principal signalé par les équipes : une relation produite automatiquement arrive avec une apparence de rigueur qui décourage la vérification. La parade est simple à énoncer et exigeante à tenir, à savoir n'inscrire dans un livrable aucune relation dont on n'a pas ouvert soi-même le document source.
Encadrer l'usage, journal des requêtes et revue humaine
Les cellules qui ont industrialisé ces outils imposent trois règles. La première est la conservation du journal des requêtes : quelle question a été posée, à quelle date, sur quelles sources, avec quel point de départ. Sans ce journal, un résultat n'est pas reproductible, et un résultat non reproductible ne tient pas devant une contestation.
La deuxième règle est l'horodatage des pièces collectées, avec conservation d'une copie locale. Les registres évoluent, les pages disparaissent, les contrats sont retirés des portails. Une relation établie le 12 septembre sur la base d'une mention supprimée depuis reste défendable si la capture existe, et devient indéfendable si elle n'existe pas.
La troisième règle est la revue humaine systématique avant diffusion, assortie d'un niveau de confiance explicite sur chaque assertion. Cette précaution ne ralentit pas le dispositif autant qu'on le craint, parce qu'elle porte sur les quelques relations retenues et non sur l'ensemble du graphe exploré. Elle protège en revanche l'organisation sur le seul terrain où une erreur coûte vraiment cher, celui de la décision prise sur la foi du livrable.
La place de l'agent dans un dispositif de veille outillé
Un agent d'investigation travaille sur demande, dossier par dossier. Il ne surveille rien en continu et ne prévient de rien. Le dispositif de veille, lui, fait l'inverse : il couvre un périmètre en permanence et signale ce qui bouge. Les deux fonctions se complètent et ne se substituent pas, l'une ouvrant les dossiers que l'autre instruit.
Sur le versant surveillance, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources dans de nombreuses langues, trie par intelligence artificielle et relie chaque synthèse à son document d'origine, ce qui raccourcit le trajet entre un signal et la décision. Dans un entretien publié par Irregular Warfare Initiative, Charlie Winter et Stephanie Rotolo, d'ExTrac, placent d'ailleurs l'avantage du côté des organisations qui transforment vite la donnée en décision plutôt que de celles qui collectent le plus.
Questions fréquentes sur les agents d'investigation automatisés
Un agent d'investigation remplace-t-il un analyste OSINT ?
Non. Il remplace la partie répétitive de son travail, celle qui consiste à interroger plusieurs bases avec les mêmes identifiants et à relever ce qui se recoupe. La formulation de l'hypothèse, la hiérarchisation des pièces et la rédaction du livrable restent humaines. Une équipe qui installe un agent sans analyste obtient des graphes, pas des conclusions.
Ces outils travaillent-ils uniquement sur des données publiques ?
Les sources décrites sont ouvertes : registres d'entreprises, financements de campagnes, contrats publics. Le caractère public de la donnée ne règle pas pour autant la question de son usage, qui reste soumise au droit applicable, notamment lorsque le dossier porte sur des personnes physiques. Ce cadrage se traite avant de lancer l'outil, pas au moment de rédiger.
Comment vérifier un lien produit par un agent d'investigation ?
En remontant au document qui le fonde et en le lisant. Un lien sans pièce consultable ne s'inscrit pas dans un livrable. La vérification consiste à ouvrir la source, à contrôler la date, à s'assurer que l'entité identifiée est bien celle du dossier, et à consigner ces trois éléments à côté de l'assertion.