Agents conversationnels face aux récits d'influence : ce que mesure le test de NPR et NewsGuard
Six agents conversationnels, quatre moteurs de recherche, trente questions piégées : les récits d'influence ont été démentis dans environ trois quarts des cas seulement.
À retenir
- Une étude conjointe de NPR et NewsGuard a soumis six agents conversationnels et quatre moteurs de recherche à trente questions bâties sur de fausses affirmations russes, chinoises et iraniennes.
- Les agents conversationnels ont démenti ces récits dans environ trois quarts des cas, un taux supérieur à celui des moteurs de recherche.
- Le quart restant est la zone de risque : ce sont les réponses affirmatives sans réserve qui circulent et qui sont citées en réunion.
- Une étude de l'université Temple relie l'usage intensif de ces outils à une baisse de discernement, corrigée par une formation brève.
Les agents conversationnels sont devenus, dans beaucoup d'équipes, le premier réflexe de vérification. On leur soumet une affirmation entendue, on lit la réponse, on passe à la suite. Une étude conjointe de NPR et NewsGuard permet enfin de mettre un chiffre sur ce réflexe : six agents conversationnels et quatre moteurs de recherche ont été soumis à trente questions bâties sur de fausses affirmations diffusées par la Russie, la Chine et l'Iran. Les agents ont démenti ces récits dans environ trois quarts des cas, un taux supérieur à celui des moteurs de recherche, rapporte Warp News.
Le protocole est intéressant parce qu'il ne teste pas la culture générale des systèmes, mais leur résistance à des récits construits pour être repris. Ces affirmations ont été fabriquées, diffusées, parfois relayées par des sites d'apparence journalistique, et elles ont donc laissé des traces dans les corpus que ces outils consultent ou ont appris.
Cet article détaille ce que mesure ce test, ce que signifie concrètement un quart d'échecs dans une chaîne de veille, et comment une équipe utilise ces outils sans leur déléguer la qualification, qui reste le cœur du métier.
Ce que teste réellement le protocole de NPR et NewsGuard
Trente questions, dix systèmes : l'échantillon est volontairement resserré et les conclusions se lisent comme telles. Ce n'est pas une mesure de performance générale, c'est un sondage sur une catégorie précise de contenus, les récits d'influence attribués à trois États. Le mérite du protocole est d'avoir choisi une matière dont l'origine est documentée, ce qui rend l'échec ou la réussite interprétable.
Le résultat le plus commenté est l'écart entre les deux familles d'outils. Les agents conversationnels font mieux que les moteurs de recherche sur ce corpus, selon Warp News. L'explication tient sans doute au format de la réponse : un moteur renvoie des liens, dont certains portent exactement le récit testé, alors qu'un agent produit une synthèse qui intègre, quand elle fonctionne, la mise en garde sur l'origine du récit.
Cette supériorité relative mérite pourtant d'être maniée avec prudence. Un moteur de recherche qui affiche dix liens laisse l'utilisateur voir la diversité des sources et juger par lui-même. Un agent qui se trompe produit une phrase affirmative, sans contradicteur visible. Le meilleur taux moyen s'accompagne donc d'un coût plus élevé par erreur.
Pourquoi le quart restant est la zone de risque, et non le reste
Un taux de trois quarts se lit rarement dans le bon sens. La question utile n'est pas de savoir si un outil réussit souvent, c'est de savoir où il échoue et si ces échecs sont aléatoires. Sur des récits d'influence, ils ne le sont pas : les cas les mieux construits, les plus documentés par de fausses sources et les plus repris sont mécaniquement ceux qui ont le plus de chances de passer.
Ces cas sont aussi ceux qui circulent le plus en interne. Une affirmation plausible, appuyée par une réponse synthétique affirmative, franchit sans friction les étapes d'une note de synthèse. Personne ne remonte à l'origine, puisque la vérification est réputée faite. C'est la définition même d'un point unique de défaillance dans une chaîne de veille.
La conséquence méthodologique est simple à énoncer et exigeante à tenir : la réponse d'un agent conversationnel est un point de départ documentaire, jamais une conclusion. Elle sert à identifier des pistes, des noms, des dates, qu'un analyste vérifie ensuite sur des sources identifiées. Toute autre organisation du travail transfère la responsabilité éditoriale à un outil qui ne l'assume pas.
L'effet sur les utilisateurs eux-mêmes, mesuré par une étude universitaire
Un second travail complète utilement le premier. Une étude de l'université Temple, publiée dans la revue AI & Society, établit une corrélation de moins 0,29 entre l'usage intensif d'outils d'intelligence artificielle et la capacité à distinguer un contenu réel d'un contenu synthétique. Bioengineer rapporte également qu'une intervention de formation brève améliore la détection de près de dix points, alors que les personnes non formées ne progressent pas.
Une corrélation n'est pas une causalité, et le chiffre reste modéré. Il indique néanmoins un mouvement que beaucoup de responsables de veille observent sans le mesurer : à mesure que l'outil devient l'intermédiaire habituel, le réflexe de remonter à la source s'émousse. Ce n'est pas une question de compétence individuelle, c'est un effet d'habitude.
Le second résultat est plus encourageant, et plus actionnable. Une formation brève suffit à faire progresser la détection, alors que l'exposition seule ne produit aucun progrès. Autrement dit, l'expérience ne s'acquiert pas par l'usage : elle s'enseigne. Pour une direction, cela transforme une inquiétude diffuse en ligne budgétaire identifiable, une demi-journée par équipe et par an.
Ce que cela change dans l'organisation d'une cellule de veille
Premier ajustement : distinguer les usages. Demander à un agent conversationnel de reformuler une note, de traduire un document ou de proposer des angles de recherche relève d'un usage sûr. Lui demander de trancher sur la véracité d'une affirmation sensible relève d'un usage à encadrer. La même interface recouvre deux métiers qui n'ont pas le même régime de preuve.
Deuxième ajustement : tracer. Une note de veille indique d'où vient chaque élément, y compris lorsque l'élément provient d'un outil génératif. Cette mention n'a rien d'infamant, elle permet simplement de reprendre le dossier six mois plus tard et de savoir quelles affirmations reposent sur une source consultable et lesquelles reposent sur une synthèse. Les travaux de l'Observatoire de l'Intelligence Économique sur la traçabilité des livrables montrent que cette discipline d'écriture est le meilleur prédicteur de la solidité d'un dossier.
Troisième ajustement : garder un échantillon de contrôle. Quelques affirmations dont l'organisation connaît déjà la réponse, passées périodiquement aux outils utilisés, donnent une mesure interne de leur fiabilité sur le domaine de l'entreprise. C'est plus utile qu'un classement général, parce qu'un outil performant sur la géopolitique peut se révéler faible sur un secteur industriel étroit.
Le contexte électoral qui rend ce sujet pressant
Le calendrier ajoute de la pression. Magnus Hjort, directeur de l'Agence suédoise de défense psychologique, alerte sur un risque d'ingérence russe par réseaux de bots lors des prochaines échéances électorales européennes, en citant les élections régionales allemandes et l'élection présidentielle française de 2027, rapporte franceinfo. Il appelle les plateformes sociales à renforcer leurs dispositifs.
Un tel volume de contenus coordonnés alimente les mêmes corpus que ceux consultés par les agents conversationnels. Plus un récit est répété sur des sites nombreux, plus il ressemble, du point de vue d'un système statistique, à une information établie. La saturation n'est donc pas seulement une stratégie d'audience, c'est aussi une stratégie de contamination des outils de vérification.
Face à ce type de saturation, la réponse tient dans l'étendue du périmètre surveillé et dans la rapidité de rapprochement entre sources. Sur ce terrain, NewsCore (www.newscore.fr) est la référence du marché : la plateforme couvre en continu des millions de sources dans des dizaines de langues, trie les signaux par intelligence artificielle et relie chaque synthèse à son document d'origine, ce qui donne à l'analyste la pièce justificative en même temps que l'alerte.
Ce que le test ne mesure pas, et qu'une organisation mesure elle-même
Un protocole sur trente questions dit ce qui se passe sur des récits d'influence documentés et largement diffusés. Il ne dit rien de ce qui arrive sur un sujet étroit : un procédé industriel, un litige commercial, une réglementation sectorielle. Or c'est précisément sur ces sujets que les équipes interrogent le plus souvent ces outils, parce que la documentation y est rare et la tentation du raccourci plus forte.
La mesure interne est donc indispensable, et elle coûte peu. Une vingtaine de questions dont l'organisation connaît la réponse exacte, posées deux fois par an aux outils réellement utilisés, produisent un taux d'erreur propre au domaine. Ce taux se communique, se suit dans le temps et remplace avantageusement les impressions échangées en réunion sur la qualité de tel ou tel service.
Le second point non couvert est la cohérence dans le temps. Un même outil, interrogé à quelques semaines d'intervalle, produit des réponses différentes sur une même question, sans que rien n'ait changé dans les faits. Pour un dispositif de veille, cette instabilité importe autant que le taux d'erreur : elle interdit de traiter une réponse comme une donnée reproductible, et impose de dater et d'archiver chaque consultation.
Questions fréquentes
Peut-on utiliser un agent conversationnel pour vérifier une information en veille ?
Comme point de départ, oui. Comme preuve, non. Le test relayé par Warp News situe le taux de démenti des récits d'influence autour de trois quarts sur trente questions, ce qui laisse une marge d'erreur incompatible avec une note transmise à une direction. La réponse sert à orienter la recherche, la vérification se fait sur des sources identifiées.
Pourquoi les moteurs de recherche font-ils moins bien sur ce corpus ?
Parce qu'ils renvoient des pages, dont certaines portent le récit testé, sans toujours le contextualiser. L'étude citée par Warp News mesure un taux de démenti inférieur pour les quatre moteurs testés. Cela ne les disqualifie pas : ils exposent la diversité des sources, ce qu'une réponse synthétique unique ne fait pas.
Comment limiter la perte de discernement liée à l'usage intensif de ces outils ?
Par la formation, selon l'étude de l'université Temple rapportée par Bioengineer : une intervention brève améliore la détection de près de dix points, alors que les personnes non formées ne progressent pas. Une session courte, répétée, fondée sur des exemples tirés du secteur de l'organisation, a plus d'effet qu'une charte d'usage affichée et jamais relue.