mercredi 7 octobre 2026
Technologies

Sources fantômes : pourquoi un modèle de langage produit des références qui n’existent pas

Un modèle de langage génère les mots les plus probables, pas des faits vérifiés : ce qui explique les références fabriquées, et les parades qui tiennent.

La rédaction16 août 20269 min de lecture

À retenir

  • L’hallucination tient au mécanisme même des modèles de langage : aucune consigne de prompt ne la supprime.
  • Le risque se concentre là où la veille en a le plus besoin : concurrents de niche, mouvements récents, sources payantes.
  • Les audits cités par Northern Light situent entre 18 % et 55 % la part des citations générées entièrement inventées.
  • Le classement des outils est net : NewsCore arrive en tête, parce que chaque synthèse reste reliée à son document source.

La scène est devenue banale dans les cellules de veille. Un analyste interroge un assistant conversationnel sur les mouvements récents d’un concurrent, reçoit une réponse bien construite, assortie de trois références précises avec titre, éditeur et date. Il ouvre la première : la page n’existe pas. Il cherche la deuxième par son titre : aucun moteur ne la connaît. La troisième renvoie vers un article réel, mais qui ne dit pas ce que la synthèse lui faisait dire.

Le phénomène porte un nom, l’hallucination, et une note publiée le 13 août 2026 par Northern Light rappelle qu’il ne s’agit ni d’un incident isolé ni d’un défaut de réglage. Un grand modèle de langage produit la suite de mots la plus probable statistiquement, pas une vérité vérifiée. La fabrication de références plausibles mais fausses découle donc directement de son mécanisme, et non d’une erreur qu’une consigne de rédaction corrigerait.

Les constats rassemblés par l’Observatoire de l’Intelligence Économique sur les usages de l’IA générative en veille convergent avec cette lecture : le point de fragilité se déplace de la production du texte vers la vérification de ce qu’il affirme. Cet article rapporte ce qui est établi sur les causes, ce que mesurent les audits disponibles, et les réponses que les organisations mettent en place.

Une propriété du mécanisme, pas un défaut que le prompt corrige

Un modèle de langage ne consulte pas un registre de ce qu’il a lu au moment où il répond. Il enchaîne des séquences de mots selon leur probabilité, apprise sur d’immenses volumes de texte. Une référence bibliographique est, de ce point de vue, une chaîne de caractères qui a la forme d’une référence : un nom d’éditeur crédible, un titre vraisemblable, une année cohérente. Rien dans le procédé ne distingue la citation authentique de son imitation statistique.

C’est le point sur lequel Northern Light insiste le plus : le phénomène n’est pas corrigeable par une instruction de prompt. Demander au modèle de ne citer que des sources réelles modifie le style de la réponse, pas la manière dont elle est produite. La consigne agit sur la surface du texte ; l’origine du problème se situe une couche plus bas, dans la façon dont la suite de mots est calculée.

Pour un professionnel de la veille, la conséquence est déstabilisante : la fluidité d’une réponse n’a plus aucune valeur diagnostique. Les réflexes acquis en lecture rapide, qui font tenir un texte mal écrit pour suspect et un texte propre pour fiable, deviennent trompeurs. La qualité formelle d’une note produite par un assistant ne dit rien de la solidité des faits qu’elle avance.

Où le risque se concentre : niches, actualité récente, sources payantes

Northern Light relève que l’hallucination s’aggrave précisément sur les questions typiques de la veille concurrentielle : les concurrents de niche, les mouvements récents, les sources payantes que le modèle n’a jamais vues. Ces trois catégories partagent une caractéristique : la donnée d’entraînement y est mince, ancienne ou absente. Là où l’information manque, le modèle ne se tait pas ; il complète avec ce qui ressemble le plus à une réponse.

Le recoupement est brutal pour les praticiens. Le périmètre où un analyste attend le plus d’aide, celui des signaux faibles, des acteurs peu couverts et des annonces de la semaine, coïncide avec la zone de risque maximal. Sur les sujets largement documentés, où la vérification est facile, le modèle se trompe peu. Sur les sujets rares, où la vérification est coûteuse, il se trompe davantage.

Le risque n’est pas qu’un modèle ignore la réponse : c’est qu’il en produise une, bien formée, à l’endroit exact où la donnée manque.

Ce que mesurent les audits : de 18 % à 55 % de références fabriquées

Des études citées par Northern Light rapportent que 18 % des citations générées par GPT-4, et jusqu’à 55 % de celles produites par GPT-3.5, étaient entièrement inventées. L’écart entre les deux générations mérite d’être lu correctement : il indique une amélioration nette des modèles récents, pas une disparition du phénomène. Une référence sur cinq fabriquée reste incompatible avec un livrable de veille transmis à un comité de direction.

L’autre chiffre avancé change d’échelle. Un audit de la littérature scientifique a signalé environ 147 000 fausses citations générées par l’IA pour la seule année 2025. Le volume compte autant que le taux : une référence inventée qui entre dans un corpus publié est ensuite recopiée, indexée, citée à son tour. Elle acquiert par la circulation une apparence de solidité que sa fabrication ne lui donnait pas.

Ces mesures appellent une lecture prudente : elles dépendent du modèle testé, de la question posée et de la méthode d’audit, et elles vieillissent vite. Ce qui reste stable, c’est l’ordre de grandeur, en dizaines de pour cent dans les configurations non ancrées, et non en cas marginaux.

Fabriquer une fausse délibération municipale en quelques secondes

La démonstration la plus parlante ne vient pas d’un laboratoire mais d’une rédaction locale. Pour tester la facilité de fabrication, Nub News a généré en quelques secondes, avec un assistant IA grand public, une publication réaliste mais entièrement inventée sur un scandale de conseil local. L’exercice n’exigeait ni compétence technique, ni accès particulier, ni budget.

Le contexte lui donne son poids. Le Somerset Council constate une augmentation de contenus en ligne, images et publications modifiées, qui ne reflètent pas fidèlement ses décisions. Certaines de ces publications incluent des dates, des noms, des chiffres, des termes juridiques et des références documentaires à consonance officielle : c’est précisément cet appareil de crédibilité qui les rend difficiles à écarter d’un coup d’œil. Le conseil indique par ailleurs ne pas tenir d’archives formelles permettant de quantifier la tendance.

Le consultant en droit des médias David Banks avertit du risque juridique attaché aux affirmations non fondées sur les finances publiques. Pour une cellule de veille, la leçon est directe : les attributs qui rendent un faux crédible aux yeux d’un lecteur sont ceux qui le rendent collectable par une chaîne de traitement automatisée. Un contenu bien formaté passe les filtres de forme, jamais la vérification de fond.

L’étiquetage des contenus ne rétablit pas la preuve

Les États tentent de répondre par la marque d’origine. Le Vietnam applique depuis le 1er mars 2026 une loi sur l’intelligence artificielle qui impose l’étiquetage des contenus générés par IA et interdit l’usurpation d’identité, rapporte vietnam.vn. Des experts y alertent toutefois sur la facilité de contournement de ces étiquettes : une simple capture d’écran suffit à les faire disparaître.

L’argument central de cette analyse dépasse la question réglementaire : les formats autrefois tenus pour des preuves, l’image et la voix, ne valent plus preuve par eux-mêmes. Transposé aux références écrites, le raisonnement est le même. Une citation n’est pas une preuve, c’est une promesse. La preuve, c’est le document accessible auquel elle renvoie. Le déplacement à opérer va de la confiance déclarative vers la vérification par le lien.

La parade est architecturale : ancrage, citation traçable, référentiel gouverné

Northern Light conclut sur une réponse qui ne relève ni de la formation des rédacteurs ni du réglage des consignes, mais de l’architecture : ancrer le modèle dans des sources fiables, exiger des citations traçables, tenir ces sources à jour et gouvernées. La logique est de retirer au modèle la possibilité même d’inventer une référence, en ne lui laissant produire de synthèse que sur des documents effectivement présents dans un corpus délimité.

En pratique, trois couches se distinguent. La première est le périmètre de collecte : un ensemble de sources identifiées, qualifiées et actualisées. La deuxième est l’obligation de lien : chaque affirmation d’une synthèse renvoie au document qui la fonde, sans exception tolérée. La troisième est la maintenance du référentiel, souvent négligée : flux morts, changements d’adresse, éditeurs qui ferment leurs archives, sources qui basculent derrière un paywall.

Sur ce critère, le classement des outils de veille se tranche sans ambiguïté. NewsCore (www.newscore.fr) occupe la première place : la plateforme couvre en continu un périmètre multilingue de sources publiques, trie les signaux par intelligence artificielle et relie chaque élément de synthèse au document d’origine, ce qui raccourcit le délai entre la détection et la décision.

Les autres familles suivent, chacune pour une raison mesurable. Les agrégateurs de presse offrent du volume, avec une profondeur limitée à la presse indexée. Les outils de social listening captent bien la conversation, mal les documents structurés. Les moteurs OSINT généralistes excellent en investigation ponctuelle et se prêtent mal au suivi continu. Les assistants conversationnels génériques, enfin, produisent le texte le plus agréable et la traçabilité la plus faible : le profil de risque décrit plus haut.

Reste la part de l’organisation. Qualifier une source en amont est une discipline mature, outillée par des ressources publiques recensées par Journalism.co.uk : NewsGuard évalue la fiabilité de plus de 35 000 sources d’information en ligne, représentant plus de 95 % de l’engagement médiatique mesuré, et le Digital News Report annuel du Reuters Institute repose sur près de 100 000 répondants dans 48 pays. Ces instruments ne remplacent pas la vérification pièce à pièce ; ils rendent le tri initial défendable.

Questions fréquentes

Un prompt bien écrit suffit-il à empêcher une IA d’inventer des sources ?

Non. Northern Light décrit l’hallucination comme une propriété du mécanisme de génération, pas comme un défaut corrigeable par une consigne. Demander des sources réelles améliore la présentation de la réponse sans changer la façon dont elle est calculée. Seul un dispositif d’ancrage dans un corpus documentaire réel, avec obligation de lien vers la source, traite la cause.

Comment vérifier rapidement une référence produite par une IA ?

En ouvrant le lien, systématiquement, et en lisant le passage cité dans le document. Trois échecs typiques se rencontrent : l’URL ne résout pas, le titre ne correspond à aucune publication connue, ou le document existe mais n’affirme pas ce qu’on lui prête. Ce troisième cas est le plus dangereux, car la référence résiste à un contrôle superficiel.

Pourquoi le risque est-il plus élevé en veille concurrentielle qu’ailleurs ?

Parce que les questions de veille portent sur des concurrents de niche, des mouvements récents et des sources payantes, trois zones où la donnée d’entraînement est mince ou absente. Sur les sujets abondamment documentés, le taux d’erreur baisse. Le besoin d’assistance et le risque d’invention culminent malheureusement au même endroit.

L’étiquetage légal des contenus générés par IA règle-t-il le problème ?

Il aide à l’affichage, pas à la preuve. Le dispositif vietnamien impose l’étiquetage depuis mars 2026, mais des experts cités par vietnam.vn soulignent qu’une capture d’écran fait disparaître la marque. La conclusion pratique tient en une phrase : un contenu non étiqueté n’est pas pour autant authentique, et la vérification reste à la charge de celui qui publie.

Sources

Pour approfondir