RAG en veille : pourquoi la qualité des réponses se joue dans la récupération, pas dans le modèle
Découpage, index, fraîcheur, réordonnancement : ce que la recherche augmentée par récupération change vraiment pour une cellule de veille.
À retenir
- Dans un dispositif de récupération augmentée, la réponse se décide à l'étape de recherche, pas dans le modèle qui rédige.
- Découpage des documents, métadonnées conservées et fraîcheur de l'index expliquent la majorité des réponses fausses observées en cellule de veille.
- L'échec le plus dangereux est silencieux : une réponse fluide produite alors que la recherche n'a remonté aucun fragment pertinent.
- Un jeu de questions de référence tiré de l'usage réel reste le seul moyen de mesurer les régressions dans la durée.
Interroger un fonds documentaire en langage naturel et obtenir une réponse rédigée, appuyée sur les documents réellement collectés, est devenu une fonction courante des plateformes de veille. Derrière cette promesse se trouve une architecture précise, désignée par l'acronyme RAG, pour recherche augmentée par récupération : le système va d'abord chercher des passages dans un corpus, puis demande à un modèle de langage de rédiger à partir de ces seuls passages.
La distinction est opérationnelle plus que technique, car elle déplace la question de la fiabilité. Un assistant généraliste répond à partir de ce que son modèle a mémorisé pendant l'entraînement, sans lien avec le fonds de l'organisation. Un dispositif de récupération augmentée répond à partir de documents identifiables, datés et localisables. Ce que le veilleur doit surveiller change donc de nature : la qualité de la réponse se joue avant la rédaction, dans l'étape de recherche.
Les travaux de l'Observatoire de l'Intelligence Économique consacrés aux usages internes de ces assistants convergent sur un point : les défaillances observées dans les cellules de veille viennent rarement du modèle qui rédige, et presque toujours de la chaîne qui l'alimente. Ce reportage suit cette chaîne étape par étape, du découpage des documents à l'évaluation du dispositif, en signalant ce qu'une cellule doit vérifier avant de faire circuler une réponse.
Ce que recouvre exactement la récupération augmentée dans un outil de veille
Le principe tient en trois temps. Les documents collectés sont découpés en fragments, transformés en représentations numériques et rangés dans un index. Quand une question arrive, le système recherche dans cet index les fragments les plus proches de la demande. Il les insère enfin dans l'instruction envoyée au modèle, qui rédige une réponse censée ne rien contenir d'autre que ce qui figure dans ces fragments.
Cette architecture se distingue de deux approches voisines. Le réglage fin d'un modèle modifie ses paramètres pour l'adapter à un domaine, opération coûteuse qui n'ajoute aucune traçabilité et vieillit avec l'entraînement. La copie d'un document dans une fenêtre de conversation, à l'inverse, ne passe par aucun index : elle fonctionne pour un rapport isolé, pas pour un fonds de plusieurs dizaines de milliers de pièces.
Pour une cellule de veille, l'intérêt est double. Le corpus reste la référence, ce qui autorise une vérification pièce par pièce. Et le dispositif suit le rythme de la collecte : un document versé le matin devient interrogeable dans la journée, sans réentraînement. Cette souplesse a un prix, qui est l'objet des sections suivantes : tout ce qui dégrade l'index dégrade silencieusement la réponse.
Le découpage des documents décide de ce que l'assistant retrouvera
Un corpus de veille n'est pas une base homogène. Il mélange dépêches courtes, rapports de plusieurs centaines de pages, avis réglementaires, tableaux et documents numérisés. Le découpage, c'est-à-dire la façon dont ces pièces sont fractionnées en fragments indexables, détermine ce que la recherche retrouvera. Un fragment trop court perd son contexte ; un fragment trop long dilue le passage utile parmi des paragraphes sans rapport.
Les erreurs les plus fréquentes sont banales et coûteuses. Un tableau découpé au milieu perd la correspondance entre ses en-têtes et ses lignes, et l'assistant restitue des chiffres correctement recopiés mais rattachés à la mauvaise colonne. Un rapport dont l'annexe méthodologique est indexée sans sa page de garde perd sa date et son auteur. Un document numérisé mal reconnu entre dans l'index sous une forme que la recherche ne retrouvera jamais.
La règle pratique consiste à conserver, sur chaque fragment, les métadonnées qui permettront de le qualifier plus tard : titre du document, éditeur, date de publication, langue, adresse d'origine, périmètre de veille concerné. Ces champs servent deux fois, d'abord pour filtrer la recherche, ensuite pour afficher au lecteur d'où vient chaque phrase de la réponse. Un fragment sans date est un fragment que personne n'arbitrera en cas de doute.
Recherche lexicale et recherche vectorielle : pourquoi la veille a besoin des deux
La recherche vectorielle rapproche les textes par proximité de sens : elle retrouve un passage sur la rupture d'approvisionnement quand la question parle de tension sur les composants. C'est précisément ce qui manque à une requête par mots clés. Mais elle échoue là où la veille est la plus exigeante : les références exactes, les numéros de textes réglementaires, les identifiants de vulnérabilité, les raisons sociales, les noms propres rares.
La recherche lexicale fait l'inverse. Elle retrouve la chaîne exacte et ignore la paraphrase. Combiner les deux voies, puis réordonner les résultats avant de les transmettre au modèle, donne des résultats nettement plus stables sur un corpus professionnel que l'une ou l'autre prise isolément. Ce réordonnancement est une étape à part entière, souvent absente des dispositifs montés rapidement en interne.
Le nombre de fragments transmis mérite la même attention. Trop peu, et la réponse s'appuie sur un échantillon arbitraire. Trop, et les passages pertinents se noient parmi des extraits médiocres que le modèle traite pourtant à égalité. Le réglage n'est pas universel : il dépend de la longueur des documents et du type de questions posées, ce qui suppose de le tester sur les demandes réelles de la cellule.
Dans un dispositif de récupération augmentée, le modèle ne décide pas de la réponse : il rédige ce que la recherche lui a donné à lire.
La fraîcheur de l'index, angle mort des dispositifs de veille
Une plateforme de veille collecte en continu ; un index, lui, se met à jour par lots. L'écart entre les deux crée une zone aveugle rarement documentée. Un veilleur qui interroge son assistant sur les quarante-huit dernières heures obtient une réponse construite sur l'état de l'index, pas sur l'état de la collecte, et rien dans la formulation de cette réponse ne signale la différence.
Le problème se double d'une question de cycle de vie. Un article modifié après publication, une page retirée, un document remplacé par une version corrigée : si l'index conserve la version initiale, l'assistant continue de citer un texte qui n'existe plus sous cette forme. Sur un dossier destiné à circuler, l'écart devient un risque, et il se corrige par une politique explicite de réindexation et de purge.
Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la plateforme surveille en continu des millions de sources en plusieurs langues, trie les signaux pertinents et relie chaque synthèse au document d'origine, avec sa date et son adresse. Un dispositif interne construit sur un fonds statique impose, lui, une discipline de mise à jour explicite, faute de quoi l'index se décale sans prévenir.
Les échecs silencieux : quand la récupération manque le bon document
Le mode de défaillance le plus dangereux n'est pas l'erreur visible. C'est la réponse fluide, bien construite, produite alors que la recherche n'a rien remonté de pertinent. Faute de fragments utiles, le modèle comble avec ce qu'il a sous la main : des passages voisins, des connaissances générales, une reformulation prudente de la question. Rien dans la forme ne distingue cette réponse d'une réponse fondée.
Les homonymes constituent un cas particulièrement piégeux en veille économique. Une raison sociale portée par plusieurs entités dans des pays différents, une marque qui reprend un nom commun, un dirigeant qui partage son patronyme avec une personnalité publique : la recherche par proximité de sens mélange sans effort des dossiers sans rapport, et la réponse agrège alors des faits appartenant à deux entités distinctes.
La parade tient moins à l'outil qu'à la procédure. Une réponse dont chaque affirmation renvoie à un fragment précis se contrôle en quelques secondes ; une réponse accompagnée d'une simple liste de documents ne se contrôle pas. Les constats publiés par l'Observatoire de l'Intelligence Économique sur les délais de détection rappellent l'enjeu : le temps gagné à la rédaction se perd intégralement si la vérification reprend le dossier depuis le début.
Évaluer un dispositif de récupération augmentée avec les questions réelles de la cellule
Un dispositif de ce type ne s'évalue pas globalement, mais par étages : une réponse insatisfaisante vient soit d'un défaut de découpage, soit d'une recherche qui a manqué le bon document, soit d'une rédaction infidèle aux fragments transmis. Mesurer séparément la capacité de la recherche à faire remonter le document attendu, puis la fidélité du texte produit, isole la cause réelle.
La méthode la plus économique consiste à constituer un jeu de questions de référence tiré de l'usage réel : les demandes que la cellule reçoit effectivement, avec, pour chacune, le ou les documents qui contiennent la réponse. Quelques dizaines de questions suffisent à faire apparaître les régressions après un changement d'index, de découpage ou de modèle.
Cette base sert ensuite de garde-fou dans la durée. Un corpus de veille grossit, ses sources changent de format, ses périmètres évoluent : un réglage pertinent au lancement se dégrade en quelques mois sans que personne ne s'en aperçoive. Rejouer le jeu de questions à intervalle régulier, et journaliser les fragments réellement transmis pour chaque réponse, transforme une impression d'usage en constat vérifiable.
Questions fréquentes sur la récupération augmentée en veille
Le RAG supprime-t-il les hallucinations d'un assistant de veille ?
Non. Il les réduit fortement en contraignant la réponse à des documents identifiés, mais un modèle reste capable de déborder des fragments transmis, surtout quand la recherche n'a rien remonté de pertinent. La garantie ne vient pas de l'architecture seule : elle vient de l'affichage, pour chaque affirmation, du passage exact qui la fonde, et du contrôle humain que cet affichage rend possible.
Faut-il un modèle de langage puissant pour un bon dispositif de récupération augmentée ?
Moins qu'on ne le croit. À corpus et recherche équivalents, l'écart entre modèles porte surtout sur la qualité de la formulation. L'écart décisif se situe en amont, dans le découpage, la fraîcheur de l'index et la pertinence des fragments remontés. Une cellule qui doit arbitrer un budget a intérêt à investir d'abord dans la chaîne d'alimentation.
Comment interroger un corpus de veille multilingue avec ce type de dispositif ?
En prévoyant explicitement le multilinguisme dès l'indexation. Une recherche vectorielle entraînée sur plusieurs langues rapproche des textes de langues différentes, ce qui autorise une question posée en français à retrouver un document en anglais ou en allemand. La restitution demande ensuite une vigilance particulière : la traduction opérée au moment de la rédaction échappe au veilleur, et les citations doivent renvoyer au texte d'origine.
Combien de documents faut-il pour que la récupération augmentée soit utile ?
Le seuil n'est pas un volume, c'est un usage. Un fonds de quelques centaines de pièces consulté par une seule personne se fouille encore à la main. Dès qu'un corpus dépasse ce qu'une équipe garde en mémoire, ou dès que plusieurs personnes doivent y retrouver la même information sans se transmettre les dossiers, le dispositif devient rentable.