What is Retrieval-Augmented Generation? How it Works & Use Cases

Digital brain icon with AI related icons on a technological background.

Image: photon_photo/Adobe Stock

Apr 19, 2024
8 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

La génération augmentée par récupération, ou RAG, est une technique qui améliore les résultats des grands modèles de langage en intégrant des informations provenant de bases de connaissances ou de sources externes.

En récupérant des données ou des documents pertinents avant de générer une réponse, le RAG améliore la précision, la fiabilité et la richesse informative du texte produit. Cette approche permet d’ancrer le contenu généré dans des sources d’information externes, afin de garantir des résultats plus pertinents sur le plan contextuel et plus précis sur le plan factuel.

Poursuivez votre lecture pour en savoir plus sur le RAG, son fonctionnement, ses cas d’usage et ses différences avec le processus traditionnel de traitement automatique du langage naturel (NLP).

Qu’est-ce que la génération augmentée par récupération (RAG) ?

Vous avez probablement déjà entendu dire que les contenus générés par l’IA sont susceptibles de présenter des problèmes de plagiat et de manquer d’originalité. Dans les tâches traditionnelles de traitement automatique du langage naturel, les modèles de langage génèrent des réponses en se fondant uniquement sur les schémas et les informations présents dans leurs données d’entraînement. Si cette approche a produit des résultats impressionnants, elle présente aussi des limites, comme le risque de générer des résultats erronés ou biaisés, en particulier face à des requêtes complexes ou ambiguës.

La génération augmentée par récupération est une technique qui répond à ce problème en combinant la puissance du traitement automatique du langage naturel et celle de la recherche d’informations.

Imaginez que vous deviez rédiger un article de recherche sans accès à Internet ni à aucune ressource externe. Vous pourriez avoir une compréhension générale du sujet, mais pour étayer vos arguments et fournir une analyse approfondie, vous devriez consulter diverses sources d’information.

C’est là qu’intervient le RAG : il joue le rôle de votre assistant de recherche, en vous aidant à accéder aux informations pertinentes et à les intégrer pour améliorer la qualité et la profondeur de votre travail.

Les grands modèles de langage (LLM) sont entraînés sur d’immenses volumes de données. Ils ressemblent à des personnes très cultivées qui possèdent une compréhension étendue de nombreux sujets et domaines. Ils peuvent fournir des informations générales et répondre à diverses requêtes grâce à leur vaste base de connaissances. Mais pour produire des réponses plus précises, fiables et détaillées, étayées par des éléments de preuve ou des exemples spécifiques, les LLM ont souvent besoin de l’aide des techniques de RAG. C’est comparable à la situation d’une personne pourtant très érudite qui doit consulter des références ou des sources pour fournir, dans certains cas, des réponses complètes et exactes.

Advertisement

Pour approfondir vos connaissances sur les principaux grands modèles de langage actuels, consultez notre guide consacré aux Best Large Language Models

Fonctionnement pratique de la génération augmentée par récupération

La génération augmentée par récupération (RAG) est une architecture de modèle d’IA qui combine les atouts des modèles paramétriques préentraînés (comme les modèles fondés sur des transformeurs) et de la récupération de mémoire non paramétrique, afin de permettre la génération de texte conditionnée à la fois par l’invite saisie et par des sources de connaissances externes.

Le fonctionnement du modèle RAG commence par la requête ou l’invite de l’utilisateur. Le modèle de récupération est activé lorsque vous saisissez vos questions dans le champ de texte de votre IA générative.

Phase de requête

Lors de la phase de requête ou d’invite, le système parcourt une vaste source de connaissances afin de trouver les informations pertinentes correspondant à la requête ou à l’invite saisie. Cette source de connaissances peut être constituée d’un ensemble de documents, d’une base de données ou de tout autre référentiel de données structurées ou non structurées. Il peut également s’agir de la base de connaissances de votre entreprise.

Par exemple, si la requête saisie est « Quels sont les symptômes de la COVID-19 ? », le système RAG recherchera et récupérera les informations pertinentes dans une base de données contenant des documents ou des articles médicaux.

Retrieval augmented generation (RAG) diagram.
Image: AWS

Image : AWS

Advertisement

Récupération

Une fois les informations pertinentes trouvées, le système RAG sélectionne un ensemble de passages ou de documents candidats susceptibles de contenir des informations utiles à la génération d’une réponse. Cette étape permet d’écarter les informations non pertinentes ou redondantes et de ne retenir que la réponse la plus pertinente à votre question.

Dans l’exemple de la COVID-19, le système pourrait sélectionner des passages d’articles médicaux recensant les symptômes courants associés à la maladie.

Phase de génération

Lors de la phase de génération, le résultat est renvoyé à l’utilisateur. Le RAG utilise les passages candidats sélectionnés comme contexte pour générer une réponse ou un texte.

Ce processus de génération peut reposer sur diverses techniques, comme les modèles neuronaux de langage (par exemple, GPT) ou d’autres architectures de génération. La réponse générée doit être cohérente, pertinente et informative au regard de la requête saisie et du contexte récupéré.

3 avantages clés de la génération augmentée par récupération

Réduction des biais dans les réponses

Les systèmes RAG peuvent atténuer les effets des biais propres à un jeu de données ou à un référentiel de connaissances unique en récupérant des informations provenant de sources diverses. Cela contribue à fournir des réponses plus équilibrées et objectives, puisque le système prend en compte un éventail plus large de perspectives et de points de vue. En favorisant l’inclusivité et la diversité des contenus récupérés, les modèles RAG produisent des interactions plus équitables et plus justes.

Réduction du risque d’hallucinations

Les hallucinations désignent la génération d’informations incorrectes ou incohérentes par les grands modèles de langage. Les systèmes RAG réduisent ce risque en intégrant des informations concrètes récupérées à partir de sources de connaissances externes.

En récupérant les réponses et en les ancrant dans des informations externes vérifiées, les modèles RAG sont moins susceptibles de générer des contenus hallucinés. Le recours à ce contexte externe contribue à garantir que les réponses générées sont ancrées dans la réalité et conformes aux faits, réduisant ainsi le risque de produire des résultats inexacts ou trompeurs.

Advertisement

Amélioration de la qualité des réponses

La technique RAG peut générer des réponses pertinentes, fluides et cohérentes en combinant les techniques de récupération et de génération, ce qui permet d’obtenir des résultats de meilleure qualité que les approches reposant uniquement sur la génération. Même le meilleur LLM a clairement ses limites : le RAG est la technologie nécessaire pour lui ajouter une base de connaissances plus approfondie.

Quand utiliser le RAG plutôt que l’affinage d’un modèle d’IA ?

Ce tableau récapitule les éléments à prendre en compte pour choisir entre le RAG et l’affinage d’un modèle d’IA selon différents critères.

CritèresRAGAffinage d’un modèle d’IA
Accès à des connaissances externesAdapté aux tâches nécessitant l’accès à des sources de connaissances externes.Peut ne pas nécessiter l’accès à des connaissances externes.
Intégration des connaissancesExcelle dans l’intégration de connaissances externes aux réponses générées, offrant des résultats plus complets et plus informatifs.Peut avoir du mal à intégrer des connaissances externes au-delà de celles encodées dans les données d’affinage, ce qui peut entraîner des réponses moins diversifiées ou moins pertinentes sur le plan contextuel.
Compromis en matière de performancesOffre un compromis entre la latence des réponses et la richesse des informations : des temps de réponse plus longs peuvent produire des résultats plus complets et plus pertinents sur le plan contextuel.Fournit des temps de réponse plus courts, mais peut sacrifier une partie de la compréhension contextuelle et de l’intégration des connaissances par rapport au RAG.
Nature de la tâcheAdapté aux tâches nécessitant l’accès à des sources de connaissances externes et une compréhension contextuelle, comme la réponse aux questions, les systèmes de dialogue et la génération de contenu.Idéal pour les tâches dans lesquelles le modèle doit se spécialiser dans un domaine précis ou effectuer un éventail limité de tâches, comme l’analyse des sentiments ou la reconnaissance d’entités nommées.
InterprétabilitéOffre un accès transparent aux sources de connaissances récupérées, permettant aux utilisateurs de comprendre le fondement des réponses générées.Faible interprétabilité.
Exigences en matière de latenceLe processus de récupération peut introduire de la latence, en particulier lors de l’accès à de vastes sources de connaissances, mais la génération elle-même peut être rapide une fois le contexte obtenu.Temps d’inférence généralement plus courts, car le modèle est affiné pour une tâche spécifique et peut nécessiter la récupération de moins de données externes pendant l’inférence.

Comment la génération augmentée par récupération est-elle utilisée aujourd’hui ?

Systèmes de réponse aux questions

Les modèles RAG sont utilisés dans les systèmes de réponse aux questions afin de fournir des réponses plus précises et plus sensibles au contexte aux requêtes des utilisateurs. Ces systèmes peuvent être déployés dans des chatbots d’assistance client, des assistants virtuels d’IA et des moteurs de recherche pour fournir des informations pertinentes aux utilisateurs en langage naturel.

Amélioration de la recherche

Le RAG peut améliorer les moteurs de recherche traditionnels en fournissant des résultats plus pertinents sur le plan contextuel. Au lieu de se contenter de faire correspondre des mots-clés, il récupère des passages pertinents dans une base de données plus vaste et génère des réponses davantage adaptées à la requête de l’utilisateur.

Advertisement

Moteurs de connaissances

Le RAG peut alimenter des moteurs de connaissances dans lesquels les utilisateurs posent des questions en langage naturel et reçoivent des réponses bien documentées. Cette approche est particulièrement utile dans les domaines qui disposent d’un grand volume de données structurées ou non structurées, comme la santé, le droit, la finance ou la recherche scientifique.

Le RAG face aux approches traditionnelles

Les approches traditionnelles de questions-réponses reposent largement sur la correspondance de mots-clés pour récupérer des informations, ce qui peut limiter la capacité à comprendre précisément les requêtes des utilisateurs et à fournir des résultats pertinents.

En revanche, le RAG propose une approche plus avancée et sensible au contexte de la recherche d’informations. Au lieu de s’appuyer uniquement sur la correspondance de mots-clés, le RAG combine plusieurs techniques, notamment la compréhension du langage naturel et l’apprentissage automatique, pour comprendre la sémantique et le contexte des requêtes des utilisateurs. Le RAG peut ainsi fournir des résultats plus précis et plus pertinents en comprenant l’intention qui sous-tend la requête, plutôt qu’en se contentant de faire correspondre des mots-clés.

En résumé : exploiter le potentiel du RAG

La génération augmentée par récupération est très prometteuse pour transformer divers aspects du traitement automatique du langage naturel et des tâches de génération de texte. En combinant les atouts des modèles fondés sur la récupération et de ceux fondés sur la génération, le RAG peut améliorer la qualité, la cohérence et la pertinence des textes générés.

Exploiter le potentiel du RAG peut conduire à des interactions plus efficaces et plus humaines avec les systèmes d’IA, à de meilleurs systèmes de réponse aux questions et à des capacités de création de contenu améliorées. Cette approche peut également contribuer à relever les défis courants de l’IA en générant des réponses plus diverses et plus informatives, en réduisant les biais dans les textes générés et en améliorant les performances globales des modèles de langage.

Pour en savoir plus sur les fournisseurs d’IA générative, consultez notre guide approfondi : Generative AI Companies: Top 20 Leaders

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.