La génération augmentée par récupération, ou RAG, est une technique qui améliore les résultats des grands modèles de langage en intégrant des informations provenant de bases de connaissances ou de sources externes.
En récupérant des données ou des documents pertinents avant de générer une réponse, le RAG améliore la précision, la fiabilité et la richesse informative du texte produit. Cette approche permet d’ancrer le contenu généré dans des sources d’information externes, afin de garantir des résultats plus pertinents sur le plan contextuel et plus précis sur le plan factuel.
Poursuivez votre lecture pour en savoir plus sur le RAG, son fonctionnement, ses cas d’usage et ses différences avec le processus traditionnel de traitement automatique du langage naturel (NLP).
- Qu’est-ce que la génération augmentée par récupération (RAG) ?
- Fonctionnement pratique de la génération augmentée par récupération
- 3 avantages clés de la génération augmentée par récupération
- Quand utiliser le RAG plutôt que l’affinage d’un modèle d’IA ?
- Comment la génération augmentée par récupération est-elle utilisée aujourd’hui ?
- Le RAG face aux approches traditionnelles
- En résumé : exploiter le potentiel du RAG
Qu’est-ce que la génération augmentée par récupération (RAG) ?
Vous avez probablement déjà entendu dire que les contenus générés par l’IA sont susceptibles de présenter des problèmes de plagiat et de manquer d’originalité. Dans les tâches traditionnelles de traitement automatique du langage naturel, les modèles de langage génèrent des réponses en se fondant uniquement sur les schémas et les informations présents dans leurs données d’entraînement. Si cette approche a produit des résultats impressionnants, elle présente aussi des limites, comme le risque de générer des résultats erronés ou biaisés, en particulier face à des requêtes complexes ou ambiguës.
La génération augmentée par récupération est une technique qui répond à ce problème en combinant la puissance du traitement automatique du langage naturel et celle de la recherche d’informations.
Imaginez que vous deviez rédiger un article de recherche sans accès à Internet ni à aucune ressource externe. Vous pourriez avoir une compréhension générale du sujet, mais pour étayer vos arguments et fournir une analyse approfondie, vous devriez consulter diverses sources d’information.
C’est là qu’intervient le RAG : il joue le rôle de votre assistant de recherche, en vous aidant à accéder aux informations pertinentes et à les intégrer pour améliorer la qualité et la profondeur de votre travail.
Les grands modèles de langage (LLM) sont entraînés sur d’immenses volumes de données. Ils ressemblent à des personnes très cultivées qui possèdent une compréhension étendue de nombreux sujets et domaines. Ils peuvent fournir des informations générales et répondre à diverses requêtes grâce à leur vaste base de connaissances. Mais pour produire des réponses plus précises, fiables et détaillées, étayées par des éléments de preuve ou des exemples spécifiques, les LLM ont souvent besoin de l’aide des techniques de RAG. C’est comparable à la situation d’une personne pourtant très érudite qui doit consulter des références ou des sources pour fournir, dans certains cas, des réponses complètes et exactes.
Pour approfondir vos connaissances sur les principaux grands modèles de langage actuels, consultez notre guide consacré aux Best Large Language Models
Fonctionnement pratique de la génération augmentée par récupération
La génération augmentée par récupération (RAG) est une architecture de modèle d’IA qui combine les atouts des modèles paramétriques préentraînés (comme les modèles fondés sur des transformeurs) et de la récupération de mémoire non paramétrique, afin de permettre la génération de texte conditionnée à la fois par l’invite saisie et par des sources de connaissances externes.
Le fonctionnement du modèle RAG commence par la requête ou l’invite de l’utilisateur. Le modèle de récupération est activé lorsque vous saisissez vos questions dans le champ de texte de votre IA générative.
Phase de requête
Lors de la phase de requête ou d’invite, le système parcourt une vaste source de connaissances afin de trouver les informations pertinentes correspondant à la requête ou à l’invite saisie. Cette source de connaissances peut être constituée d’un ensemble de documents, d’une base de données ou de tout autre référentiel de données structurées ou non structurées. Il peut également s’agir de la base de connaissances de votre entreprise.
Par exemple, si la requête saisie est « Quels sont les symptômes de la COVID-19 ? », le système RAG recherchera et récupérera les informations pertinentes dans une base de données contenant des documents ou des articles médicaux.

Image : AWS
Récupération
Une fois les informations pertinentes trouvées, le système RAG sélectionne un ensemble de passages ou de documents candidats susceptibles de contenir des informations utiles à la génération d’une réponse. Cette étape permet d’écarter les informations non pertinentes ou redondantes et de ne retenir que la réponse la plus pertinente à votre question.
Dans l’exemple de la COVID-19, le système pourrait sélectionner des passages d’articles médicaux recensant les symptômes courants associés à la maladie.
Phase de génération
Lors de la phase de génération, le résultat est renvoyé à l’utilisateur. Le RAG utilise les passages candidats sélectionnés comme contexte pour générer une réponse ou un texte.
Ce processus de génération peut reposer sur diverses techniques, comme les modèles neuronaux de langage (par exemple, GPT) ou d’autres architectures de génération. La réponse générée doit être cohérente, pertinente et informative au regard de la requête saisie et du contexte récupéré.
3 avantages clés de la génération augmentée par récupération
Réduction des biais dans les réponses
Les systèmes RAG peuvent atténuer les effets des biais propres à un jeu de données ou à un référentiel de connaissances unique en récupérant des informations provenant de sources diverses. Cela contribue à fournir des réponses plus équilibrées et objectives, puisque le système prend en compte un éventail plus large de perspectives et de points de vue. En favorisant l’inclusivité et la diversité des contenus récupérés, les modèles RAG produisent des interactions plus équitables et plus justes.
Réduction du risque d’hallucinations
Les hallucinations désignent la génération d’informations incorrectes ou incohérentes par les grands modèles de langage. Les systèmes RAG réduisent ce risque en intégrant des informations concrètes récupérées à partir de sources de connaissances externes.
En récupérant les réponses et en les ancrant dans des informations externes vérifiées, les modèles RAG sont moins susceptibles de générer des contenus hallucinés. Le recours à ce contexte externe contribue à garantir que les réponses générées sont ancrées dans la réalité et conformes aux faits, réduisant ainsi le risque de produire des résultats inexacts ou trompeurs.
Amélioration de la qualité des réponses
La technique RAG peut générer des réponses pertinentes, fluides et cohérentes en combinant les techniques de récupération et de génération, ce qui permet d’obtenir des résultats de meilleure qualité que les approches reposant uniquement sur la génération. Même le meilleur LLM a clairement ses limites : le RAG est la technologie nécessaire pour lui ajouter une base de connaissances plus approfondie.
Quand utiliser le RAG plutôt que l’affinage d’un modèle d’IA ?
Ce tableau récapitule les éléments à prendre en compte pour choisir entre le RAG et l’affinage d’un modèle d’IA selon différents critères.
| Critères | RAG | Affinage d’un modèle d’IA |
|---|---|---|
| Accès à des connaissances externes | Adapté aux tâches nécessitant l’accès à des sources de connaissances externes. | Peut ne pas nécessiter l’accès à des connaissances externes. |
| Intégration des connaissances | Excelle dans l’intégration de connaissances externes aux réponses générées, offrant des résultats plus complets et plus informatifs. | Peut avoir du mal à intégrer des connaissances externes au-delà de celles encodées dans les données d’affinage, ce qui peut entraîner des réponses moins diversifiées ou moins pertinentes sur le plan contextuel. |
| Compromis en matière de performances | Offre un compromis entre la latence des réponses et la richesse des informations : des temps de réponse plus longs peuvent produire des résultats plus complets et plus pertinents sur le plan contextuel. | Fournit des temps de réponse plus courts, mais peut sacrifier une partie de la compréhension contextuelle et de l’intégration des connaissances par rapport au RAG. |
| Nature de la tâche | Adapté aux tâches nécessitant l’accès à des sources de connaissances externes et une compréhension contextuelle, comme la réponse aux questions, les systèmes de dialogue et la génération de contenu. | Idéal pour les tâches dans lesquelles le modèle doit se spécialiser dans un domaine précis ou effectuer un éventail limité de tâches, comme l’analyse des sentiments ou la reconnaissance d’entités nommées. |
| Interprétabilité | Offre un accès transparent aux sources de connaissances récupérées, permettant aux utilisateurs de comprendre le fondement des réponses générées. | Faible interprétabilité. |
| Exigences en matière de latence | Le processus de récupération peut introduire de la latence, en particulier lors de l’accès à de vastes sources de connaissances, mais la génération elle-même peut être rapide une fois le contexte obtenu. | Temps d’inférence généralement plus courts, car le modèle est affiné pour une tâche spécifique et peut nécessiter la récupération de moins de données externes pendant l’inférence. |
Comment la génération augmentée par récupération est-elle utilisée aujourd’hui ?
Systèmes de réponse aux questions
Les modèles RAG sont utilisés dans les systèmes de réponse aux questions afin de fournir des réponses plus précises et plus sensibles au contexte aux requêtes des utilisateurs. Ces systèmes peuvent être déployés dans des chatbots d’assistance client, des assistants virtuels d’IA et des moteurs de recherche pour fournir des informations pertinentes aux utilisateurs en langage naturel.
Amélioration de la recherche
Le RAG peut améliorer les moteurs de recherche traditionnels en fournissant des résultats plus pertinents sur le plan contextuel. Au lieu de se contenter de faire correspondre des mots-clés, il récupère des passages pertinents dans une base de données plus vaste et génère des réponses davantage adaptées à la requête de l’utilisateur.
Moteurs de connaissances
Le RAG peut alimenter des moteurs de connaissances dans lesquels les utilisateurs posent des questions en langage naturel et reçoivent des réponses bien documentées. Cette approche est particulièrement utile dans les domaines qui disposent d’un grand volume de données structurées ou non structurées, comme la santé, le droit, la finance ou la recherche scientifique.
Le RAG face aux approches traditionnelles
Les approches traditionnelles de questions-réponses reposent largement sur la correspondance de mots-clés pour récupérer des informations, ce qui peut limiter la capacité à comprendre précisément les requêtes des utilisateurs et à fournir des résultats pertinents.
En revanche, le RAG propose une approche plus avancée et sensible au contexte de la recherche d’informations. Au lieu de s’appuyer uniquement sur la correspondance de mots-clés, le RAG combine plusieurs techniques, notamment la compréhension du langage naturel et l’apprentissage automatique, pour comprendre la sémantique et le contexte des requêtes des utilisateurs. Le RAG peut ainsi fournir des résultats plus précis et plus pertinents en comprenant l’intention qui sous-tend la requête, plutôt qu’en se contentant de faire correspondre des mots-clés.
En résumé : exploiter le potentiel du RAG
La génération augmentée par récupération est très prometteuse pour transformer divers aspects du traitement automatique du langage naturel et des tâches de génération de texte. En combinant les atouts des modèles fondés sur la récupération et de ceux fondés sur la génération, le RAG peut améliorer la qualité, la cohérence et la pertinence des textes générés.
Exploiter le potentiel du RAG peut conduire à des interactions plus efficaces et plus humaines avec les systèmes d’IA, à de meilleurs systèmes de réponse aux questions et à des capacités de création de contenu améliorées. Cette approche peut également contribuer à relever les défis courants de l’IA en générant des réponses plus diverses et plus informatives, en réduisant les biais dans les textes générés et en améliorant les performances globales des modèles de langage.
Pour en savoir plus sur les fournisseurs d’IA générative, consultez notre guide approfondi : Generative AI Companies: Top 20 Leaders


