Que veut dire RAG ?
RAG est le sigle anglais de Retrieval-Augmented Generation, que l'on traduit par génération augmentée par récupération. Le principe tient en une phrase : avant de répondre, le système va chercher des informations dans une source choisie, puis le modèle de langage rédige sa réponse en s'appuyant sur elles plutôt que sur sa seule mémoire.
Le terme vient de l'article « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », publié en 2020 sur arXiv par Patrick Lewis et onze coauteurs de Facebook AI Research, de l'University College London et de l'université de New York. Les auteurs y associent deux mémoires : la mémoire « paramétrique » d'un modèle de langage pré-entraîné (BART) et une mémoire « non paramétrique », un index vectoriel de Wikipédia de 21 millions de documents, interrogé par un moteur de recherche neuronal.
Comment fonctionne un RAG, étape par étape ?
Un RAG d'entreprise enchaîne cinq étapes, dont trois se déroulent avant la première question.
- Rassembler les documents de référence : procédures, contrats, fiches produits, historique du SAV, avec leur date de validité et leurs droits d'accès.
- Découper chaque document en passages courts et cohérents : un article de contrat, une étape de procédure, une fiche produit.
- Indexer : chaque passage est converti en vecteur numérique (embedding) qui représente son sens, puis rangé dans une base capable de retrouver les passages proches d'une question, même formulée avec d'autres mots.
- Rechercher : à chaque question, le système sélectionne les passages les plus pertinents, avec au besoin une recherche par mots-clés pour les références et numéros de pièce.
- Générer : ces passages sont insérés dans la consigne envoyée au modèle, avec l'instruction de répondre uniquement à partir d'eux et d'indiquer la source.
Dans son guide sur les agents de décembre 2024, Anthropic range la récupération d'informations parmi les extensions de base d'un modèle de langage, et observe qu'un appel au modèle bien construit, avec récupération et exemples, suffit souvent.
Exemples de RAG en entreprise
Le RAG est utile partout où des salariés cherchent une réponse précise dans une masse de documents qui évolue.
| Source documentaire | Question posée | Ce que le RAG change |
|---|---|---|
| Contrats et conditions générales | « Quel préavis de résiliation pour le contrat de maintenance du client Martin ? » | La réponse cite l'article exact au lieu d'un souvenir approximatif |
| Modes opératoires d'atelier | « Quel couple de serrage après remplacement de cette pièce ? » | Le technicien obtient la version en vigueur, pas celle imprimée il y a trois ans |
| Catalogue et fiches techniques | « Cette pièce est-elle compatible avec tel modèle ? » | Le commercial répond en rendez-vous, sans rappeler le bureau d'études |
Sur le site Pièces Peugeot Motocycles, YMHB Web a intégré un assistant conversationnel connecté au catalogue : la même idée d'une réponse appuyée sur des données de référence.
RAG, réentraînement ou long contexte : que choisir ?
Le RAG est la bonne approche quand les connaissances sont nombreuses, changent souvent et doivent être sourcées.
| Approche | Principe | Mise à jour des connaissances | Adaptée quand |
|---|---|---|---|
| RAG | Le système retrouve les passages utiles et les donne au modèle | On met à jour l'index | Base documentaire large et vivante, réponses à justifier |
| Réentraînement (fine-tuning) | On ajuste les paramètres du modèle sur des exemples | Nouvel entraînement | Format ou ton à reproduire à l'identique sur une tâche répétitive |
| Long contexte | On place le document entier dans la consigne | On renvoie le document | Analyse ponctuelle d'un dossier précis |
Les auteurs de l'article de 2020 ont montré qu'un simple changement d'index met à jour les connaissances : avec un index de Wikipédia de 2016, leur modèle identifiait 70 % des dirigeants mondiaux de 2016 testés, et 68 % de ceux de 2018 avec l'index de 2018, contre 4 à 12 % avec un index décalé. Le long contexte progresse aussi, avec une fenêtre d'un million de jetons pour les modèles Claude actuels selon la documentation d'Anthropic relevée en octobre 2026, mais chaque appel retraite alors tout le texte fourni.
Pourquoi un RAG peut encore se tromper
- Le bon passage n'est pas retrouvé : PDF scannés sans texte exploitable, découpage qui coupe un tableau en deux, sigles internes que la recherche ne relie pas à la question.
- Les documents se contredisent : l'ancienne et la nouvelle grille tarifaire cohabitent dans l'index et le modèle s'appuie sur la mauvaise.
- Les droits d'accès sont oubliés : un commercial obtient un extrait d'un dossier du personnel parce que la recherche ne filtre pas selon le profil de l'utilisateur.
- Personne ne mesure la qualité : sans jeu de questions de test et de réponses attendues, impossible de savoir si une modification améliore ou dégrade le système.
Le RAG réduit les hallucinations sans les supprimer : l'article de 2020 rapporte un langage plus précis et plus factuel qu'un modèle seul, pas une exactitude garantie. Un assistant RAG sérieux affiche donc la source de chaque réponse, pour que l'utilisateur puisse la vérifier.
Termes voisins
- LLM : le modèle de langage qui rédige la réponse à partir des passages retrouvés.
- Embedding : la représentation numérique du sens d'un texte, qui permet de retrouver des passages proches d'une question.
- Agent IA : un programme qui peut utiliser la recherche documentaire comme un outil parmi d'autres.
- Assistant IA sur vos documents : les facteurs qui font varier le coût d'un projet de ce type.
Questions fréquentes
- Que signifie RAG en intelligence artificielle ?
- En intelligence artificielle, RAG signifie Retrieval-Augmented Generation, ou génération augmentée par récupération. Le RAG désigne une technique où un système retrouve d'abord les passages utiles dans une base de documents, puis les transmet à un modèle de langage qui rédige sa réponse à partir d'eux. Le terme vient d'un article de Patrick Lewis et de ses coauteurs publié sur arXiv en 2020.
- Le RAG empêche-t-il les hallucinations ?
- Non, le RAG réduit les hallucinations sans les empêcher. Le modèle peut mal résumer un passage, mélanger deux documents ou répondre alors que la recherche n'a rien trouvé de pertinent. On limite ce risque en demandant au modèle de citer ses sources, en l'autorisant à répondre qu'il ne sait pas, et en mesurant régulièrement les réponses sur un jeu de questions de test.
- Avec un RAG, mes documents servent-ils à entraîner le modèle ?
- Avec un RAG, les documents ne modifient pas le modèle de langage : ils lui sont transmis au moment de chaque question, puis la réponse est produite. Les documents sont en revanche envoyés au fournisseur du modèle à chaque appel. Il faut donc vérifier dans son contrat l'usage qu'il fait des données reçues, leur durée de conservation et leur lieu de traitement, ou héberger le modèle soi-même.
- Quelle différence entre RAG et fine-tuning ?
- Le RAG apporte des connaissances au modèle au moment de la question, en lui donnant des passages de documents, alors que le fine-tuning modifie les paramètres du modèle par un nouvel entraînement sur des exemples. Le RAG convient aux informations nombreuses et changeantes, qu'il suffit de mettre à jour dans l'index. Le fine-tuning convient plutôt pour imposer un format ou un style constant.