3.10 — RAG : brancher l'agent sur VOS documents
Un agent est intelligent, mais il ne connaît pas vos documents : vos procédures internes, votre catalogue produit, vos comptes-rendus. Le RAG lui donne une mémoire documentaire : il va d’abord chercher les bons passages chez vous, puis répond en s’appuyant dessus.
🟢 En clair — RAG veut dire « génération augmentée par récupération » (Retrieval-Augmented Generation). Autrement dit : avant de répondre, l’IA cherche les passages utiles dans vos documents, puis rédige sa réponse à partir d’eux. Elle ne « connaît » pas vos docs par cœur — elle les consulte à chaque question.
📚 L’analogie de l’examen à livre ouvert. Sans RAG, l’IA répond de mémoire — et peut inventer (halluciner). Avec RAG, on lui ouvre le bon classeur à la bonne page : elle lit VOTRE document, puis répond. Le savoir reste dans votre classeur, pas dans sa tête.
Le RAG tient en trois étapes (la première une seule fois, les deux autres à chaque question) :
- 1. Préparer (une fois) — on découpe vos documents en petits morceaux et on les indexe par le sens (une sorte de « carte » du sens, appelée embeddings).
- 2. Retrouver (à chaque question) — on cherche les morceaux dont le sens est le plus proche de la question — pas seulement les mots-clés.
- 3. Répondre — on glisse ces morceaux dans le prompt : l’IA répond en s’appuyant dessus, et peut citer ses sources.
🔎 Le trajet d’une question :
Question ❓ → 🔎 recherche dans la base → 📄 passages pertinents → 🤖 réponse fondée (+ sources)
🧪 Essaie — pose une question au support d’une boutique fictive : compare la réponse de mémoire (sans RAG) et la réponse fondée sur les fiches (avec RAG), et vois quels passages sont retrouvés.
Choisis une question ci-dessus pour voir le RAG en action.
⚠️ Simulation pédagogique dans ton navigateur (aucune IA ni vraie base vectorielle). La « similarité » est ici un simple comptage de mots communs ; un vrai RAG compare le *sens* (embeddings).
🧩 Exemple concret — un agent de support client branché sur votre base de FAQ et de procédures. À « comment annuler ma commande ? », il retrouve la procédure exacte et répond « d’après la procédure « Annulation », étape 2… » — au lieu d’inventer une réponse plausible mais fausse.
Pourquoi c’est un tournant pour un agent :
- Moins d’hallucinations : la réponse s’appuie sur un texte réel, pas sur la mémoire floue du modèle.
- Toujours à jour : vous mettez à jour vos documents, pas le modèle. Aucun ré-entraînement.
- Vérifiable : l’agent cite d’où vient l’information.
🔧 Lien avec les outils (3.2) — le RAG est souvent le premier « outil » qu’on branche à un agent :
chercher_dans_mes_documents(question). En no-code (Make/n8n), ça prend la forme d’un nœud « base de connaissances / vector store » ; via MCP (3.3), d’une ressource documentaire exposée à l’agent.
⚠️ Erreur fréquente — confondre le RAG et le fait d’entraîner l’IA sur vos données (fine-tuning). Le RAG ne modifie pas le modèle : il lui fournit les bons extraits au bon moment. C’est moins cher, plus à jour et plus contrôlable que ré-entraîner — et c’est le premier réflexe pour la plupart des cas métier. (Le fine-tuning sert surtout à changer le style ou le format d’une réponse, pas à ajouter des connaissances.)
❓ Vérifie que tu as compris — votre agent doit répondre à partir de vos 200 pages de procédures internes, qui changent souvent. Fine-tuning ou RAG ?
Voir la réponse
RAG. Vos procédures changent (le RAG se met à jour en modifiant les documents, sans ré-entraîner), vous voulez des sources citées (vérifiable), et vous ajoutez des connaissances, pas un style. Le fine-tuning serait plus cher, vite périmé et non vérifiable.
✅ En résumé
- RAG = chercher d’abord dans VOS documents, puis répondre en s’appuyant dessus.
- 3 étapes : indexer vos docs → retrouver les passages utiles → répondre (+ sources).
- Avantages : moins d’hallucinations, à jour sans ré-entraînement, vérifiable.
- ≠ fine-tuning : le RAG ajoute des connaissances sans toucher au modèle.
🔍 Pour aller plus loin (tech). Les morceaux sont transformés en vecteurs (embeddings) stockés dans une base vectorielle ; la recherche compare les vecteurs (similarité de sens). Sujets avancés : découpage (chunking) malin, re-ranking des passages, et surtout évaluer son RAG (la réponse est-elle fidèle aux sources ? les bons passages sont-ils retrouvés ?). (Un notebook « RAG minimal, sans clé API » est prévu pour les profils tech.)
📝 Ma note
Une formationBaxIA