Aller au contenu

3.10 — RAG : brancher l'agent sur VOS documents

Un agent est intelligent, mais il ne connaît pas vos documents : vos procédures internes, votre catalogue produit, vos comptes-rendus. Le RAG lui donne une mémoire documentaire : il va d’abord chercher les bons passages chez vous, puis répond en s’appuyant dessus.

🟢 En clair — RAG veut dire « génération augmentée par récupération » (Retrieval-Augmented Generation). Autrement dit : avant de répondre, l’IA cherche les passages utiles dans vos documents, puis rédige sa réponse à partir d’eux. Elle ne « connaît » pas vos docs par cœur — elle les consulte à chaque question.

📚 L’analogie de l’examen à livre ouvert. Sans RAG, l’IA répond de mémoire — et peut inventer (halluciner). Avec RAG, on lui ouvre le bon classeur à la bonne page : elle lit VOTRE document, puis répond. Le savoir reste dans votre classeur, pas dans sa tête.

Le RAG tient en trois étapes (la première une seule fois, les deux autres à chaque question) :

  • 1. Préparer (une fois) — on découpe vos documents en petits morceaux et on les indexe par le sens (une sorte de « carte » du sens, appelée embeddings).
  • 2. Retrouver (à chaque question) — on cherche les morceaux dont le sens est le plus proche de la question — pas seulement les mots-clés.
  • 3. Répondre — on glisse ces morceaux dans le prompt : l’IA répond en s’appuyant dessus, et peut citer ses sources.

🔎 Le trajet d’une question : Question ❓ → 🔎 recherche dans la base → 📄 passages pertinents → 🤖 réponse fondée (+ sources)

🧪 Essaie — pose une question au support d’une boutique fictive : compare la réponse de mémoire (sans RAG) et la réponse fondée sur les fiches (avec RAG), et vois quels passages sont retrouvés.

RAG Search— cherche dans tes fiches, puis répond
Pose une question au support

Choisis une question ci-dessus pour voir le RAG en action.

⚠️ Simulation pédagogique dans ton navigateur (aucune IA ni vraie base vectorielle). La « similarité » est ici un simple comptage de mots communs ; un vrai RAG compare le *sens* (embeddings).

🧩 Exemple concret — un agent de support client branché sur votre base de FAQ et de procédures. À « comment annuler ma commande ? », il retrouve la procédure exacte et répond « d’après la procédure « Annulation », étape 2… » — au lieu d’inventer une réponse plausible mais fausse.

Pourquoi c’est un tournant pour un agent :

  • Moins d’hallucinations : la réponse s’appuie sur un texte réel, pas sur la mémoire floue du modèle.
  • Toujours à jour : vous mettez à jour vos documents, pas le modèle. Aucun ré-entraînement.
  • Vérifiable : l’agent cite d’où vient l’information.

🔧 Lien avec les outils (3.2) — le RAG est souvent le premier « outil » qu’on branche à un agent : chercher_dans_mes_documents(question). En no-code (Make/n8n), ça prend la forme d’un nœud « base de connaissances / vector store » ; via MCP (3.3), d’une ressource documentaire exposée à l’agent.

⚠️ Erreur fréquente — confondre le RAG et le fait d’entraîner l’IA sur vos données (fine-tuning). Le RAG ne modifie pas le modèle : il lui fournit les bons extraits au bon moment. C’est moins cher, plus à jour et plus contrôlable que ré-entraîner — et c’est le premier réflexe pour la plupart des cas métier. (Le fine-tuning sert surtout à changer le style ou le format d’une réponse, pas à ajouter des connaissances.)

Vérifie que tu as compris — votre agent doit répondre à partir de vos 200 pages de procédures internes, qui changent souvent. Fine-tuning ou RAG ?

Voir la réponse

RAG. Vos procédures changent (le RAG se met à jour en modifiant les documents, sans ré-entraîner), vous voulez des sources citées (vérifiable), et vous ajoutez des connaissances, pas un style. Le fine-tuning serait plus cher, vite périmé et non vérifiable.

En résumé

  • RAG = chercher d’abord dans VOS documents, puis répondre en s’appuyant dessus.
  • 3 étapes : indexer vos docs → retrouver les passages utiles → répondre (+ sources).
  • Avantages : moins d’hallucinations, à jour sans ré-entraînement, vérifiable.
  • ≠ fine-tuning : le RAG ajoute des connaissances sans toucher au modèle.

🔍 Pour aller plus loin (tech). Les morceaux sont transformés en vecteurs (embeddings) stockés dans une base vectorielle ; la recherche compare les vecteurs (similarité de sens). Sujets avancés : découpage (chunking) malin, re-ranking des passages, et surtout évaluer son RAG (la réponse est-elle fidèle aux sources ? les bons passages sont-ils retrouvés ?). (Un notebook « RAG minimal, sans clé API » est prévu pour les profils tech.)

Comment évaluez-vous cette leçon ?
📝 Ma note

Une formationBaxIA