Salta ai contenuti

3.10 — RAG: collega l'agente ai TUOI documenti

Un agente è intelligente, ma non conosce i tuoi documenti: le tue procedure interne, il tuo catalogo prodotti, i tuoi report. Il RAG gli dà una memoria documentale: prima cerca i passaggi giusti nei tuoi contenuti, poi risponde basandosi su di essi.

🟢 In parole semplici — RAG significa generazione aumentata dal recupero (Retrieval-Augmented Generation). In altre parole: prima di rispondere, l’IA cerca i passaggi utili nei tuoi documenti, poi scrive la risposta a partire da essi. Non « conosce » i tuoi documenti a memoria — li consulta a ogni domanda.

📚 L’analogia dell’esame a libro aperto. Senza RAG, l’IA risponde a memoria — e può inventare (allucinare). Con il RAG, le apri il raccoglitore giusto alla pagina giusta: legge il TUO documento, poi risponde. Il sapere resta nel tuo raccoglitore, non nella sua testa.

Il RAG si riduce a tre passi (il primo una volta sola, gli altri due a ogni domanda):

  • 1. Preparare (una volta) — i tuoi documenti vengono divisi in piccoli pezzi e indicizzati per significato (una sorta di « mappa » del significato, chiamata embeddings).
  • 2. Recuperare (a ogni domanda) — si cercano i pezzi il cui significato è più vicino alla domanda — non solo le parole chiave.
  • 3. Rispondere — questi pezzi vengono inseriti nel prompt: l’IA risponde basandosi su di essi, e può citare le fonti.

🔎 Il percorso di una domanda: Domanda ❓ → 🔎 ricerca nella base → 📄 passaggi pertinenti → 🤖 risposta fondata (+ fonti)

🧪 Prova — fai una domanda al supporto di un negozio fittizio: confronta la risposta a memoria (senza RAG) con la risposta basata sulle schede (con RAG), e guarda quali passaggi vengono recuperati.

RAG Search— cerca nelle tue schede, poi risponde
Fai una domanda al supporto

Scegli una domanda qui sopra per vedere il RAG in azione.

⚠️ Simulazione didattica nel tuo browser (nessuna IA né vero database vettoriale). Qui la « similarità » è un semplice conteggio di parole comuni; un vero RAG confronta il *significato* (embeddings).

🧩 Esempio concreto — un agente di assistenza clienti collegato alla tua base di FAQ e procedure. A « come annullo il mio ordine? », recupera la procedura esatta e risponde « secondo la procedura « Annullamento », passo 2… » — invece di inventare una risposta plausibile ma falsa.

Perché è una svolta per un agente:

  • Meno allucinazioni: la risposta si basa su un testo reale, non sulla memoria sfocata del modello.
  • Sempre aggiornato: aggiorni i tuoi documenti, non il modello. Nessun riaddestramento.
  • Verificabile: l’agente cita da dove viene l’informazione.

🔧 Legame con gli strumenti (3.2) — il RAG è spesso il primo « strumento » che si collega a un agente: cerca_nei_miei_documenti(domanda). In no-code (Make/n8n) prende la forma di un nodo « base di conoscenza / vector store »; via MCP (3.3), di una risorsa documentale esposta all’agente.

⚠️ Errore frequente — confondere il RAG con l’addestrare l’IA sui tuoi dati (fine-tuning). Il RAG non modifica il modello: gli fornisce gli estratti giusti al momento giusto. È più economico, più aggiornato e più controllabile del riaddestramento — ed è il primo riflesso per la maggior parte dei casi aziendali. (Il fine-tuning serve soprattutto a cambiare lo stile o il formato di una risposta, non ad aggiungere conoscenze.)

Verifica di aver capito — il tuo agente deve rispondere a partire dalle tue 200 pagine di procedure interne, che cambiano spesso. Fine-tuning o RAG?

Vedi la risposta

RAG. Le tue procedure cambiano (il RAG si aggiorna modificando i documenti, senza riaddestrare), vuoi fonti citate (verificabile), e stai aggiungendo conoscenze, non uno stile. Il fine-tuning sarebbe più costoso, presto obsoleto e non verificabile.

In sintesi

  • RAG = cercare prima nei TUOI documenti, poi rispondere basandosi su di essi.
  • 3 passi: indicizzare i documenti → recuperare i passaggi utili → rispondere (+ fonti).
  • Vantaggi: meno allucinazioni, aggiornato senza riaddestramento, verificabile.
  • ≠ fine-tuning: il RAG aggiunge conoscenze senza toccare il modello.

🔍 Per approfondire (tech). I pezzi vengono trasformati in vettori (embeddings) memorizzati in un database vettoriale; la ricerca confronta i vettori (somiglianza di significato). Argomenti avanzati: suddivisione (chunking) intelligente, re-ranking dei passaggi, e soprattutto valutare il proprio RAG (la risposta è fedele alle fonti? i passaggi giusti vengono recuperati?). (Un notebook « RAG minimo, senza chiave API » è previsto per i profili tecnici.)

Come valuti questa lezione?
📝 La mia nota

Una formazioneBaxIA