Un sistem RAG clasic primește o întrebare, caută fragmente relevante într-un index vectorial sau lexical, apoi trimite acele fragmente către un model lingvistic pentru a genera răspunsul. Pentru întrebări directe, metoda poate funcționa foarte bine. Pentru întrebări complexe, ambigue sau compuse, rezultatul depinde mult de felul în care a fost formulată întrebarea inițială.
Aici intră în scenă RAG Fusion: o tehnică folosită pentru a lărgi căutarea, fără a transforma modelul AI într-o sursă de adevăr. Ideea este simplă: în loc să cauți o singură dată, generezi mai multe interogări apropiate ca sens, rulezi recuperarea pentru fiecare, apoi combini rezultatele cu Reciprocal Rank Fusion, prescurtat RRF.
RAG Fusion nu garantează că răspunsul final este corect. Este o metodă de recuperare și reordonare a documentelor. Dacă documentele din index sunt vechi, incomplete sau greșite, sistemul poate produce în continuare un răspuns slab. De aceea, într-un proiect serios, sursele, fragmentele folosite și traseul de recuperare trebuie păstrate pentru verificare.
De ce nu ajunge o singură întrebare
Să luăm o întrebare practică: „Ce riscuri are o firmă mică dacă folosește un chatbot intern pentru documente care pot conține date personale?” O căutare simplă poate pune accent pe „chatbot intern” și poate rata elemente importante precum accesul angajaților, logurile, protecția datelor, auditul sau separarea documentelor confidențiale.
Multi-query retrieval încearcă să rezolve această limitare. Un model lingvistic reformulează întrebarea în mai multe interogări scurte, fiecare orientată spre un alt unghi al problemei. LangChain documentează această abordare prin MultiQueryRetriever, unde modelul generează mai multe versiuni ale întrebării pentru a acoperi perspective diferite în etapa de retrieval.
Pasul 1: formulează întrebarea de bază
Întrebarea inițială trebuie păstrată clară și completă. Nu începe cu o comandă vagă precum „explică AI în firme”. Scrie exact ce vrei să afli: „Ce măsuri de securitate sunt recomandate pentru un sistem RAG intern care caută în documente ale companiei?”
Această întrebare devine punctul de plecare. Ea nu se pierde și nu este înlocuită de reformulări. Reformulările sunt doar ajutoare pentru căutare.
Pasul 2: generează 3-5 interogări alternative
Pentru aceeași întrebare, sistemul poate genera variante precum: „securitate RAG documente interne”, „control acces chatbot documente companie”, „riscuri date personale asistent AI intern”, „audit loguri sistem RAG” și „protecția informațiilor confidențiale în retrieval”.
Numărul trebuie ținut sub control. Prea puține interogări pot rata context. Prea multe pot aduce zgomot, costuri mai mari și fragmente irelevante. Pentru un proiect pilot, 3-5 interogări sunt un punct de pornire rezonabil.
Pasul 3: rulează retrieval pentru fiecare interogare
Fiecare interogare se trimite către sistemul de căutare: index vectorial, BM25 sau căutare hibridă. Pentru fiecare rezultat se păstrează cel puțin identificatorul documentului, poziția în lista de rezultate, sursa și fragmentul recuperat.
Este important să nu compari direct scoruri brute venite din sisteme diferite. Scorul unui model vectorial și scorul unui motor lexical nu au aceeași semnificație. De aceea, RRF se uită la poziția rezultatului în listă, nu la scorul brut.
Pasul 4: combină rezultatele cu Reciprocal Rank Fusion
Reciprocal Rank Fusion este o metodă de combinare a mai multor liste ordonate de rezultate. Formula folosită frecvent este suma 1 / (k + rang), unde rangul este poziția documentului într-o listă, iar k este o constantă de stabilizare. Documentele care apar sus în mai multe liste primesc un avantaj.
Lucrarea semnată de Gordon V. Cormack, Charles L. A. Clarke și Stefan Büttcher a arătat că RRF poate combina eficient rezultate provenite din sisteme diferite de recuperare. Microsoft Azure AI Search folosește RRF pentru a uni rezultatele din interogări paralele în căutarea hibridă, iar Elasticsearch documentează RRF ca metodă de combinare a mai multor seturi de rezultate.
Pasul 5: selectează fragmentele pentru răspuns
După calcularea scorului RRF, sortezi documentele și alegi fragmentele de top. Apoi aplici deduplicare: dacă două fragmente spun același lucru din același document, păstrezi varianta mai clară. Pentru aplicații interne, verificarea drepturilor de acces este obligatorie: retrieverul nu trebuie să returneze documente pe care utilizatorul nu are voie să le vadă.
Pasul 6: construiește răspunsul cu surse
Modelul primește întrebarea inițială, fragmentele selectate și instrucțiunea de a răspunde doar pe baza contextului primit. Dacă sursele nu sunt suficiente, răspunsul corect este „nu am suficiente informații”, nu o completare inventată.
RAG Fusion este util mai ales pentru întrebări complexe, unde o singură formulare poate rata informații esențiale. Dar metoda trebuie tratată ca o îmbunătățire a recuperării, nu ca o garanție de adevăr. Diferența dintre un demo spectaculos și un sistem utilizabil în producție stă în verificare: surse clare, acces controlat, loguri păstrate și răspunsuri care recunosc limitele informației disponibile.
Surse
- Cormack, Gordon V.; Clarke, Charles L. A.; Büttcher, Stefan — „Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods”, SIGIR 2009
- Microsoft Learn — „Hybrid Search Scoring (RRF) – Azure AI Search”
- Elastic — „Reciprocal rank fusion | Elasticsearch Reference”
- LangChain Docs — MultiQueryRetriever / query multiple queries

















































