Skip to main content

Cyber AI România

Marți, 29 septembrie 2026

Reward Model pentru preference learning: cum antrenezi și calibrezi un evaluator chosen–rejected

Un reward model este un evaluator antrenat să estimeze care dintre două răspunsuri este preferat de oameni. Într-un flux de preference learning, el nu „știe” adevărul absolut; învață un semnal relativ din perechi de tip chosen–rejected: pentru același prompt, răspunsul chosen a fost preferat, iar rejected a fost respins. Folosit corect, modelul ajută la evaluare, filtrare și, uneori, la optimizarea unui asistent AI. Folosit superficial, poate recompensa lungimea, tonul convingător sau alte scurtături nedorite.

Începe cu rubrica, nu cu modelul

Primul pas este definirea criteriilor. Înainte de date și cod, scrie ce înseamnă „mai bun”: corectitudine, utilitate, respectarea instrucțiunilor, siguranță, concizie și ton potrivit. Pentru un evaluator defensiv, include explicit penalizări pentru halucinații, sfaturi riscante, scurgeri de date personale sau instrucțiuni care facilitează abuzuri. Fără rubrică, perechile chosen–rejected devin zgomotoase: adnotatorii aleg după preferințe diferite, iar modelul învață un amestec greu de calibrat.

Cum pregătești perechile chosen–rejected

Datele trebuie să aibă format consistent. O pereche minimă conține promptul, răspunsul chosen și răspunsul rejected. În format conversațional, chosen și rejected pot fi liste de mesaje cu roluri, exact cum documentează și instrumente precum TRL de la Hugging Face. Important este ca diferența dintre răspunsuri să reflecte criteriul dorit, nu doar lungimea sau stilul. Elimină duplicatele, exemplele ambigue și perechile unde ambele răspunsuri sunt nesigure. Păstrează un set de validare separat, ideal cu prompturi diferite de cele din antrenare.

Ce învață, de fapt, reward modelul

Antrenarea clasică folosește o idee de tip Bradley–Terry: modelul produce un scor scalar pentru fiecare răspuns, iar pierderea îl împinge să dea scor mai mare răspunsului chosen decât celui rejected. În practică, pornești de la un model lingvistic potrivit domeniului și îi adaugi un cap de regresie sau reward. Hiperparametrii nu trebuie tratați ca rețete magice: rata de învățare, batch size, numărul de epoci și regularizarea se aleg în funcție de mărimea datelor, model, buget și validare.

Metrici utile, dar insuficiente

Măsoară mai mult decât acuratețea pe perechi. Pairwise accuracy spune în câte cazuri scorul chosen este mai mare decât scorul rejected, dar nu îți spune dacă scorurile sunt calibrate. Verifică distribuțiile scorurilor, diferența medie chosen–rejected și exemplele unde modelul greșește. Caută biasuri: răspunsuri mai lungi, mai politicoase sau mai sigure verbal pot primi scoruri mari chiar când sunt incorecte. Studii despre RLHF au arătat că lungimea răspunsului poate influența recompensa, deci include teste controlate cu răspunsuri de lungimi diferite.

Calibrarea scorurilor

Calibrarea înseamnă să faci scorul util operațional, nu doar să ordonezi perechile. O metodă simplă este să transformi diferența de scor într-o probabilitate estimată că răspunsul chosen este preferat și să verifici dacă probabilitățile corespund frecvențelor reale pe validare. Poți folosi curbe de calibrare, grupare pe intervale de scor și praguri alese pe date de validare, nu pe intuiție. Dacă modelul indică 0,80 în multe cazuri, aproximativ 80% dintre acele cazuri ar trebui să fie corecte; altfel, scorul este supraîncrezător sau subîncrezător.

Testare înainte de folosire

Înainte de a folosi evaluatorul într-un flux automat, testează-l pe cazuri-limită. Include prompturi cu informații false, cereri ambigue, cereri de securitate ofensivă, date personale, răspunsuri foarte scurte și răspunsuri lungi dar goale. Revizuirea manuală a erorilor este obligatorie: un reward model poate amplifica defectele datasetului. Dacă îl folosești pentru a selecta răspunsuri, păstrează garduri separate de siguranță și verificări factuale; evaluatorul nu este un substitut pentru politici, filtrare sau expertiză umană.

Pentru iterație, tratează reward modelul ca pe un produs de evaluare. Versionează datele, modelul, rubricile și metricile. Compară fiecare versiune cu un baseline simplu și cu evaluare umană pe un eșantion mic. Când apar erori sistematice, nu corecta doar pragul; adaugă exemple reprezentative, clarifică rubricile și reantrenează. Scopul nu este un scor frumos, ci un evaluator previzibil, auditat și suficient de bine calibrat pentru decizii cu risc controlat.

Surse

Facebook
X
WhatsApp
Reward Model pentru preference learning: cum antrenezi și calibrezi un evaluator chosen–rejected

Te-ar putea interesa si: