Modelele AI bune în limba română nu apar doar din arhitecturi mari și plăci video scumpe. Ele depind, în primul rând, de date: texte corecte, diverse, curate, documentate și obținute legal.
Contextul european face tema și mai importantă. AI Act a intrat în vigoare la 1 august 2024, iar Comisia Europeană notează că regulamentul a devenit aplicabil, cu excepții și etape diferite, inclusiv obligații pentru modele de uz general. Pentru dezvoltatorii de modele, transparența privind datele, respectarea drepturilor de autor și documentarea procesului nu mai sunt detalii administrative, ci cerințe care trebuie tratate din faza de proiectare. Nu este consultanță juridică: situațiile concrete depind de scop, licențe, surse și jurisdicție, iar sursele oficiale trebuie verificate înainte de un proiect real.
De unde pornești: colectare legală, nu „tot ce găsești pe web”
Primul pas este definirea scopului. Un corpus pentru corectarea diacriticelor nu arată la fel ca unul pentru chatbot-uri de suport, analiză juridică, știri sau educație. Stabilește domeniul, perioada, tipurile de texte, licențele acceptate și ce date trebuie excluse: informații personale, conținut piratat, forumuri toxice, spam, duplicări masive sau pagini fără proveniență clară.
Sursele deschise pot fi utile, dar trebuie citite cu atenție. Common Crawl oferă instantanee mari ale webului, iar proiecte precum OSCAR distribuie date derivate pe limbi, inclusiv în variante deduplicate. Cardul OSCAR-2301 de pe Hugging Face listează pentru română un subcorpus consistent, dar avertizează și asupra limitărilor, licențelor și drepturilor de autor asupra conținutului crawlat. CulturaX este un alt exemplu relevant: un set multilingv public, prezentat ca fiind curățat și deduplicat, cu 167 de limbi. Aceste resurse sunt puncte de plecare pentru cercetare, nu scutiri automate de verificare legală.
Curățarea: mai mult decât ștergerea HTML-ului
Curățarea începe cu extragerea textului util din HTML, PDF sau documente, apoi eliminarea meniurilor, footerelor, cookie bannerelor, scripturilor, fragmentelor repetate și textelor fără sens. Un corpus românesc bun trebuie să păstreze propoziții naturale, nu resturi de interfețe web.
Urmează filtrarea limbii. Româna este adesea amestecată cu engleză, franceză, maghiară sau texte fără diacritice. Un detector de limbă ajută, dar nu este suficient: trebuie testat pe mostre românești reale, inclusiv știri, bloguri, anunțuri publice și texte regionale. Pentru fiecare document este util să salvezi metadate minime: sursa, data colectării, licența, domeniul, metoda de filtrare și motivul excluderii, dacă a fost respins.
Deduplicarea: de ce contează
Duplicatele degradează modelele. Dacă aceleași articole, comunicate sau pagini preluate apar de sute de ori, modelul poate memora formulări, poate supraevalua anumite surse și poate părea mai bun la testare decât este în realitate. Deduplicarea exactă elimină fișiere identice. Deduplicarea aproximativă, de obicei prin semnături, hashing pe fragmente sau tehnici precum MinHash, identifică texte aproape identice: articole republicate, pagini oglindă sau variante cu mici modificări.
Regula practică: deduplică la mai multe niveluri. Verifică documente întregi, paragrafe și linii. Păstrează un jurnal al eliminărilor, pentru că uneori duplicatele apar legitim în legislație, citate oficiale sau formulare standard.
Diacriticele nu sunt opționale
Pentru română, diacriticele sunt o problemă de calitate, nu de estetică. „fata” și „fața”, „copii” și „copiii”, „s-a” și „sa” pot schimba sensul. Un corpus fără diacritice poate fi util pentru sarcini speciale, dar pentru modele generale este important să ai text normalizat corect.
Normalizarea trebuie să distingă între caracterele corecte românești cu virgulă, precum „ș” și „ț”, și variantele vechi cu sedilă, precum „ş” și „ţ”. În practică, păstrează o politică explicită: convertești la forma modernă, marchezi textele fără diacritice și, dacă restaurezi automat diacriticele, păstrezi și versiunea originală. RoBERT, model BERT antrenat pentru română, include printre evaluările prezentate și restaurarea diacriticelor, semn că sarcina este relevantă pentru ecosistemul local.
Evaluarea calității: eșantioane, scoruri și oameni
Un corpus nu se declară „curat” doar pentru că a trecut printr-un script. Ai nevoie de evaluare. Începe cu eșantioane manuale: 100–500 de documente selectate pe domenii, surse și perioade. Notează limba corectă, prezența spamului, calitatea diacriticelor, procentul de text util și eventuale riscuri de date personale.
Adaugă metrici automate: lungimea documentelor, raportul semnelor de punctuație, repetiții, procentul de caractere neobișnuite, ponderea textelor fără diacritice, rata duplicatelor și distribuția surselor. Pentru un model, testează și impactul: performanță pe sarcini românești, robustețe pe texte fără diacritice, răspunsuri la întrebări locale și comportament pe domenii sensibile.
Limita importantă este că filtrarea excesivă poate șterge diversitatea limbii. Dacă păstrezi doar texte „perfecte”, modelul va înțelege mai slab româna reală: mesaje de utilizatori, formulări administrative, regionalisme sau greșeli frecvente. Calitatea nu înseamnă sterilizare, ci control, documentare și echilibru.
Pentru România, un corpus AI valoros se construiește încet: surse clare, licențe verificate, curățare reproductibilă, deduplicare transparentă, diacritice normalizate și evaluare repetată. Este o muncă mai puțin spectaculoasă decât lansarea unui chatbot, dar fără ea modelele în română vor rămâne fragile, greu de auditat și dependente de date opace.
Surse
- Comisia Europeană — AI Act, Shaping Europe’s digital future
- Comisia Europeană — General-Purpose AI Code of Practice
- EUR-Lex — Regulation (EU) 2024/1689, Artificial Intelligence Act
- Common Crawl — Overview
- OSCAR Project
- Hugging Face — oscar-corpus/OSCAR-2301 dataset card
- Hugging Face — CulturaX dataset card
- arXiv — CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages
- Hugging Face — readerbench/RoBERT-base model card

















































