Măsurăm ce promitem.
„Fundamentat pe lege" nu poate fi doar un slogan. Rulăm un benchmark intern pe un set fix de întrebări cu răspuns cunoscut și publicăm cifrele — cu tot cu metodologie și cu ce NU garantează ele.
Cifrele, pe scurt.
Articol corect în top 10
Articol corect în top 5
Citare corectă în răspuns
Refuz corect în afara domeniului
Măsurat pe setul auriu de 34 întrebări de recuperare + 3 de control (în afara domeniului), pe calea de recuperare din producție. Ultima rulare reprodusă: 3 iulie 2026. Vezi metodologia și tabelul complet mai jos.
| Metrică | Valoare | Ce înseamnă |
|---|---|---|
| Articol corect în top 10 | 91,2% | În 91,2% din întrebări, articolul de lege așteptat apare printre primele 10 prevederi recuperate. |
| Articol corect în top 5 | 88,2% | Restrâns la primele 5 rezultate — cele pe care le vede efectiv modelul care compune răspunsul. |
| Citare corectă în răspuns | 97,1% | În 97,1% din cazuri, răspunsul final citează chiar articolul așteptat (măsurat end-to-end, cu generare). |
| Refuz corect în afara domeniului | 100% | La întrebări fără temei în surse, Jurivo refuză să răspundă în loc să improvizeze — 100% din cazurile de control. |
| MRR (rang mediu reciproc) | 0,695 | Măsură de poziționare: cu cât articolul corect apare mai sus în listă, cu atât scorul e mai aproape de 1. |
Drept UE (extensie).
Corpusul de drept UE (GDPR, eIDAS, protecția avertizorilor) e evaluat separat, cu propriile întrebări cu răspuns cunoscut, pe un branch de test dedicat.
- 100% — Pe cele 17 întrebări de drept UE (GDPR, eIDAS, avertizori), articolul corect apare de fiecare dată în top 10.
- 1,000 — Scor perfect: articolul corect e constant pe prima poziție pentru corpusul UE indexat.
17 întrebări de recuperare + 1 de control.
Cum măsurăm, exact.
Benchmark-ul rulează chiar calea de recuperare din producție (recuperare hibridă + rerank), peste un set de întrebări adnotate manual cu articolul de lege corect. Nimic nu e „aranjat" pentru test.
- Recuperare (hit@k). Pentru fiecare întrebare știm articolul corect. „hit@10" = de câte ori acel articol apare printre primele 10 prevederi recuperate; „hit@5" restrânge la primele 5 — cele văzute efectiv de model.
- Citare corectă (end-to-end). Generăm răspunsul complet cu modelul de producție și verificăm automat că citează chiar articolul așteptat, nu doar că l-a recuperat.
- Refuz în afara domeniului. Includem întrebări-capcană fără temei în surse (ex. „Care e capitala Franței?"). Răspunsul corect e refuzul — măsurăm că se întâmplă de fiecare dată.
- Judecătorul de verificare. Un al doilea model confruntă fiecare afirmație din răspuns cu extrasul citat (susține / parțial / nu susține). Îl calibrăm pe triple etichetate manual, optimizând să nu rateze afirmațiile nesusținute — mecanismul din spatele marcajului de încredere pe care îl vezi în produs.
- Preflight pe bază de cunoștințe. Înainte de fiecare rulare, un test de sănătate refuză să continue dacă vreun act are prevederi dar zero fragmente indexate — exact clasa de regresie care ne-a lovit o dată și pe care acum o prindem automat.
Legislație primară RO (~14 acte: coduri + legi) + jurisprudență ÎCCJ/CCR, plus extensia de drept UE (GDPR, eIDAS, avertizori). Măsurat pe setul auriu fix, pe calea de recuperare din producție (retrieveForAnswer).
Transparența e o funcție, nu o pagină.
Aceleași mecanisme pe care le măsurăm aici — citare la articol, status în vigoare/abrogat, verificare automată, refuz onest — rulează la fiecare răspuns. Vezi cum tratăm datele și modelele.