évaluation RAG & LLM
Découvrez où votre RAG craque.
Votre RAG fait une belle démo — puis répond avec assurance à une question que vos documents ne permettent pas. Plexoria construit des jeux d'évaluation à cas durs à partir de votre corpus et note votre RAG sur les modes d'échec qui comptent.
Réussir une démo n'est pas réussir un test.
Un RAG qui gère vos questions faciles peut quand même halluciner sur celles que votre corpus ne couvre pas, s'accrocher à un passage plausible mais faux, ou rater un fait réparti sur deux documents. Les benchmarks publics génériques ne couvrent pas votre corpus — donc ils ne peuvent pas attraper vos échecs.
Hallucination
L'échec le plus coûteux : répondre à une question que le corpus ne supporte pas au lieu de dire « je ne sais pas ».
Distracteurs
La récupération attrape un passage similaire mais faux et répond à partir de lui.
Multi-hop
La réponse nécessite deux passages combinés ; le RAG s'arrête au premier.
Un jeu d'éval étiqueté — et le scorecard de votre RAG.
Chaque item est une question avec sa réponse-or et son document source-or, taggé d'une typologie de difficulté. On pointe le jeu sur l'endpoint de votre RAG et on note la justesse de la réponse, la récupération, et — le point-clé — s'il refuse correctement l'insoluble.
| Typologie | Type | Ce qu'elle teste |
|---|---|---|
answerable | baseline | La réponse est dans un passage — le RAG la trouve-t-il ? |
multi_hop | visible | Nécessite deux passages combinés. |
distractor | dur | Un passage faux mais ressemblant concurrence le bon. |
no_answer | dur | Le corpus ne peut pas répondre — le RAG doit refuser, pas inventer. |
Scorecard d'exemple d'un RAG baseline naïf. L'écart entre answerable et les typologies dures est le point : c'est exactement ce qu'une démo cache et qu'une fiche technique ne peut pas montrer.
Générer · valider · noter.
La même rigueur que nos datasets, appliquée au RAG. Reproductible, et signé de bout en bout.
01 Générer
À partir de votre corpus, on génère des items étiquetés par typologie — dont les cas durs que la plupart des jeux ignorent.
02 Valider
Un gate d'ancrage jette tout item dont la réponse-or n'est pas supportée par sa source. Une réponse-or fausse est pire qu'inutile.
03 Noter
On passe le jeu contre l'endpoint de votre RAG et on livre un scorecard par typologie : récupération, justesse, refus.
04 Signer
Jeu d'éval + scorecard livrés en bundle signé (manifest SHA-256 + Ed25519) — reproductible et vérifiable.
Sur mesure de votre corpus — vous le possédez.
Un jeu d'éval n'est utile qu'ancré dans vos documents : on le génère pour votre corpus et vous possédez les deux. Pas de fichier générique qui ne colle à personne. Compatible gouvernance : généré avec un modèle Apache-2.0 (droits commerciaux sur la sortie), aucune donnée utilisateur réelle requise, et chaque bundle est signé. Adapté aux environnements régulés et souverains.