Comprendre l'évaluation RAG.
Ce qu'est un RAG, pourquoi il échoue, et comment un bon jeu d'évaluation attrape ces échecs — en clair. Les mêmes trois verbes que le reste de notre travail : générer, valider, noter.
Le RAG en un paragraphe
Une app RAG (Retrieval-Augmented Generation) répond à une question en récupérant d'abord les passages pertinents d'un corpus de documents, puis en demandant à un LLM de générer une réponse ancrée dedans. C'est ainsi que les chatbots répondent sur des docs privés. La promesse : des réponses adossées à vos sources. Le risque : quand la récupération rate ou que le corpus n'a pas la réponse, un RAG faible en invente une.
Vocabulaire essentiel
| Terme | En clair |
|---|---|
corpus | L'ensemble des documents sur lesquels le RAG répond. |
récupération | Trouver les passages les plus pertinents pour une question. |
ancrage | Une réponse est ancrée quand elle est réellement supportée par un passage récupéré. |
hallucination | Une réponse assurée qui n'est pas supportée par le corpus — l'échec qui compte le plus. |
item d'éval | Un test : une question + sa réponse-or + sa source-or + une étiquette de difficulté. |
réponse-or | La bonne réponse, servant à noter celle du RAG. |
typologie | Une famille de test avec sa difficulté (ex. no_answer, distractor). |
abstention | Le RAG qui dit correctement « je ne sais pas » quand le corpus ne peut pas répondre. |
1 · Générer
À partir du corpus, on construit des items étiquetés par typologie. Les faciles (answerable) ont leur réponse dans un seul passage. Les durs sont le point :
no_answer— une question plausible que le corpus ne peut pas résoudre. Un bon RAG doit refuser ; un faible hallucine.distractor— un passage qui semble pertinent mais est faux concurrence le bon.multi_hop— la réponse nécessite deux passages combinés.
Les questions peuvent être écrites par un générateur à règles (déterministe, sans LLM) ou par un LLM (formulation naturelle) — même forme étiquetée dans les deux cas.
2 · Valider
Un jeu d'éval ne vaut d'être exécuté que si ses réponses sont justes — une réponse-or fausse est pire que pas de test du tout. Donc un gate d'ancrage jette tout item dont la réponse-or n'est pas réellement supportée par sa source-or, et supprime les doublons. La qualité du test, c'est le moat.
3 · Noter
On envoie chaque question à votre RAG et on note la réponse sur trois choses :
- Récupération — a-t-il ramené la source-or ?
- Justesse — la réponse correspond-elle à la réponse-or ?
- Refus — sur
no_answer, s'est-il correctement abstenu au lieu d'inventer ?
Le résultat est un scorecard par typologie. Le point clé est l'écart : un RAG peut réussir answerable parfaitement et rater tous les pièges no_answer.
Dans cet exemple, le RAG a répondu à 100% des questions qu'il aurait dû refuser. Ce seul chiffre — le taux d'hallucination sur les questions hors-scope — est souvent la chose la plus importante à savoir avant de mettre un RAG en production, et la plus dure à obtenir sans un jeu d'éval sur mesure.
La confiance, comme nos datasets
Le jeu d'éval et son scorecard sont livrés en bundle signé (manifest SHA-256 + Ed25519), reproductible depuis une graine fixe. Aucune donnée utilisateur réelle n'est nécessaire pour le construire, et il est généré avec un modèle Apache-2.0 — la sortie est à vous, usage commercial inclus. Voir comment marche la vérification →