Comprendre l'évaluation RAG.

Ce qu'est un RAG, pourquoi il échoue, et comment un bon jeu d'évaluation attrape ces échecs — en clair. Les mêmes trois verbes que le reste de notre travail : générer, valider, noter.

Le RAG en un paragraphe

Une app RAG (Retrieval-Augmented Generation) répond à une question en récupérant d'abord les passages pertinents d'un corpus de documents, puis en demandant à un LLM de générer une réponse ancrée dedans. C'est ainsi que les chatbots répondent sur des docs privés. La promesse : des réponses adossées à vos sources. Le risque : quand la récupération rate ou que le corpus n'a pas la réponse, un RAG faible en invente une.

Vocabulaire essentiel

TermeEn clair
corpusL'ensemble des documents sur lesquels le RAG répond.
récupérationTrouver les passages les plus pertinents pour une question.
ancrageUne réponse est ancrée quand elle est réellement supportée par un passage récupéré.
hallucinationUne réponse assurée qui n'est pas supportée par le corpus — l'échec qui compte le plus.
item d'évalUn test : une question + sa réponse-or + sa source-or + une étiquette de difficulté.
réponse-orLa bonne réponse, servant à noter celle du RAG.
typologieUne famille de test avec sa difficulté (ex. no_answer, distractor).
abstentionLe RAG qui dit correctement « je ne sais pas » quand le corpus ne peut pas répondre.

1 · Générer

À partir du corpus, on construit des items étiquetés par typologie. Les faciles (answerable) ont leur réponse dans un seul passage. Les durs sont le point :

  • no_answer — une question plausible que le corpus ne peut pas résoudre. Un bon RAG doit refuser ; un faible hallucine.
  • distractor — un passage qui semble pertinent mais est faux concurrence le bon.
  • multi_hop — la réponse nécessite deux passages combinés.

Les questions peuvent être écrites par un générateur à règles (déterministe, sans LLM) ou par un LLM (formulation naturelle) — même forme étiquetée dans les deux cas.

2 · Valider

Un jeu d'éval ne vaut d'être exécuté que si ses réponses sont justes — une réponse-or fausse est pire que pas de test du tout. Donc un gate d'ancrage jette tout item dont la réponse-or n'est pas réellement supportée par sa source-or, et supprime les doublons. La qualité du test, c'est le moat.

3 · Noter

On envoie chaque question à votre RAG et on note la réponse sur trois choses :

  • Récupération — a-t-il ramené la source-or ?
  • Justesse — la réponse correspond-elle à la réponse-or ?
  • Refus — sur no_answer, s'est-il correctement abstenu au lieu d'inventer ?

Le résultat est un scorecard par typologie. Le point clé est l'écart : un RAG peut réussir answerable parfaitement et rater tous les pièges no_answer.

1.00
answerable · pass
0.60
distractor · pass
0.00
no_answer · abstention

Dans cet exemple, le RAG a répondu à 100% des questions qu'il aurait dû refuser. Ce seul chiffre — le taux d'hallucination sur les questions hors-scope — est souvent la chose la plus importante à savoir avant de mettre un RAG en production, et la plus dure à obtenir sans un jeu d'éval sur mesure.

La confiance, comme nos datasets

Le jeu d'éval et son scorecard sont livrés en bundle signé (manifest SHA-256 + Ed25519), reproductible depuis une graine fixe. Aucune donnée utilisateur réelle n'est nécessaire pour le construire, et il est généré avec un modèle Apache-2.0 — la sortie est à vous, usage commercial inclus. Voir comment marche la vérification →