Comprendre la donnée synthétique depuis zéro.
Ce qu'est la donnée synthétique, comment on la fabrique, et comment on la valide — en clair. Tout le projet tient en trois verbes : générer, valider, apprendre.
L'idée en un paragraphe
Certaines données précieuses ne peuvent pas être partagées — elles contiennent des informations personnelles ou bancaires. La donnée synthétique est inventée par un programme pour ressembler statistiquement à la vraie sans décrire personne de réel. Pour la fraude, on va plus loin : aucune donnée réelle n'est utilisée. Un générateur de règles produit des données de départ plausibles et déjà synthétiques, qu'un modèle apprend ensuite à imiter. Rien de réel n'entre jamais dans le pipeline.
Vocabulaire essentiel
| Terme | En clair |
|---|---|
dataset | Un tableau. Chaque ligne = un exemple (une transaction) ; chaque colonne = une caractéristique. |
tabulaire | En forme de tableau (lignes × colonnes), comme un tableur. |
feature | Une colonne utilisée pour prédire — ex. montant, pays, heure. |
label / cible | La colonne à prédire. Ici : is_fraud. |
marginale | La distribution d'une seule colonne prise isolément. |
corrélation | Un lien statistique entre deux colonnes. |
copule | Le « moteur » qui imite un tableau en séparant deux choses : la forme de chaque colonne (marginales) et la façon dont les colonnes varient ensemble (corrélations). |
déséquilibre de classes | Quand une catégorie est rare — la fraude ≈ 0,5 % des transactions. |
typologie | Une famille de fraude avec sa signature (card-testing, prise de compte…), étiquetée dans fraud_type. |
non-stationnarité | Les motifs dérivent — la fraude d'hier n'est pas celle de demain. Aucun jeu figé n'est jamais « à jour ». |
1 · Générer
On produit des transactions réalistes à deux niveaux. Entre classes, la fraude décale les marginales : montants plus élevés ou atypiques, heures nocturnes, carte non présentée, géographies étrangères, rafales. À l'intérieur d'une classe, les colonnes sont corrélées, pas indépendantes — un gros montant va avec certains marchands ; un achat en personne se fait près de chez soi. Ces liens inter-features sont ce qu'un modèle de fraude apprend réellement.
Une copule gaussienne apprend cette structure et la reproduit. On ajuste une copule par typologie et on les recombine à un taux cible exact, pour ne pas noyer le signal minoritaire de fraude et pour que chaque typologie garde sa signature.
2 · Valider
Un dataset synthétique ne vaut que s'il passe trois tests. On les automatise en barrières de qualité — un échec et rien n'est publié.
- Fidélité — le synthétique colle-t-il aux statistiques de départ (marginales et corrélations) ? Agrégé en
quality_score(≈0,85 ; seuil ≥0,72). - Confidentialité — évite-t-il de recopier les lignes de départ ?
privacy_score= 1,00 (aucune copie). - Utilité — un modèle peut-il réellement apprendre dessus ? Le test le plus honnête.
3 · Apprendre
C'est le point de vue de l'acheteur : entraîner un détecteur, puis le mesurer. Comme la fraude est rare, le « pourcentage de bonnes réponses » est inutile (toujours dire « pas de fraude » donne 99,5 %). On utilise plutôt l'AUC ROC et la PR-AUC — indépendantes du seuil, robustes au déséquilibre.
Chaque dataset livre un baseline reproductible (LogReg + gradient boosting). Le point clé : une AUC globale élevée, mais une AUC nettement plus basse sur les typologies dures — la preuve mesurable que le dataset contient de vrais cas frontières.
La datasheet, anatomie de la confiance
Chaque dataset livre le même gabarit fixe de datasheet (d'après la discipline « datasheets for datasets »). La cohérence est le but — un acheteur reconnaît un dataset Plexoria à sa datasheet.
| Rubrique | Ce qu'elle contient |
|---|---|
| Scope — à lire d'abord | Ce que le dataset est / n'est pas, avec l'avertissement de portée. |
| Méthode | Seed, synthèse par copule et par typologie, taux/mix par construction. |
| Provenance | Générateur RNG, aucune donnée réelle, pins de reproductibilité. |
| Dictionnaire des données | Colonne par colonne, dont is_fraud et fraud_type. |
| Typologies de fraude | Type (visible / dur), part, effectif, description. |
| Réalisme & non-stationnarité | Empreintes statistiques, domaine adversarial, régénérable. |
| Scores qualité & confidentialité | Les chiffres QC mesurés. |
| Benchmark baseline | AUC globale + par typologie. |
| Intégrité | Manifest SHA-256 + signature Ed25519, et comment vérifier. |