La confiance est le produit.

La donnée synthétique ne vaut d'être achetée que lorsque la vraie est hors de portée — et ne vaut d'être crue que lorsqu'on peut la vérifier. Plexoria est bâti autour de cette seconde moitié.

Pourquoi le synthétique, et pourquoi nous

Pour des domaines comme la fraude, la donnée réelle est juridiquement verrouillée — impossible à partager ou revendre. Un substitut synthétique réaliste, étiqueté et légalement partageable est réellement rare. Mais le marché est aussi plein de générateurs gratuits et non documentés. Donc on ne se bat pas sur le fait d'être bon marché ou volumineux. On se bat sur le fait d'être fiable et profond.

Quatre engagements, sur chaque dataset

Interprétable, pas anonymisé. Des colonnes nommées et parlantes plutôt que des composantes PCA opaques. Vous pouvez faire du feature engineering et raisonner sur la donnée.

Cas durs étiquetés. On ne livre pas un bloc indifférencié. Les schémas d'attaque sont étiquetés en typologies — dont des cas couverts qui collent volontairement au profil légitime, pour stresser un détecteur sur les cas qu'il rate vraiment.

Prouvé, pas affirmé. Un benchmark baseline reproductible est livré dans le bundle. La qualité est un chiffre que vous ré-exécutez, pas un argument marketing.

Provenance signée. Un manifest SHA-256 et une signature Ed25519 accompagnent chaque bundle, et l'empreinte de clé est publiée hors-bande. Vous pouvez prouver qu'un dataset est intact et vient bien de nous. Voir comment →

Honnête par construction

Aucune donnée réelle n'entre jamais dans notre pipeline — le générateur est à base de règles et seedé, donc il n'y a aucune donnée personnelle à fuiter et rien à re-licencier. Chaque datasheet dit clairement ce qu'un dataset est et n'est pas. La détection de fraude est adversariale et non-stationnaire ; aucun jeu figé — synthétique ou réel — n'est jamais « à jour ». Nos datasets sont un banc d'essai pour développer et stresser des méthodes, pas un substitut aux décisions de production. On préfère sous-promettre et être cru.

Un dataset est généré, pas extrait — donc on peut le régénérer, re-doser la difficulté, ou ajouter de nouvelles typologies à la demande. Un extrait réel figé ne le peut pas. C'est l'avantage de long terme de bien faire ce métier.

Un pipeline, plusieurs datasets

La fraude est la première gamme. La même orchestration, les mêmes barrières de qualité, la même signature et la même gouvernance se reportent sur la suivante — pour que chaque dataset du catalogue atteigne le même niveau et porte la même signature. La cohérence, c'est la marque.