Sachez ce que contiennent vos données d'entraînement
Un rapport chiffré sur tout jeu de données de texte ou de code : doublons, intégrité linguistique, données personnelles, conformité des licences, validité syntaxique et recoupement avec les jeux d'évaluation. Avant et après curation, dans un seul document.
Le texte et le code ont chacun leurs contrôles
On ne juge pas du code comme de la prose. Dans le code, ce qui compte, c'est un fichier source défectueux, une clé exposée ou un en-tête copyleft. Dans le texte, c'est une étiquette de langue erronée ou un scan endommagé.
Jeux de données de texte
- Inventaire : documents, tokens, distribution des longueurs, répartition par langue et par domaine
- Doublons exacts et quasi-doublons
- Identification de la langue, comparée à l'étiquette fournie
- Métadonnées de licence, comparées à votre politique de licences
- Qualité structurelle : répétitions, erreurs d'encodage, fragments
- Données personnelles détectées : e-mail, téléphone, IBAN, carte de paiement, adresse IP
- Recoupement avec les jeux d'évaluation
Jeux de données de code
- Inventaire par langage de programmation : fichiers, tokens, lignes
- Fichiers en doublon exact ou quasi-doublon
- Validité syntaxique : part des fichiers analysés sans erreur
- En-têtes de licence, dont la part de copyleft
- Identifiants exposés : clés, jetons, mots de passe codés en dur
- Fichiers générés, minifiés ou repris de code tiers
- Recoupement avec les jeux d'évaluation de code
Un seul chiffre, avec le détail du calcul
Chaque contrôle convertit un taux de défauts mesuré en un score de 0 à 100, par rapport à une tolérance déclarée. L'indice est la moyenne pondérée, exprimée en classes de A à E, pour les données avant et après curation.
Les tolérances et les pondérations figurent dans chaque rapport. L'indice résume les mesures. Il ne garantit pas les performances d'un modèle entraîné sur ces données.

Une page d'un rapport portant sur des données de test synthétiques, avec des défauts introduits volontairement. Les chiffres ne proviennent pas d'un jeu de données client.
Cinq règles que le rapport respecte
Uniquement des chiffres
Le rapport contient des décomptes, des taux et des distributions. Il ne reprend aucun texte de vos données, et les petits groupes sont fusionnés pour qu'aucun chiffre ne désigne une poignée de documents.
Traitement local
La mesure s'exécute sur notre machine ou dans votre environnement. Aucun contenu du jeu de données n'est envoyé à un service externe.
Reproductible
La version de l'outil, les paramètres, le tokenizer et une empreinte des données sont consignés. La même entrée donne les mêmes chiffres.
Détecté, et non absent
Les analyses indiquent ce qui a été détecté. Un zéro n'est pas présenté comme la preuve qu'il n'y a rien, et chaque section précise ses limites connues.
Vos jeux d'évaluation privés
Votre propre benchmark peut être contrôlé pour détecter une fuite. Il est converti en un index haché qui ne permet pas de reconstituer le texte.
Quatre moments pour mesurer
Avant d'acheter des données
Comparez l'échantillon d'un fournisseur à ce qu'annonce son offre.
Avant l'entraînement
Repérez les doublons, les données personnelles et les fuites de benchmark tant qu'ils restent peu coûteux à corriger.
Après la curation
Montrez, chiffres à l'appui, ce que le nettoyage a changé, à votre équipe ou à un auditeur.
Quand vous vendez des données
Envoyez à vos acheteurs un rapport de qualité indépendant, en complément de votre fiche du jeu de données.
Ce que vous recevez
Envoyer ou héberger
Vous envoyez le jeu de données sous NDA, ou nous le mesurons dans votre environnement.
Nous mesurons
CurateLM réalise la mesure. L'outil lui-même n'est pas remis.
Vous recevez le rapport
Un rapport PDF, une version HTML et un fichier JSON contenant tous les chiffres.
Questions sur le benchmark
Le rapport contient-il une partie de nos données ?
Non. Il ne contient que des chiffres agrégés. Les adresses e-mail, clés et valeurs similaires détectées sont comptées et jamais conservées.
Pouvez-vous confronter nos données à notre propre benchmark privé ?
Oui. Votre jeu d'évaluation est converti en index haché sur la machine qui exécute la mesure. L'index ne contient aucun texte du benchmark.
Un bon indice garantit-il la qualité du modèle ?
Non. Le rapport indique ce qui a été mesuré et comment. Il ne constitue ni un conseil juridique, ni un avis sur les licences, ni une prévision des performances d'un modèle.
Pour quels langages de programmation la syntaxe peut-elle être vérifiée ?
Plus de vingt, dont Python, C, C++, Java, JavaScript, TypeScript, Rust, Go, SQL, COBOL et Fortran. Les langages sans analyseur syntaxique sont indiqués comme non vérifiés, et non comme en échec.
Peut-on obtenir le benchmark sans acheter de données ni de curation ?
Oui. Le benchmark est un service à part entière. Il est aussi inclus dans les projets de curation de données, sous la forme du rapport avant et après.
Faites mesurer un jeu de données
Indiquez-nous s'il s'agit de texte, de code ou des deux, et sa taille approximative.
Demander un benchmark