Des données d'entraînement IA sous licence.
Et le pipeline pour nettoyer les vôtres.
CurateLM fournit des corpus de texte et de code à licence vérifiée pour l'entraînement de LLM. Nous appliquons aussi ce même pipeline de curation à vos propres données : suppression des données personnelles, déduplication, détection de la langue et score de qualité, avec un traitement en Allemagne et dans l'UE.
Les corpus s'enrichissent chaque jour. Les chiffres exacts du moment figurent dans la fiche du jeu de données.
Trois façons de travailler avec CurateLM
Des corpus prêts à l'emploi, sous licence
Du texte multilingue dans plus de 150 langues, du code source, y compris dans les langages historiques des grandes organisations, et des données biomédicales. Chaque enregistrement indique sa licence, sa langue et son score de qualité.
Voir les jeux de donnéesConfier la curation de vos propres données
Nous transformons vos documents, scans, fichiers audio et vidéo en données d'entraînement structurées, sans données personnelles et dans le cadre d'un contrat de sous-traitance. Dans l'UE ou sur site.
Fonctionnement du serviceFaire mesurer un jeu de données
Un rapport chiffré sur tout jeu de données de texte ou de code : doublons, données personnelles, conformité des licences, validité syntaxique et recoupement avec les jeux d'évaluation. Avant et après curation.
Contenu du rapportDes corpus disponibles sous licence dès aujourd'hui
Trois corpus, constitués selon une seule politique de licences : domaine public, CC0, CC BY et licences de code permissives uniquement. Les contenus sous licence non commerciale, sans modification, à partage dans les mêmes conditions ou copyleft sont écartés dès la collecte.
Texte multilingue
- Plus de 5,5 milliards de tokens, en croissance quotidienne
- Plus de 150 langues réparties sur 140 niches thématiques
- Priorité aux langues rares et peu dotées
- Sciences, droit, administration publique, médecine, finance, ingénierie
Code source
- Plus de 2 milliards de tokens, en croissance
- Langages historiques : COBOL, Fortran, JCL, PL/I
- Langages modernes : Rust, Go, Java, C, C++, TypeScript et d'autres
- Licences permissives uniquement, vérifiées pour chaque dépôt
Biomédical et sciences de la vie
- Plus de 700 millions de tokens dans 31 niches
- Pharmacologie, neurologie, biochimie, immunologie
- Données structurées : étiquetage des médicaments, essais, affinités de liaison
- Aucune donnée individuelle de patients
Un rapport de qualité pour tout jeu de données
La plupart des jeux de données se vendent au nombre de tokens. Nous mesurons ce qu'ils contiennent : la part de doublons, les données personnelles détectées, la conformité des licences à votre politique, la validité syntaxique du code et la présence de benchmarks d'évaluation qui auraient fuité dans les données. Le rapport ne contient que des chiffres, jamais votre texte.
- Texte et code dans un même rapport
- Avant et après curation, côte à côte
- Contrôles par rapport aux jeux d'évaluation publics et à vos propres jeux privés
- Exécution en local : aucune donnée ne quitte la machine
Du brut au prêt à l'emploi en quatre étapes
Vous nous envoyez vos données brutes. Nous vous livrons, dans vos délais, des jeux de données d'entraînement prêts pour la production et entièrement documentés.
Envoyer les données brutes
PDF, HTML, CSV, transcriptions audio, collectes web : tous les formats, toutes les langues, tous les volumes.
Nous nettoyons et structurons
Déduplication, normalisation, conception du schéma, suppression des données personnelles, filtrage par la qualité et annotation.
Conversion de format
Sortie en JSONL, en Parquet ou selon un schéma sur mesure, optimisée et validée pour votre pipeline.
Livraison
Chaque jeu de données est livré avec une fiche du jeu de données, un rapport de statistiques de qualité et un fichier d'échantillon de validation.
Vos données ne sortent jamais des murs
Chaque jeu de données est traité sur site, en Allemagne et dans l'UE. Aucun stockage cloud, à aucun moment. Un contrat de sous-traitance au sens de l'art. 28 du RGPD pour chaque projet. Aucun transfert de données vers les États-Unis ou d'autres pays tiers.
Chiffrement AES-256
Les données sont chiffrées au repos en AES-256-GCM. Les clés sont définies par session et ne sont jamais écrites sur disque.
L'UE d'abord · Conforme à l'art. 28 du RGPD
Entreprise immatriculée à Berlin. Un contrat de sous-traitance au sens de l'art. 28 du RGPD et un NDA sont proposés pour chaque projet.
Formats et services pour votre pipeline
Création de JSONL
Formats instruction-réponse, conversation, paires DPO et complétion, adaptés à l'architecture de votre modèle.
Conversion Parquet
Des fichiers Parquet en colonnes, au schéma optimisé, pour le pré-entraînement à grande échelle via Hugging Face, S3 ou BigQuery.
Nettoyage des données
Déduplication, détection de la langue, normalisation, suppression des données personnelles, filtrage des contenus toxiques et score de qualité.
Découpage RAG
Segmentation des documents, stratégie de découpage et enrichissement des métadonnées pour le pipeline de votre base vectorielle.
Dites-nous de quelles données vous avez besoin, ou quelles données vous avez
Nous répondons sous un jour ouvré avec une fiche du jeu de données, une proposition d'échantillon ou un périmètre pour votre projet.