Sur site en Allemagne et dans l'UE · Aucun stockage cloud

Des données d'entraînement IA sous licence.
Et le pipeline pour nettoyer les vôtres.

CurateLM fournit des corpus de texte et de code à licence vérifiée pour l'entraînement de LLM. Nous appliquons aussi ce même pipeline de curation à vos propres données : suppression des données personnelles, déduplication, détection de la langue et score de qualité, avec un traitement en Allemagne et dans l'UE.

5.5B+tokens de texte multilingue dans plus de 150 langues
corpus_sample.jsonl { "text": "Die Studie untersucht, wie …", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "pii_scrubbed": true }
2B+tokens de code à licence vérifiée, de COBOL à Rust
payroll.cbl · COBOL · Apache-2.0 · parses cleanly IDENTIFICATION DIVISION. PROGRAM-ID. PAYCALC. PROCEDURE DIVISION. COMPUTE NET-PAY = GROSS-PAY - TAX-AMT. DISPLAY "NET PAY: " NET-PAY. STOP RUN.
700M+tokens de texte biomédical dans 31 niches
biomedical_sample.jsonl { "text": "The compound inhibits …", "language": "en", "niche": "pharmacology", "license": "CC-BY-4.0", "quality_score": 0.93, "pii_scrubbed": true }
En croissance quotidienne
5.5B+tokens de texte multilingue
150+langues, dont beaucoup sont rares et peu dotées
2B+tokens de code source à licence vérifiée
700M+tokens de texte biomédical

Les corpus s'enrichissent chaque jour. Les chiffres exacts du moment figurent dans la fiche du jeu de données.

Berlin · Données hébergées dans l'UE · Licence vérifiée pour chaque enregistrement · Contrat de sous-traitance au sens de l'art. 28 du RGPD
Ce que nous faisons

Trois façons de travailler avec CurateLM

Jeux de données

Des corpus prêts à l'emploi, sous licence

Du texte multilingue dans plus de 150 langues, du code source, y compris dans les langages historiques des grandes organisations, et des données biomédicales. Chaque enregistrement indique sa licence, sa langue et son score de qualité.

Voir les jeux de données
Curation de données B2B

Confier la curation de vos propres données

Nous transformons vos documents, scans, fichiers audio et vidéo en données d'entraînement structurées, sans données personnelles et dans le cadre d'un contrat de sous-traitance. Dans l'UE ou sur site.

Fonctionnement du service
Benchmark de qualité

Faire mesurer un jeu de données

Un rapport chiffré sur tout jeu de données de texte ou de code : doublons, données personnelles, conformité des licences, validité syntaxique et recoupement avec les jeux d'évaluation. Avant et après curation.

Contenu du rapport
Nos données

Des corpus disponibles sous licence dès aujourd'hui

Trois corpus, constitués selon une seule politique de licences : domaine public, CC0, CC BY et licences de code permissives uniquement. Les contenus sous licence non commerciale, sans modification, à partage dans les mêmes conditions ou copyleft sont écartés dès la collecte.

Texte multilingue

  • Plus de 5,5 milliards de tokens, en croissance quotidienne
  • Plus de 150 langues réparties sur 140 niches thématiques
  • Priorité aux langues rares et peu dotées
  • Sciences, droit, administration publique, médecine, finance, ingénierie

Code source

  • Plus de 2 milliards de tokens, en croissance
  • Langages historiques : COBOL, Fortran, JCL, PL/I
  • Langages modernes : Rust, Go, Java, C, C++, TypeScript et d'autres
  • Licences permissives uniquement, vérifiées pour chaque dépôt

Biomédical et sciences de la vie

  • Plus de 700 millions de tokens dans 31 niches
  • Pharmacologie, neurologie, biochimie, immunologie
  • Données structurées : étiquetage des médicaments, essais, affinités de liaison
  • Aucune donnée individuelle de patients
Tous les jeux de données et la politique de licences
Benchmark

Un rapport de qualité pour tout jeu de données

La plupart des jeux de données se vendent au nombre de tokens. Nous mesurons ce qu'ils contiennent : la part de doublons, les données personnelles détectées, la conformité des licences à votre politique, la validité syntaxique du code et la présence de benchmarks d'évaluation qui auraient fuité dans les données. Le rapport ne contient que des chiffres, jamais votre texte.

  • Texte et code dans un même rapport
  • Avant et après curation, côte à côte
  • Contrôles par rapport aux jeux d'évaluation publics et à vos propres jeux privés
  • Exécution en local : aucune donnée ne quitte la machine
Curation de données

Du brut au prêt à l'emploi en quatre étapes

Vous nous envoyez vos données brutes. Nous vous livrons, dans vos délais, des jeux de données d'entraînement prêts pour la production et entièrement documentés.

01

Envoyer les données brutes

PDF, HTML, CSV, transcriptions audio, collectes web : tous les formats, toutes les langues, tous les volumes.

02

Nous nettoyons et structurons

Déduplication, normalisation, conception du schéma, suppression des données personnelles, filtrage par la qualité et annotation.

03

Conversion de format

Sortie en JSONL, en Parquet ou selon un schéma sur mesure, optimisée et validée pour votre pipeline.

04

Livraison

Chaque jeu de données est livré avec une fiche du jeu de données, un rapport de statistiques de qualité et un fichier d'échantillon de validation.

Fonctionnement du service

Vos données ne sortent jamais des murs

Chaque jeu de données est traité sur site, en Allemagne et dans l'UE. Aucun stockage cloud, à aucun moment. Un contrat de sous-traitance au sens de l'art. 28 du RGPD pour chaque projet. Aucun transfert de données vers les États-Unis ou d'autres pays tiers.

Chiffrement AES-256

Les données sont chiffrées au repos en AES-256-GCM. Les clés sont définies par session et ne sont jamais écrites sur disque.

L'UE d'abord · Conforme à l'art. 28 du RGPD

Entreprise immatriculée à Berlin. Un contrat de sous-traitance au sens de l'art. 28 du RGPD et un NDA sont proposés pour chaque projet.

AES-256-GCM Art. 28 RGPD Données hébergées dans l'UE NDA Standard
Services

Formats et services pour votre pipeline

Création de JSONL

Formats instruction-réponse, conversation, paires DPO et complétion, adaptés à l'architecture de votre modèle.

Conversion Parquet

Des fichiers Parquet en colonnes, au schéma optimisé, pour le pré-entraînement à grande échelle via Hugging Face, S3 ou BigQuery.

Nettoyage des données

Déduplication, détection de la langue, normalisation, suppression des données personnelles, filtrage des contenus toxiques et score de qualité.

Découpage RAG

Segmentation des documents, stratégie de découpage et enrichissement des métadonnées pour le pipeline de votre base vectorielle.

Voir tous les services

Dites-nous de quelles données vous avez besoin, ou quelles données vous avez

Nous répondons sous un jour ouvré avec une fiche du jeu de données, une proposition d'échantillon ou un périmètre pour votre projet.

Demander la fiche du jeu de données Voir les tarifs