Jeux de données

Données d'entraînement pour LLM sous licence

Des corpus de texte, de code et de données biomédicales collectés selon une politique de licences unique et stricte, expurgés des données personnelles, dédupliqués et notés. Livrés au format JSONL ou Parquet avec une fiche du jeu de données.

01 · Texte multilingue

Plus de 5,5 milliards de tokens dans plus de 150 langues

Un corpus de texte conçu pour les langues et les sujets que les collectes web généralistes couvrent mal. Il privilégie les langues rares et peu dotées, ainsi que les contenus institutionnels et spécialisés : sciences, droit, administration publique, médecine, finance et ingénierie.

Tokens
Plus de 5,5 milliards, en croissance quotidienne
Langues
Plus de 150, dont de nombreuses langues peu dotées
Niches thématiques
140
Licences
Domaine public, CC0, CC BY
Formats
JSONL, Apache Parquet
02 · Code source

Du code à licence vérifiée, langages historiques compris

Banques, assureurs et organismes publics fonctionnent encore avec COBOL, Fortran, JCL et PL/I. Les modèles qui modernisent ces systèmes ont besoin de données d'entraînement dans ces langages. Ce corpus associe du code d'entreprise historique à des langages modernes. Seules les licences permissives sont acceptées, et la licence est vérifiée pour chaque dépôt.

Tokens
Plus de 2 milliards, en croissance quotidienne
Langages historiques
COBOL, Fortran, JCL, PL/I
Langages modernes
Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
Licences
MIT, Apache-2.0, BSD, ISC, Unlicense. Ni GPL ni AGPL
Formats
JSONL, Apache Parquet
03 · Biomédical et sciences de la vie

Plus de 700 millions de tokens de texte biomédical, et des données structurées

Du texte biomédical couvrant 31 niches et 33 langues, de la pharmacologie et la neurologie à la médecine tropicale et la biochimie. Des données structurées sont proposées en complément pour la recherche de médicaments et les travaux cliniques. Ce corpus ne contient aucune donnée individuelle de patients.

Non proposé : les données individuelles de patients pour les jumeaux numériques. Les déclarations d'effets indésirables sont des dossiers réglementaires désidentifiés, et non une cohorte de patients. Elles ne doivent pas être analysées comme telle.

Tokens
Plus de 700 millions, en croissance
Documents
Plus de 2 800
Niches thématiques
31, dont médecine, pharmacologie, neurologie, médecine tropicale, biochimie, immunologie, épidémiologie
Langues
33
Données structurées
Étiquetage réglementaire des médicaments, déclarations d'effets indésirables désidentifiées, enregistrements de registres d'essais cliniques, affinités de liaison mesurées, annotations de gènes et de voies biologiques
Cas d'usage
Identification de cibles, mécanismes d'action des médicaments, optimisation de molécules, prédiction de biomarqueurs, sélection de patients
Couverture

Langues et sujets du corpus de texte

Des données d'entraînement pour des langues et des sujets difficiles à trouver ailleurs. Les volumes varient fortement d'une langue à l'autre : demandez la fiche du jeu de données pour savoir ce qui est disponible dans celles qui vous intéressent.

Langues couvertes (sélection)

Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu

Sujets couverts (sélection)

Sciences et recherche · Droit, tribunaux et législation · Documents gouvernementaux et parlementaires · Médecine · Médecine traditionnelle, ayurvéda et médecine islamique (Tibb Nabawi) · Savoirs autochtones · Banque, finance et fiscalité · Ingénierie et aéronautique · Agriculture · Architecture · Astronomie et chimie · Linguistique · Théologie et sciences humaines · Éducation · Systèmes informatiques historiques

Ce que contient chaque enregistrement

Chaque enregistrement est livré avec sa licence, sa langue, son domaine, son score de qualité, son nombre de tokens et une empreinte du contenu. Vous pouvez ainsi filtrer, auditer et reproduire votre sélection.

{ "text": "…", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "token_count": 1842, "text_hash": "9f2c…e41a" }
Politique de licences

Une seule règle pour tout ce que nous collectons

Un enregistrement n'est admis que si sa propre licence autorise l'usage commercial et la redistribution. Un enregistrement sans licence est refusé : nous ne présumons pas qu'il est libre.

Accepté

  • Domaine public et CC0
  • CC BY, avec l'attribution livrée en même temps que les données
  • Code : MIT, Apache-2.0, BSD, ISC, Unlicense

Refusé

  • Licences non commerciales (NC) et sans modification (ND)
  • Licences à partage dans les mêmes conditions (SA)
  • GPL, AGPL et autres licences de code copyleft
  • Tout contenu dont la licence est absente ou ambiguë
Comment fonctionne la licence

Du premier aperçu à la livraison

Fiche du jeu de données

Vous recevez la fiche du jeu de données avec les volumes, les langues, les niches et la répartition des licences.

Échantillon

Un échantillon au format de livraison montre le schéma et la qualité.

NDA et contrat

Nous signons un NDA, puis nous convenons du périmètre, des conditions de licence et du prix.

Livraison

Transfert chiffré de fichiers JSONL ou Parquet, accompagnés de leur documentation.

Les questions que posent les acheteurs

Pouvons-nous voir un échantillon avant de signer quoi que ce soit ?

Oui. La fiche du jeu de données est disponible sur demande, suivie d'un court échantillon au format de livraison. Les lots d'évaluation plus volumineux sont partagés sous NDA.

Indiquez-vous d'où proviennent les données ?

Non. Nos sources sont confidentielles. Chaque enregistrement indique sa licence, et l'attribution est fournie chaque fois qu'une licence l'exige. CurateLM garantit la conformité des licences dans le contrat.

Les données personnelles sont-elles supprimées ?

Le texte est expurgé par détection automatique des noms, adresses e-mail, numéros de téléphone et identifiants similaires. La détection automatique ne trouve pas tout. Nous communiquons donc les taux détectés et n'affirmons pas qu'il n'en reste aucune.

Pouvons-nous prendre sous licence une seule langue ou une seule niche ?

Oui. Chaque enregistrement est étiqueté par langue et par niche. Un extrait peut donc être constitué par langue, sujet, catégorie de licence ou score de qualité.

Fournissez-vous un rapport de qualité avec les données ?

Oui. Un rapport de benchmark peut être livré avec le jeu de données. Il mesure les doublons, les données personnelles détectées, la répartition des licences et le recoupement avec les jeux d'évaluation.

Demandez la fiche du jeu de données

Indiquez-nous les langues, les sujets ou les langages de programmation dont vous avez besoin.

Demander la fiche du jeu de données