Datensätze

Lizenzierte Trainingsdaten für LLMs

Text-, Code- und Biomedizin-Korpora, erfasst nach einer strengen Lizenzrichtlinie, von personenbezogenen Daten bereinigt, dedupliziert und bewertet. Geliefert als JSONL oder Parquet mit Dataset Card.

01 · Mehrsprachiger Text

Über 5,5 Milliarden Tokens in über 150 Sprachen

Ein Textkorpus für Sprachen und Themen, die allgemeine Web-Crawls nur schlecht abdecken. Der Schwerpunkt liegt auf seltenen und ressourcenarmen Sprachen sowie auf institutionellem und fachlichem Material: Wissenschaft, Recht, Verwaltung, Medizin, Finanzen und Technik.

Tokens
Über 5,5 Milliarden, täglich wachsend
Sprachen
Über 150, darunter viele ressourcenarme Sprachen
Fachgebiete
140
Lizenzen
Gemeinfrei, CC0, CC BY
Formate
JSONL, Apache Parquet
02 · Quellcode

Lizenzgeprüfter Code, auch in Legacy-Sprachen

Banken, Versicherungen und Behörden arbeiten weiterhin mit COBOL, Fortran, JCL und PL/I. Modelle, die solche Systeme modernisieren sollen, brauchen Trainingsdaten in genau diesen Sprachen. Dieses Korpus verbindet Legacy-Code aus Unternehmen mit modernen Sprachen. Akzeptiert werden nur permissive Lizenzen, und die Lizenz wird für jedes Repository geprüft.

Tokens
Über 2 Milliarden, täglich wachsend
Legacy-Sprachen
COBOL, Fortran, JCL, PL/I
Moderne Sprachen
Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
Lizenzen
MIT, Apache-2.0, BSD, ISC, Unlicense. Kein GPL oder AGPL
Formate
JSONL, Apache Parquet
03 · Biomedizin und Life Sciences

Über 700 Millionen Tokens biomedizinischer Text, dazu strukturierte Daten

Biomedizinischer Text aus 31 Fachgebieten und 33 Sprachen, von Pharmakologie und Neurologie bis Tropenmedizin und Biochemie. Ergänzend stehen strukturierte Daten für Wirkstoffforschung und klinische Fragestellungen bereit. Dieses Korpus enthält keine Daten auf Patientenebene.

Nicht im Angebot: Daten auf Patientenebene für digitale Zwillinge. Meldungen unerwünschter Ereignisse sind de-identifizierte behördliche Meldungen, keine Patientenkohorte, und dürfen nicht als solche ausgewertet werden.

Tokens
Über 700 Millionen, wachsend
Dokumente
Über 2.800
Fachgebiete
31, darunter Medizin, Pharmakologie, Neurologie, Tropenmedizin, Biochemie, Immunologie, Epidemiologie
Sprachen
33
Strukturierte Daten
Behördliche Arzneimittelkennzeichnung, de-identifizierte Meldungen unerwünschter Ereignisse, Einträge aus Studienregistern, gemessene Bindungsaffinitäten, Gen- und Signalweg-Annotationen
Anwendungsfälle
Target-Identifikation, Wirkmechanismen, Molekül-Optimierung, Biomarker-Vorhersage, Patientenauswahl
Abdeckung

Sprachen und Fachgebiete im Textkorpus

Trainingsdaten für Sprachen und Themen, die anderswo schwer zu finden sind. Der Umfang unterscheidet sich je nach Sprache stark. Die Dataset Card zeigt, was für Ihre Sprachen verfügbar ist.

Sprachen (Auswahl)

Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu

Fachgebiete (Auswahl)

Wissenschaft und Forschung · Recht, Gerichte und Gesetzgebung · Verwaltung und Parlamentsprotokolle · Medizin · Traditionelle Medizin, Ayurveda und islamische Medizin (Tibb Nabawi) · Indigenes Wissen · Banken, Finanzen und Steuern · Ingenieurwesen und Luftfahrt · Landwirtschaft · Architektur · Astronomie und Chemie · Sprachwissenschaft · Theologie und Geisteswissenschaften · Bildung · Legacy-IT-Systeme

Was jeder Datensatz mitbringt

Jeder Datensatz wird mit Lizenz, Sprache, Fachgebiet, Qualitätswert, Tokenzahl und Inhalts-Hash geliefert. So können Sie filtern, prüfen und Ihre Auswahl reproduzieren.

{ "text": "…", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "token_count": 1842, "text_hash": "9f2c…e41a" }
Lizenzrichtlinie

Eine Regel für alles, was wir erfassen

Ein Datensatz wird nur aufgenommen, wenn seine eigene Lizenz kommerzielle Nutzung und Weitergabe erlaubt. Ein Datensatz ohne Lizenz wird abgelehnt und nicht als frei angenommen.

Akzeptiert

  • Gemeinfrei und CC0
  • CC BY, die Namensnennung wird mit den Daten geliefert
  • Code: MIT, Apache-2.0, BSD, ISC, Unlicense

Abgelehnt

  • Lizenzen mit NC (nicht kommerziell) und ND (keine Bearbeitung)
  • Lizenzen mit SA (Weitergabe unter gleichen Bedingungen)
  • GPL, AGPL und andere Copyleft-Lizenzen für Code
  • Alles mit fehlender oder unklarer Lizenz
So läuft die Lizenzierung

Vom ersten Blick bis zur Lieferung

Dataset Card

Sie erhalten die Dataset Card mit Umfang, Sprachen, Fachgebieten und Lizenzverteilung.

Stichprobe

Eine Stichprobe im Lieferformat zeigt Schema und Qualität.

NDA und Vertrag

Wir unterzeichnen ein NDA und vereinbaren anschließend Umfang, Lizenzbedingungen und Preis.

Lieferung

Verschlüsselte Übertragung der JSONL- oder Parquet-Dateien mit Dokumentation.

Häufige Fragen von Käufern

Können wir eine Stichprobe sehen, bevor wir etwas unterschreiben?

Ja. Die Dataset Card erhalten Sie auf Anfrage, danach eine kurze Stichprobe im Lieferformat. Größere Evaluationspakete teilen wir unter NDA.

Legen Sie offen, woher die Daten stammen?

Nein. Die Bezugsquellen sind vertraulich. Jeder Datensatz trägt seine Lizenz, und die Namensnennung wird überall dort mitgeliefert, wo eine Lizenz sie verlangt. CurateLM sichert die Lizenzkonformität vertraglich zu.

Werden personenbezogene Daten entfernt?

Texte werden mit automatischer Erkennung von Namen, E-Mail-Adressen, Telefonnummern und ähnlichen Kennungen bereinigt. Automatische Erkennung findet nicht alles. Deshalb berichten wir Erkennungsraten und behaupten nicht, dass nichts mehr enthalten ist.

Können wir eine einzelne Sprache oder ein Fachgebiet lizenzieren?

Ja. Jeder Datensatz ist mit Sprache und Fachgebiet gekennzeichnet. Ein Ausschnitt lässt sich nach Sprache, Thema, Lizenzklasse oder Qualitätswert bilden.

Gibt es einen Qualitätsbericht zu den Daten?

Ja. Zum Datensatz kann ein Benchmark-Bericht geliefert werden. Er misst Duplikate, erkannte personenbezogene Daten, Lizenzverteilung und Überschneidung mit Evaluationsdatensätzen.

Fordern Sie die Dataset Card an

Sagen Sie uns, welche Sprachen, Themen oder Programmiersprachen Sie brauchen.

Dataset Card anfordern