Lizenzierte Trainingsdaten für LLMs
Text-, Code- und Biomedizin-Korpora, erfasst nach einer strengen Lizenzrichtlinie, von personenbezogenen Daten bereinigt, dedupliziert und bewertet. Geliefert als JSONL oder Parquet mit Dataset Card.
Über 5,5 Milliarden Tokens in über 150 Sprachen
Ein Textkorpus für Sprachen und Themen, die allgemeine Web-Crawls nur schlecht abdecken. Der Schwerpunkt liegt auf seltenen und ressourcenarmen Sprachen sowie auf institutionellem und fachlichem Material: Wissenschaft, Recht, Verwaltung, Medizin, Finanzen und Technik.
- Tokens
- Über 5,5 Milliarden, täglich wachsend
- Sprachen
- Über 150, darunter viele ressourcenarme Sprachen
- Fachgebiete
- 140
- Lizenzen
- Gemeinfrei, CC0, CC BY
- Formate
- JSONL, Apache Parquet
Lizenzgeprüfter Code, auch in Legacy-Sprachen
Banken, Versicherungen und Behörden arbeiten weiterhin mit COBOL, Fortran, JCL und PL/I. Modelle, die solche Systeme modernisieren sollen, brauchen Trainingsdaten in genau diesen Sprachen. Dieses Korpus verbindet Legacy-Code aus Unternehmen mit modernen Sprachen. Akzeptiert werden nur permissive Lizenzen, und die Lizenz wird für jedes Repository geprüft.
- Tokens
- Über 2 Milliarden, täglich wachsend
- Legacy-Sprachen
- COBOL, Fortran, JCL, PL/I
- Moderne Sprachen
- Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
- Lizenzen
- MIT, Apache-2.0, BSD, ISC, Unlicense. Kein GPL oder AGPL
- Formate
- JSONL, Apache Parquet
Über 700 Millionen Tokens biomedizinischer Text, dazu strukturierte Daten
Biomedizinischer Text aus 31 Fachgebieten und 33 Sprachen, von Pharmakologie und Neurologie bis Tropenmedizin und Biochemie. Ergänzend stehen strukturierte Daten für Wirkstoffforschung und klinische Fragestellungen bereit. Dieses Korpus enthält keine Daten auf Patientenebene.
Nicht im Angebot: Daten auf Patientenebene für digitale Zwillinge. Meldungen unerwünschter Ereignisse sind de-identifizierte behördliche Meldungen, keine Patientenkohorte, und dürfen nicht als solche ausgewertet werden.
- Tokens
- Über 700 Millionen, wachsend
- Dokumente
- Über 2.800
- Fachgebiete
- 31, darunter Medizin, Pharmakologie, Neurologie, Tropenmedizin, Biochemie, Immunologie, Epidemiologie
- Sprachen
- 33
- Strukturierte Daten
- Behördliche Arzneimittelkennzeichnung, de-identifizierte Meldungen unerwünschter Ereignisse, Einträge aus Studienregistern, gemessene Bindungsaffinitäten, Gen- und Signalweg-Annotationen
- Anwendungsfälle
- Target-Identifikation, Wirkmechanismen, Molekül-Optimierung, Biomarker-Vorhersage, Patientenauswahl
Sprachen und Fachgebiete im Textkorpus
Trainingsdaten für Sprachen und Themen, die anderswo schwer zu finden sind. Der Umfang unterscheidet sich je nach Sprache stark. Die Dataset Card zeigt, was für Ihre Sprachen verfügbar ist.
Sprachen (Auswahl)
Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu
Fachgebiete (Auswahl)
Wissenschaft und Forschung · Recht, Gerichte und Gesetzgebung · Verwaltung und Parlamentsprotokolle · Medizin · Traditionelle Medizin, Ayurveda und islamische Medizin (Tibb Nabawi) · Indigenes Wissen · Banken, Finanzen und Steuern · Ingenieurwesen und Luftfahrt · Landwirtschaft · Architektur · Astronomie und Chemie · Sprachwissenschaft · Theologie und Geisteswissenschaften · Bildung · Legacy-IT-Systeme
Was jeder Datensatz mitbringt
Jeder Datensatz wird mit Lizenz, Sprache, Fachgebiet, Qualitätswert, Tokenzahl und Inhalts-Hash geliefert. So können Sie filtern, prüfen und Ihre Auswahl reproduzieren.
Eine Regel für alles, was wir erfassen
Ein Datensatz wird nur aufgenommen, wenn seine eigene Lizenz kommerzielle Nutzung und Weitergabe erlaubt. Ein Datensatz ohne Lizenz wird abgelehnt und nicht als frei angenommen.
Akzeptiert
- Gemeinfrei und CC0
- CC BY, die Namensnennung wird mit den Daten geliefert
- Code: MIT, Apache-2.0, BSD, ISC, Unlicense
Abgelehnt
- Lizenzen mit NC (nicht kommerziell) und ND (keine Bearbeitung)
- Lizenzen mit SA (Weitergabe unter gleichen Bedingungen)
- GPL, AGPL und andere Copyleft-Lizenzen für Code
- Alles mit fehlender oder unklarer Lizenz
Vom ersten Blick bis zur Lieferung
Dataset Card
Sie erhalten die Dataset Card mit Umfang, Sprachen, Fachgebieten und Lizenzverteilung.
Stichprobe
Eine Stichprobe im Lieferformat zeigt Schema und Qualität.
NDA und Vertrag
Wir unterzeichnen ein NDA und vereinbaren anschließend Umfang, Lizenzbedingungen und Preis.
Lieferung
Verschlüsselte Übertragung der JSONL- oder Parquet-Dateien mit Dokumentation.
Häufige Fragen von Käufern
Können wir eine Stichprobe sehen, bevor wir etwas unterschreiben?
Ja. Die Dataset Card erhalten Sie auf Anfrage, danach eine kurze Stichprobe im Lieferformat. Größere Evaluationspakete teilen wir unter NDA.
Legen Sie offen, woher die Daten stammen?
Nein. Die Bezugsquellen sind vertraulich. Jeder Datensatz trägt seine Lizenz, und die Namensnennung wird überall dort mitgeliefert, wo eine Lizenz sie verlangt. CurateLM sichert die Lizenzkonformität vertraglich zu.
Werden personenbezogene Daten entfernt?
Texte werden mit automatischer Erkennung von Namen, E-Mail-Adressen, Telefonnummern und ähnlichen Kennungen bereinigt. Automatische Erkennung findet nicht alles. Deshalb berichten wir Erkennungsraten und behaupten nicht, dass nichts mehr enthalten ist.
Können wir eine einzelne Sprache oder ein Fachgebiet lizenzieren?
Ja. Jeder Datensatz ist mit Sprache und Fachgebiet gekennzeichnet. Ein Ausschnitt lässt sich nach Sprache, Thema, Lizenzklasse oder Qualitätswert bilden.
Gibt es einen Qualitätsbericht zu den Daten?
Ja. Zum Datensatz kann ein Benchmark-Bericht geliefert werden. Er misst Duplikate, erkannte personenbezogene Daten, Lizenzverteilung und Überschneidung mit Evaluationsdatensätzen.
Fordern Sie die Dataset Card an
Sagen Sie uns, welche Sprachen, Themen oder Programmiersprachen Sie brauchen.
Dataset Card anfordern