Gelicentieerde trainingsdata voor LLM's
Tekst-, code- en biomedische corpora, verzameld volgens één strikt licentiebeleid, ontdaan van persoonsgegevens, gededupliceerd en beoordeeld op kwaliteit. Geleverd als JSONL of Parquet, met een dataset card.
Meer dan 5,5 miljard tokens in 150+ talen
Een tekstcorpus voor de talen en onderwerpen die algemene webcrawls slecht dekken. De nadruk ligt op zeldzame talen en talen met weinig beschikbare data, en op institutioneel en specialistisch materiaal: wetenschap, recht, overheid, geneeskunde, financiën en techniek.
- Tokens
- 5,5 miljard+, groeit dagelijks
- Talen
- 150+, waaronder veel talen met weinig beschikbare data
- Domeinniches
- 140
- Licenties
- Publiek domein, CC0, CC BY
- Formaten
- JSONL, Apache Parquet
Code met geverifieerde licentie, inclusief de legacy-talen
Banken, verzekeraars en overheidsinstanties draaien nog steeds op COBOL, Fortran, JCL en PL/I. Modellen die deze systemen moderniseren, hebben trainingsdata in die talen nodig. Dit corpus combineert legacy-code uit het bedrijfsleven met moderne talen. Alleen permissieve licenties worden geaccepteerd en de licentie wordt voor elke repository gecontroleerd.
- Tokens
- 2 miljard+, groeit dagelijks
- Legacy-talen
- COBOL, Fortran, JCL, PL/I
- Moderne talen
- Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
- Licenties
- MIT, Apache-2.0, BSD, ISC, Unlicense. Geen GPL of AGPL
- Formaten
- JSONL, Apache Parquet
Meer dan 700 miljoen tokens biomedische tekst, plus gestructureerde records
Biomedische tekst in 31 niches en 33 talen, van farmacologie en neurologie tot tropische geneeskunde en biochemie. Daarnaast zijn gestructureerde records beschikbaar voor geneesmiddelenonderzoek en klinisch werk. Dit corpus bevat geen data op patiëntniveau.
Niet in het aanbod: data op patiëntniveau voor digital twins. Bijwerkingenmeldingen zijn geanonimiseerde meldingen aan toezichthouders. Ze vormen geen patiëntencohort en mogen niet als zodanig worden geanalyseerd.
- Tokens
- 700 miljoen+, en groeiend
- Documenten
- 2.800+
- Domeinniches
- 31, waaronder geneeskunde, farmacologie, neurologie, tropische geneeskunde, biochemie, immunologie, epidemiologie
- Talen
- 33
- Gestructureerde records
- Wettelijke geneesmiddeletikettering, geanonimiseerde bijwerkingenmeldingen, records uit registers van klinische trials, gemeten bindingsaffiniteiten, gen- en pathway-annotaties
- Toepassingen
- Target discovery, werkingsmechanismen van geneesmiddelen, optimalisatie van moleculen, voorspelling van biomarkers, patiëntselectie
Talen en onderwerpen in het tekstcorpus
Trainingsdata voor talen en onderwerpen die elders moeilijk te vinden zijn. De volumes verschillen sterk per taal. Vraag daarom de dataset card aan om te zien wat er beschikbaar is voor de talen die u nodig hebt.
Talen, onder meer
Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu
Onderwerpen, onder meer
Wetenschap en onderzoek · Recht, rechtspraak en wetgeving · Overheids- en parlementaire stukken · Geneeskunde · Traditionele geneeskunde, ayurveda en islamitische geneeskunde (Tibb Nabawi) · Inheemse kennis · Bankwezen, financiën en belastingen · Techniek en luchtvaarttechniek · Landbouw · Architectuur · Sterrenkunde en scheikunde · Taalkunde · Theologie en geesteswetenschappen · Onderwijs · Legacy-IT-systemen
Wat elk record bevat
Elk record wordt geleverd met licentie, taal, domein, kwaliteitsscore, aantal tokens en een contenthash. Zo kunt u uw selectie filteren, controleren en reproduceren.
Eén regel voor alles wat wij verzamelen
Een record wordt alleen toegelaten als de eigen licentie commercieel gebruik en herdistributie toestaat. Een record zonder licentie wordt geweigerd. Wij gaan er niet van uit dat het open is.
Geaccepteerd
- Publiek domein en CC0
- CC BY, waarbij de naamsvermelding met de data wordt meegeleverd
- Code: MIT, Apache-2.0, BSD, ISC, Unlicense
Geweigerd
- Licenties voor niet-commercieel gebruik (NC) en zonder afgeleide werken (ND)
- Gelijk-delen-licenties (SA)
- GPL, AGPL en andere copyleftlicenties voor code
- Alles met een ontbrekende of onduidelijke licentie
Van eerste kennismaking tot levering
Dataset card
U ontvangt de dataset card met volumes, talen, niches en de verdeling van licenties.
Sample
Een sample in het leveringsformaat toont het schema en de kwaliteit.
NDA en overeenkomst
Wij tekenen een NDA en spreken daarna scope, licentievoorwaarden en prijs af.
Levering
Versleutelde overdracht van JSONL- of Parquet-bestanden met documentatie.
Vragen van afnemers
Kunnen wij een sample zien voordat wij iets ondertekenen?
Ja. De dataset card is op aanvraag beschikbaar. Daarna volgt een korte sample in het leveringsformaat. Grotere evaluatiepakketten delen wij onder NDA.
Maakt u bekend waar de data vandaan komt?
Nee. De herkomst is vertrouwelijk. Elk record bevat zijn licentie, en de naamsvermelding wordt meegeleverd waar een licentie dat vereist. CurateLM garandeert in de overeenkomst dat de licenties worden nageleefd.
Worden persoonsgegevens verwijderd?
Tekst wordt opgeschoond met geautomatiseerde detectie van namen, e-mailadressen, telefoonnummers en vergelijkbare identificatoren. Geautomatiseerde detectie vindt niet alles. Daarom rapporteren wij de gedetecteerde percentages en beweren wij niet dat er niets achterblijft.
Kunnen wij één taal of niche in licentie nemen?
Ja. Elk record is gelabeld met taal en niche. Een deelset kan dus worden samengesteld op taal, onderwerp, licentieklasse of kwaliteitsscore.
Levert u een kwaliteitsrapport bij de data?
Ja. Bij de dataset kan een benchmarkrapport worden geleverd. Het meet duplicaten, gedetecteerde persoonsgegevens, de verdeling van licenties en de overlap met evaluatiesets.
Vraag de dataset card aan
Vertel ons welke talen, onderwerpen of programmeertalen u nodig hebt.
Vraag de dataset card aan