Licencjonowane dane treningowe dla LLM
Korpusy tekstu, kodu i danych biomedycznych zebrane według jednej, rygorystycznej polityki licencyjnej. Oczyszczone z danych osobowych, zdeduplikowane i ocenione. Dostarczane w formacie JSONL lub Parquet wraz z kartą zbioru danych.
Ponad 5,5 mld tokenów w ponad 150 językach
Korpus tekstowy stworzony z myślą o językach i tematach, które ogólne crawle internetu pokrywają słabo. Nacisk kładziemy na języki rzadkie i o ograniczonych zasobach oraz na materiały instytucjonalne i specjalistyczne: naukę, prawo, administrację, medycynę, finanse i inżynierię.
- Tokeny
- Ponad 5,5 mld, rośnie codziennie
- Języki
- 150+, w tym wiele języków o ograniczonych zasobach
- Nisze dziedzinowe
- 140
- Licencje
- Domena publiczna, CC0, CC BY
- Formaty
- JSONL, Apache Parquet
Kod ze zweryfikowaną licencją, także w starszych językach
Banki, ubezpieczyciele i instytucje publiczne nadal pracują na systemach w COBOL, Fortran, JCL i PL/I. Modele, które mają te systemy modernizować, potrzebują danych treningowych w tych językach. Ten korpus łączy starszy kod korporacyjny z nowoczesnymi językami. Przyjmujemy wyłącznie licencje permisywne, a licencję sprawdzamy dla każdego repozytorium.
- Tokeny
- Ponad 2 mld, rośnie codziennie
- Starsze języki
- COBOL, Fortran, JCL, PL/I
- Nowoczesne języki
- Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
- Licencje
- MIT, Apache-2.0, BSD, ISC, Unlicense. Bez GPL i AGPL
- Formaty
- JSONL, Apache Parquet
Ponad 700 mln tokenów tekstu biomedycznego oraz rekordy ustrukturyzowane
Tekst biomedyczny w 31 niszach i 33 językach, od farmakologii i neurologii po medycynę tropikalną i biochemię. Dodatkowo dostępne są rekordy ustrukturyzowane do zastosowań w odkrywaniu leków i pracy klinicznej. Korpus nie zawiera żadnych danych na poziomie pacjenta.
Nie oferujemy: danych na poziomie pacjenta do cyfrowych bliźniaków. Zgłoszenia zdarzeń niepożądanych to dokumenty regulacyjne pozbawione danych identyfikujących, a nie kohorta pacjentów, i nie wolno ich analizować jak kohorty.
- Tokeny
- Ponad 700 mln, rośnie
- Dokumenty
- 2800+
- Nisze dziedzinowe
- 31, w tym medycyna, farmakologia, neurologia, medycyna tropikalna, biochemia, immunologia, epidemiologia
- Języki
- 33
- Rekordy ustrukturyzowane
- Regulacyjne oznakowanie leków, zgłoszenia zdarzeń niepożądanych pozbawione danych identyfikujących, wpisy z rejestrów badań klinicznych, zmierzone powinowactwa wiązania, adnotacje genów i szlaków
- Zastosowania
- Identyfikacja celów terapeutycznych, mechanizmy działania leków, optymalizacja cząsteczek, przewidywanie biomarkerów, dobór pacjentów
Języki i tematy w korpusie tekstowym
Dane treningowe dla języków i tematów, które trudno znaleźć gdzie indziej. Wolumeny bardzo się różnią w zależności od języka. Karta zbioru danych pokazuje, co jest dostępne dla języków, których Państwo potrzebują.
Wybrane języki
Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu
Wybrane tematy
Nauka i badania · Prawo, sądy i legislacja · Dokumenty rządowe i parlamentarne · Medycyna · Medycyna tradycyjna, ajurweda i medycyna islamska (Tibb Nabawi) · Wiedza rdzennych społeczności · Bankowość, finanse i podatki · Inżynieria i aeronautyka · Rolnictwo · Architektura · Astronomia i chemia · Językoznawstwo · Teologia i nauki humanistyczne · Edukacja · Starsze systemy IT
Co zawiera każdy rekord
Każdy rekord dostarczamy z licencją, językiem, dziedziną, oceną jakości, liczbą tokenów i hashem treści. Dzięki temu mogą Państwo filtrować dane, audytować je i odtworzyć swój wybór.
Jedna zasada dla wszystkiego, co pozyskujemy
Rekord trafia do zbioru tylko wtedy, gdy jego własna licencja zezwala na użytek komercyjny i dalszą dystrybucję. Rekord bez licencji odrzucamy. Nie zakładamy, że jest otwarty.
Przyjmujemy
- Domena publiczna i CC0
- CC BY, z informacją o autorstwie dostarczaną razem z danymi
- Kod: MIT, Apache-2.0, BSD, ISC, Unlicense
Odrzucamy
- Licencje niekomercyjne (NC) i bez utworów zależnych (ND)
- Licencje na tych samych warunkach (SA)
- GPL, AGPL i inne licencje copyleft na kod
- Wszystko, co nie ma licencji lub ma licencję niejasną
Od pierwszego wglądu do dostawy
Karta zbioru danych
Otrzymują Państwo kartę zbioru danych z wolumenami, językami, niszami i strukturą licencji.
Próbka
Próbka w formacie dostawy pokazuje schemat i jakość.
NDA i umowa
Podpisujemy NDA, a następnie uzgadniamy zakres, warunki licencji i cenę.
Dostawa
Szyfrowany transfer plików JSONL lub Parquet wraz z dokumentacją.
Pytania, które zadają kupujący
Czy możemy zobaczyć próbkę, zanim cokolwiek podpiszemy?
Tak. Kartę zbioru danych udostępniamy na życzenie, a po niej krótką próbkę w formacie dostawy. Większe pakiety do oceny udostępniamy po podpisaniu NDA.
Czy ujawniają Państwo, skąd pochodzą dane?
Nie. Źródła pozyskania są poufne. Każdy rekord ma przypisaną licencję, a informację o autorstwie dostarczamy wszędzie tam, gdzie licencja tego wymaga. CurateLM gwarantuje zgodność licencyjną w umowie.
Czy dane osobowe są usuwane?
Tekst jest oczyszczany przy użyciu automatycznego wykrywania imion i nazwisk, adresów e-mail, numerów telefonów i podobnych identyfikatorów. Automatyczne wykrywanie nie znajduje wszystkiego. Dlatego podajemy wskaźniki wykrycia i nie twierdzimy, że nic nie pozostało.
Czy możemy licencjonować jeden język lub jedną niszę?
Tak. Każdy rekord jest oznaczony językiem i niszą, więc wycinek można przygotować według języka, tematu, klasy licencji lub oceny jakości.
Czy do danych dołączają Państwo raport jakości?
Tak. Wraz ze zbiorem danych możemy dostarczyć raport z benchmarku. Mierzy on duplikaty, wykryte dane osobowe, strukturę licencji i pokrycie ze zbiorami ewaluacyjnymi.
Proszę poprosić o kartę zbioru danych
Proszę napisać, jakich języków, tematów lub języków programowania Państwo potrzebują.
Poproś o kartę zbioru danych