Dati di addestramento per LLM con licenza
Corpora di testo, codice e biomedicina raccolti secondo un'unica e rigorosa policy sulle licenze, ripuliti dai dati personali, deduplicati e valutati con un punteggio. Consegna in JSONL o Parquet con scheda del dataset.
Oltre 5,5 miliardi di token in oltre 150 lingue
Un corpus di testo pensato per le lingue e gli argomenti che i crawl generici del web coprono male. Il focus è sulle lingue rare e a basse risorse e sul materiale istituzionale e specialistico: scienza, diritto, pubblica amministrazione, medicina, finanza e ingegneria.
- Token
- Oltre 5,5 miliardi, in crescita ogni giorno
- Lingue
- Oltre 150, tra cui molte lingue a basse risorse
- Nicchie tematiche
- 140
- Licenze
- Pubblico dominio, CC0, CC BY
- Formati
- JSONL, Apache Parquet
Codice con licenza verificata, compresi i linguaggi legacy
Banche, assicurazioni ed enti pubblici lavorano ancora con COBOL, Fortran, JCL e PL/I, e i modelli che modernizzano questi sistemi hanno bisogno di dati di addestramento in questi linguaggi. Questo corpus unisce codice legacy aziendale e linguaggi moderni. Sono ammesse solo licenze permissive, e la licenza viene verificata per ogni repository.
- Token
- Oltre 2 miliardi, in crescita ogni giorno
- Linguaggi legacy
- COBOL, Fortran, JCL, PL/I
- Linguaggi moderni
- Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
- Licenze
- MIT, Apache-2.0, BSD, ISC, Unlicense. Nessuna licenza GPL o AGPL
- Formati
- JSONL, Apache Parquet
Oltre 700 milioni di token di testo biomedico, più record strutturati
Testo biomedico in 31 nicchie e 33 lingue, dalla farmacologia e dalla neurologia alla medicina tropicale e alla biochimica. Accanto al testo sono disponibili record strutturati per la scoperta di farmaci e il lavoro clinico. Questo corpus non contiene alcun dato a livello di paziente.
Non offriamo: dati a livello di paziente per gemelli digitali. Le segnalazioni di eventi avversi sono comunicazioni regolatorie de-identificate, non una coorte di pazienti, e non devono essere analizzate come tale.
- Token
- Oltre 700 milioni, in crescita
- Documenti
- Oltre 2.800
- Nicchie tematiche
- 31, tra cui medicina, farmacologia, neurologia, medicina tropicale, biochimica, immunologia, epidemiologia
- Lingue
- 33
- Record strutturati
- Etichettatura regolatoria dei farmaci, segnalazioni di eventi avversi de-identificate, record dei registri di studi clinici, affinità di legame misurate, annotazioni di geni e pathway
- Casi d'uso
- Individuazione di target, meccanismi d'azione dei farmaci, ottimizzazione di molecole, previsione di biomarcatori, selezione dei pazienti
Lingue e argomenti nel corpus di testo
Dati di addestramento per lingue e argomenti difficili da trovare altrove. I volumi variano molto da lingua a lingua: richiedete la scheda del dataset per vedere cosa è disponibile per quelle che vi servono.
Tra le lingue
Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu
Tra gli argomenti
Scienza e ricerca · Diritto, tribunali e legislazione · Atti governativi e parlamentari · Medicina · Medicina tradizionale, Ayurveda e medicina islamica (Tibb Nabawi) · Saperi indigeni · Banche, finanza e fisco · Ingegneria e aeronautica · Agricoltura · Architettura · Astronomia e chimica · Linguistica · Teologia e scienze umane · Istruzione · Sistemi IT legacy
Cosa riporta ogni record
Ogni record viene consegnato con licenza, lingua, dominio, punteggio di qualità, numero di token e hash del contenuto. Così potete filtrare, verificare e riprodurre la vostra selezione.
Una sola regola per tutto ciò che raccogliamo
Un record viene ammesso solo se la sua licenza consente l'uso commerciale e la ridistribuzione. Un record privo di licenza viene scartato, non considerato aperto per presunzione.
Ammesso
- Pubblico dominio e CC0
- CC BY, con l'attribuzione consegnata insieme ai dati
- Codice: MIT, Apache-2.0, BSD, ISC, Unlicense
Scartato
- Licenze non commerciali (NC) e senza opere derivate (ND)
- Licenze share-alike, condividi allo stesso modo (SA)
- GPL, AGPL e altre licenze copyleft per il codice
- Tutto ciò che ha una licenza mancante o poco chiara
Dal primo sguardo alla consegna
Scheda del dataset
Ricevete la scheda del dataset con volumi, lingue, nicchie e ripartizione delle licenze.
Campione
Un campione nel formato di consegna mostra lo schema e la qualità.
NDA e contratto
Firmiamo un NDA, poi concordiamo perimetro, condizioni di licenza e prezzo.
Consegna
Trasferimento cifrato dei file JSONL o Parquet, con documentazione.
Le domande degli acquirenti
Possiamo vedere un campione prima di firmare qualcosa?
Sì. La scheda del dataset è disponibile su richiesta, seguita da un breve campione nel formato di consegna. I pacchetti di valutazione più ampi vengono condivisi sotto NDA.
Comunicate da dove provengono i dati?
No. Le fonti sono riservate. Ogni record riporta la propria licenza, e l'attribuzione viene consegnata ovunque una licenza la richieda. CurateLM garantisce la conformità delle licenze nel contratto.
I dati personali vengono rimossi?
Il testo viene ripulito con un rilevamento automatico di nomi, indirizzi e-mail, numeri di telefono e identificativi simili. Il rilevamento automatico non trova tutto: per questo riportiamo i tassi di rilevamento e non affermiamo che non resti nulla.
Possiamo prendere in licenza una sola lingua o nicchia?
Sì. Ogni record è etichettato con lingua e nicchia, quindi è possibile estrarre una porzione per lingua, argomento, classe di licenza o punteggio di qualità.
Fornite un report di qualità insieme ai dati?
Sì. Con il dataset può essere consegnato un report di benchmark. Misura duplicati, dati personali rilevati, ripartizione delle licenze e sovrapposizione con i set di valutazione.
Richiedete la scheda del dataset
Diteci quali lingue, argomenti o linguaggi di programmazione vi servono.
Richiedi la scheda del dataset