Dataset

Dati di addestramento per LLM con licenza

Corpora di testo, codice e biomedicina raccolti secondo un'unica e rigorosa policy sulle licenze, ripuliti dai dati personali, deduplicati e valutati con un punteggio. Consegna in JSONL o Parquet con scheda del dataset.

01 · Testo multilingue

Oltre 5,5 miliardi di token in oltre 150 lingue

Un corpus di testo pensato per le lingue e gli argomenti che i crawl generici del web coprono male. Il focus è sulle lingue rare e a basse risorse e sul materiale istituzionale e specialistico: scienza, diritto, pubblica amministrazione, medicina, finanza e ingegneria.

Token
Oltre 5,5 miliardi, in crescita ogni giorno
Lingue
Oltre 150, tra cui molte lingue a basse risorse
Nicchie tematiche
140
Licenze
Pubblico dominio, CC0, CC BY
Formati
JSONL, Apache Parquet
02 · Codice sorgente

Codice con licenza verificata, compresi i linguaggi legacy

Banche, assicurazioni ed enti pubblici lavorano ancora con COBOL, Fortran, JCL e PL/I, e i modelli che modernizzano questi sistemi hanno bisogno di dati di addestramento in questi linguaggi. Questo corpus unisce codice legacy aziendale e linguaggi moderni. Sono ammesse solo licenze permissive, e la licenza viene verificata per ogni repository.

Token
Oltre 2 miliardi, in crescita ogni giorno
Linguaggi legacy
COBOL, Fortran, JCL, PL/I
Linguaggi moderni
Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
Licenze
MIT, Apache-2.0, BSD, ISC, Unlicense. Nessuna licenza GPL o AGPL
Formati
JSONL, Apache Parquet
03 · Biomedicina e scienze della vita

Oltre 700 milioni di token di testo biomedico, più record strutturati

Testo biomedico in 31 nicchie e 33 lingue, dalla farmacologia e dalla neurologia alla medicina tropicale e alla biochimica. Accanto al testo sono disponibili record strutturati per la scoperta di farmaci e il lavoro clinico. Questo corpus non contiene alcun dato a livello di paziente.

Non offriamo: dati a livello di paziente per gemelli digitali. Le segnalazioni di eventi avversi sono comunicazioni regolatorie de-identificate, non una coorte di pazienti, e non devono essere analizzate come tale.

Token
Oltre 700 milioni, in crescita
Documenti
Oltre 2.800
Nicchie tematiche
31, tra cui medicina, farmacologia, neurologia, medicina tropicale, biochimica, immunologia, epidemiologia
Lingue
33
Record strutturati
Etichettatura regolatoria dei farmaci, segnalazioni di eventi avversi de-identificate, record dei registri di studi clinici, affinità di legame misurate, annotazioni di geni e pathway
Casi d'uso
Individuazione di target, meccanismi d'azione dei farmaci, ottimizzazione di molecole, previsione di biomarcatori, selezione dei pazienti
Copertura

Lingue e argomenti nel corpus di testo

Dati di addestramento per lingue e argomenti difficili da trovare altrove. I volumi variano molto da lingua a lingua: richiedete la scheda del dataset per vedere cosa è disponibile per quelle che vi servono.

Tra le lingue

Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu

Tra gli argomenti

Scienza e ricerca · Diritto, tribunali e legislazione · Atti governativi e parlamentari · Medicina · Medicina tradizionale, Ayurveda e medicina islamica (Tibb Nabawi) · Saperi indigeni · Banche, finanza e fisco · Ingegneria e aeronautica · Agricoltura · Architettura · Astronomia e chimica · Linguistica · Teologia e scienze umane · Istruzione · Sistemi IT legacy

Cosa riporta ogni record

Ogni record viene consegnato con licenza, lingua, dominio, punteggio di qualità, numero di token e hash del contenuto. Così potete filtrare, verificare e riprodurre la vostra selezione.

{ "text": "…", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "token_count": 1842, "text_hash": "9f2c…e41a" }
Policy sulle licenze

Una sola regola per tutto ciò che raccogliamo

Un record viene ammesso solo se la sua licenza consente l'uso commerciale e la ridistribuzione. Un record privo di licenza viene scartato, non considerato aperto per presunzione.

Ammesso

  • Pubblico dominio e CC0
  • CC BY, con l'attribuzione consegnata insieme ai dati
  • Codice: MIT, Apache-2.0, BSD, ISC, Unlicense

Scartato

  • Licenze non commerciali (NC) e senza opere derivate (ND)
  • Licenze share-alike, condividi allo stesso modo (SA)
  • GPL, AGPL e altre licenze copyleft per il codice
  • Tutto ciò che ha una licenza mancante o poco chiara
Come funziona la licenza

Dal primo sguardo alla consegna

Scheda del dataset

Ricevete la scheda del dataset con volumi, lingue, nicchie e ripartizione delle licenze.

Campione

Un campione nel formato di consegna mostra lo schema e la qualità.

NDA e contratto

Firmiamo un NDA, poi concordiamo perimetro, condizioni di licenza e prezzo.

Consegna

Trasferimento cifrato dei file JSONL o Parquet, con documentazione.

Le domande degli acquirenti

Possiamo vedere un campione prima di firmare qualcosa?

Sì. La scheda del dataset è disponibile su richiesta, seguita da un breve campione nel formato di consegna. I pacchetti di valutazione più ampi vengono condivisi sotto NDA.

Comunicate da dove provengono i dati?

No. Le fonti sono riservate. Ogni record riporta la propria licenza, e l'attribuzione viene consegnata ovunque una licenza la richieda. CurateLM garantisce la conformità delle licenze nel contratto.

I dati personali vengono rimossi?

Il testo viene ripulito con un rilevamento automatico di nomi, indirizzi e-mail, numeri di telefono e identificativi simili. Il rilevamento automatico non trova tutto: per questo riportiamo i tassi di rilevamento e non affermiamo che non resti nulla.

Possiamo prendere in licenza una sola lingua o nicchia?

Sì. Ogni record è etichettato con lingua e nicchia, quindi è possibile estrarre una porzione per lingua, argomento, classe di licenza o punteggio di qualità.

Fornite un report di qualità insieme ai dati?

Sì. Con il dataset può essere consegnato un report di benchmark. Misura duplicati, dati personali rilevati, ripartizione delle licenze e sovrapposizione con i set di valutazione.

Richiedete la scheda del dataset

Diteci quali lingue, argomenti o linguaggi di programmazione vi servono.

Richiedi la scheda del dataset