Dati di addestramento per l'IA con licenza.
E la pipeline per ripulire i vostri.
CurateLM fornisce corpora di testo e di codice con licenza verificata per l'addestramento di LLM. Applichiamo la stessa pipeline di curation anche ai vostri dati: rimozione dei dati personali, deduplicazione, rilevamento della lingua e punteggio di qualità, con trattamento in Germania e nell'UE.
I corpora crescono ogni giorno. Le cifre aggiornate si trovano nella scheda del dataset.
Tre modi di lavorare con CurateLM
Corpora pronti da prendere in licenza
Testo multilingue in oltre 150 lingue, codice sorgente che comprende i linguaggi legacy aziendali e dati biomedici. Ogni record riporta licenza, lingua e punteggio di qualità.
Vedi i datasetFate curare i vostri dati
Trasformiamo documenti, scansioni, audio e video in dati di addestramento strutturati, senza dati personali e con un accordo sul trattamento dei dati. Nell'UE o presso la vostra sede.
Come funziona il servizioFate misurare un dataset
Un report basato su misurazioni per qualsiasi dataset di testo o di codice: duplicati, dati personali, conformità delle licenze, validità sintattica e sovrapposizione con i set di valutazione. Prima e dopo la curation.
Cosa copre il reportCorpora che potete prendere in licenza oggi
Tre corpora, costruiti con un'unica policy sulle licenze: solo pubblico dominio, CC0, CC BY e licenze permissive per il codice. Il materiale non commerciale, senza opere derivate, share-alike e copyleft viene scartato già in fase di raccolta.
Testo multilingue
- Oltre 5,5 miliardi di token, in crescita ogni giorno
- Oltre 150 lingue in 140 nicchie tematiche
- Focus su lingue rare e a basse risorse
- Scienza, diritto, pubblica amministrazione, medicina, finanza, ingegneria
Codice sorgente
- Oltre 2 miliardi di token, in crescita
- Legacy: COBOL, Fortran, JCL, PL/I
- Moderni: Rust, Go, Java, C, C++, TypeScript e altri
- Solo licenze permissive, verificate per ogni repository
Biomedicina e scienze della vita
- Oltre 700 milioni di token in 31 nicchie
- Farmacologia, neurologia, biochimica, immunologia
- Record strutturati: etichettatura dei farmaci, studi clinici, affinità di legame
- Nessun dato a livello di paziente
Un report di qualità per qualsiasi dataset
La maggior parte dei dataset si vende in base al numero di token. Noi misuriamo cosa c'è dentro: quanto contenuto è duplicato, quali dati personali vengono rilevati, se le licenze rispettano la vostra policy, se il codice supera il parsing e se nei dati sono finiti benchmark di valutazione. Il report contiene solo numeri, mai il vostro testo.
- Testo e codice in un unico report
- Prima e dopo la curation, a confronto
- Controlli rispetto ai set di valutazione pubblici e a quelli privati del cliente
- Esecuzione in locale: nessun dato lascia la macchina
Dai dati grezzi ai dati pronti in quattro passaggi
Ci inviate i vostri dati grezzi. Vi restituiamo dataset di addestramento pronti per la produzione, nei tempi concordati e con documentazione completa.
Inviate i dati grezzi
PDF, HTML, CSV, trascrizioni audio, dati raccolti dal web: qualsiasi formato, qualsiasi lingua, qualsiasi volume.
Puliamo e strutturiamo
Deduplicazione, normalizzazione, progettazione dello schema, rimozione dei dati personali, filtri di qualità e annotazione.
Conversione di formato
Output in JSONL, Parquet o in uno schema personalizzato, ottimizzato e validato per la vostra pipeline.
Consegna
Ogni dataset viene consegnato con una scheda del dataset, un report con le statistiche di qualità e un file campione di validazione.
I vostri dati restano sempre on-premise
Ogni dataset viene trattato on-premise in Germania e nell'UE. Nessuna archiviazione in cloud, in nessuna fase. Per ogni progetto, un accordo sul trattamento dei dati ai sensi dell'art. 28 del GDPR. Nessun trasferimento di dati verso gli USA o paesi terzi.
Cifratura AES-256
I dati a riposo sono cifrati con AES-256-GCM. Le chiavi sono impostate per sessione e non vengono mai scritte su disco.
Priorità all'UE · Conforme all'art. 28 del GDPR
Impresa registrata a Berlino. Per ogni progetto sono disponibili un accordo sul trattamento dei dati ai sensi dell'art. 28 del GDPR e un NDA.
Formati e servizi per la vostra pipeline
Creazione di JSONL
Formati instruction-following, chat, coppie DPO e completion, adattati all'architettura del vostro modello.
Conversione in Parquet
File Parquet colonnari con schema ottimizzato per il pre-addestramento su larga scala tramite Hugging Face, S3 o BigQuery.
Pulizia dei dati
Deduplicazione, rilevamento della lingua, normalizzazione, rimozione dei dati personali, filtro dei contenuti tossici e punteggio di qualità.
Chunking per RAG
Segmentazione dei documenti, strategia di chunking e arricchimento dei metadati per la pipeline del vostro database vettoriale.
Diteci di quali dati avete bisogno, o quali dati avete
Rispondiamo entro un giorno lavorativo con una scheda del dataset, una proposta di campione o un perimetro per il vostro progetto.