On-premise in Germania e nell'UE · Nessuna archiviazione in cloud

Dati di addestramento per l'IA con licenza.
E la pipeline per ripulire i vostri.

CurateLM fornisce corpora di testo e di codice con licenza verificata per l'addestramento di LLM. Applichiamo la stessa pipeline di curation anche ai vostri dati: rimozione dei dati personali, deduplicazione, rilevamento della lingua e punteggio di qualità, con trattamento in Germania e nell'UE.

5.5B+token di testo multilingue in oltre 150 lingue
corpus_sample.jsonl { "text": "Die Studie untersucht, wie …", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "pii_scrubbed": true }
2B+token di codice con licenza verificata, da COBOL a Rust
payroll.cbl · COBOL · Apache-2.0 · parses cleanly IDENTIFICATION DIVISION. PROGRAM-ID. PAYCALC. PROCEDURE DIVISION. COMPUTE NET-PAY = GROSS-PAY - TAX-AMT. DISPLAY "NET PAY: " NET-PAY. STOP RUN.
700M+token di testo biomedico in 31 nicchie
biomedical_sample.jsonl { "text": "The compound inhibits …", "language": "en", "niche": "pharmacology", "license": "CC-BY-4.0", "quality_score": 0.93, "pii_scrubbed": true }
In crescita ogni giorno
5.5B+token di testo multilingue
150+lingue, molte delle quali rare e a basse risorse
2B+token di codice sorgente con licenza verificata
700M+token di testo biomedico

I corpora crescono ogni giorno. Le cifre aggiornate si trovano nella scheda del dataset.

Berlino · Dati conservati nell'UE · Licenza verificata per ogni record · Accordo sul trattamento dei dati ai sensi dell'art. 28 del GDPR
Cosa facciamo

Tre modi di lavorare con CurateLM

Dataset

Corpora pronti da prendere in licenza

Testo multilingue in oltre 150 lingue, codice sorgente che comprende i linguaggi legacy aziendali e dati biomedici. Ogni record riporta licenza, lingua e punteggio di qualità.

Vedi i dataset
Data curation B2B

Fate curare i vostri dati

Trasformiamo documenti, scansioni, audio e video in dati di addestramento strutturati, senza dati personali e con un accordo sul trattamento dei dati. Nell'UE o presso la vostra sede.

Come funziona il servizio
Benchmark di qualità

Fate misurare un dataset

Un report basato su misurazioni per qualsiasi dataset di testo o di codice: duplicati, dati personali, conformità delle licenze, validità sintattica e sovrapposizione con i set di valutazione. Prima e dopo la curation.

Cosa copre il report
I nostri dati

Corpora che potete prendere in licenza oggi

Tre corpora, costruiti con un'unica policy sulle licenze: solo pubblico dominio, CC0, CC BY e licenze permissive per il codice. Il materiale non commerciale, senza opere derivate, share-alike e copyleft viene scartato già in fase di raccolta.

Testo multilingue

  • Oltre 5,5 miliardi di token, in crescita ogni giorno
  • Oltre 150 lingue in 140 nicchie tematiche
  • Focus su lingue rare e a basse risorse
  • Scienza, diritto, pubblica amministrazione, medicina, finanza, ingegneria

Codice sorgente

  • Oltre 2 miliardi di token, in crescita
  • Legacy: COBOL, Fortran, JCL, PL/I
  • Moderni: Rust, Go, Java, C, C++, TypeScript e altri
  • Solo licenze permissive, verificate per ogni repository

Biomedicina e scienze della vita

  • Oltre 700 milioni di token in 31 nicchie
  • Farmacologia, neurologia, biochimica, immunologia
  • Record strutturati: etichettatura dei farmaci, studi clinici, affinità di legame
  • Nessun dato a livello di paziente
Tutti i dataset e la policy sulle licenze
Benchmark

Un report di qualità per qualsiasi dataset

La maggior parte dei dataset si vende in base al numero di token. Noi misuriamo cosa c'è dentro: quanto contenuto è duplicato, quali dati personali vengono rilevati, se le licenze rispettano la vostra policy, se il codice supera il parsing e se nei dati sono finiti benchmark di valutazione. Il report contiene solo numeri, mai il vostro testo.

  • Testo e codice in un unico report
  • Prima e dopo la curation, a confronto
  • Controlli rispetto ai set di valutazione pubblici e a quelli privati del cliente
  • Esecuzione in locale: nessun dato lascia la macchina
Data curation

Dai dati grezzi ai dati pronti in quattro passaggi

Ci inviate i vostri dati grezzi. Vi restituiamo dataset di addestramento pronti per la produzione, nei tempi concordati e con documentazione completa.

01

Inviate i dati grezzi

PDF, HTML, CSV, trascrizioni audio, dati raccolti dal web: qualsiasi formato, qualsiasi lingua, qualsiasi volume.

02

Puliamo e strutturiamo

Deduplicazione, normalizzazione, progettazione dello schema, rimozione dei dati personali, filtri di qualità e annotazione.

03

Conversione di formato

Output in JSONL, Parquet o in uno schema personalizzato, ottimizzato e validato per la vostra pipeline.

04

Consegna

Ogni dataset viene consegnato con una scheda del dataset, un report con le statistiche di qualità e un file campione di validazione.

Come funziona il servizio

I vostri dati restano sempre on-premise

Ogni dataset viene trattato on-premise in Germania e nell'UE. Nessuna archiviazione in cloud, in nessuna fase. Per ogni progetto, un accordo sul trattamento dei dati ai sensi dell'art. 28 del GDPR. Nessun trasferimento di dati verso gli USA o paesi terzi.

Cifratura AES-256

I dati a riposo sono cifrati con AES-256-GCM. Le chiavi sono impostate per sessione e non vengono mai scritte su disco.

Priorità all'UE · Conforme all'art. 28 del GDPR

Impresa registrata a Berlino. Per ogni progetto sono disponibili un accordo sul trattamento dei dati ai sensi dell'art. 28 del GDPR e un NDA.

AES-256-GCM Art. 28 GDPR Residenza dei dati nell'UE NDA Standard
Servizi

Formati e servizi per la vostra pipeline

Creazione di JSONL

Formati instruction-following, chat, coppie DPO e completion, adattati all'architettura del vostro modello.

Conversione in Parquet

File Parquet colonnari con schema ottimizzato per il pre-addestramento su larga scala tramite Hugging Face, S3 o BigQuery.

Pulizia dei dati

Deduplicazione, rilevamento della lingua, normalizzazione, rimozione dei dati personali, filtro dei contenuti tossici e punteggio di qualità.

Chunking per RAG

Segmentazione dei documenti, strategia di chunking e arricchimento dei metadati per la pipeline del vostro database vettoriale.

Vedi tutti i servizi

Diteci di quali dati avete bisogno, o quali dati avete

Rispondiamo entro un giorno lavorativo con una scheda del dataset, una proposta di campione o un perimetro per il vostro progetto.

Richiedi la scheda del dataset Vedi i prezzi