On-premise in Duitsland en de EU · Geen cloudopslag

Gelicentieerde AI-trainingsdata.
En de pipeline om uw eigen data op te schonen.

CurateLM levert tekst- en codecorpora met geverifieerde licentie voor het trainen van LLM's. Dezelfde curatiepipeline zetten wij ook in op uw eigen data: persoonsgegevens verwijderen, deduplicatie, taaldetectie en kwaliteitsbeoordeling, verwerkt in Duitsland en de EU.

5.5B+tokens meertalige tekst in 150+ talen
corpus_sample.jsonl { "text": "Die Studie untersucht, wie …", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "pii_scrubbed": true }
2B+tokens code met geverifieerde licentie, van COBOL tot Rust
payroll.cbl · COBOL · Apache-2.0 · parses cleanly IDENTIFICATION DIVISION. PROGRAM-ID. PAYCALC. PROCEDURE DIVISION. COMPUTE NET-PAY = GROSS-PAY - TAX-AMT. DISPLAY "NET PAY: " NET-PAY. STOP RUN.
700M+tokens biomedische tekst in 31 niches
biomedical_sample.jsonl { "text": "The compound inhibits …", "language": "en", "niche": "pharmacology", "license": "CC-BY-4.0", "quality_score": 0.93, "pii_scrubbed": true }
Groeit dagelijks
5.5B+tokens meertalige tekst
150+talen, waaronder veel zeldzame talen met weinig beschikbare data
2B+tokens broncode met geverifieerde licentie
700M+tokens biomedische tekst

De corpora groeien elke dag. De exacte actuele cijfers staan in de dataset card.

Berlijn · Dataopslag in de EU · Licentie per record geverifieerd · Verwerkersovereenkomst volgens art. 28 AVG
Wat wij doen

Drie manieren om met CurateLM te werken

Datasets

Kant-en-klare corpora in licentie nemen

Meertalige tekst in 150+ talen, broncode inclusief legacy-talen uit het bedrijfsleven, en biomedische data. Elk record bevat zijn licentie, taal en kwaliteitsscore.

Bekijk de datasets
B2B-datacuratie

Uw eigen data laten cureren

Wij zetten uw documenten, scans, audio en video om in gestructureerde trainingsdata. Persoonsgegevens worden verwijderd en er ligt een verwerkersovereenkomst. In de EU of op uw eigen locatie.

Zo werkt de dienst
Kwaliteitsbenchmark

Een dataset laten meten

Een rapport met meetresultaten over elke tekst- of codedataset: duplicaten, persoonsgegevens, licentieconformiteit, syntactische geldigheid en overlap met evaluatiesets. Voor en na curatie.

Wat het rapport omvat
Onze data

Corpora die u vandaag in licentie kunt nemen

Drie corpora, opgebouwd volgens één licentiebeleid: alleen publiek domein, CC0, CC BY en permissieve codelicenties. Materiaal met een niet-commerciële, geen-afgeleide-werken-, gelijk-delen- of copyleftlicentie wordt al bij het verzamelen geweigerd.

Meertalige tekst

  • Meer dan 5,5 miljard tokens, groeit dagelijks
  • 150+ talen in 140 domeinniches
  • Nadruk op zeldzame talen en talen met weinig beschikbare data
  • Wetenschap, recht, overheid, geneeskunde, financiën, techniek

Broncode

  • 2 miljard+ tokens, en groeiend
  • Legacy: COBOL, Fortran, JCL, PL/I
  • Modern: Rust, Go, Java, C, C++, TypeScript en meer
  • Alleen permissieve licenties, gecontroleerd per repository

Biomedisch en life sciences

  • Meer dan 700 miljoen tokens in 31 niches
  • Farmacologie, neurologie, biochemie, immunologie
  • Gestructureerde records: geneesmiddeletikettering, trials, bindingsaffiniteiten
  • Geen data op patiëntniveau
Alle datasets en licentiebeleid
Benchmark

Een kwaliteitsrapport voor elke dataset

De meeste datasets worden verkocht op basis van het aantal tokens. Wij meten wat erin zit: hoeveel is gedupliceerd, welke persoonsgegevens worden gedetecteerd, of de licenties bij uw beleid passen, of de code te parsen is en of er evaluatiebenchmarks in zijn gelekt. Het rapport bevat alleen cijfers, nooit uw tekst.

  • Tekst en code in één rapport
  • Voor en na curatie, naast elkaar
  • Controles tegen openbare evaluatiesets en uw eigen besloten evaluatiesets
  • Draait lokaal: er verlaat geen data de machine
Datacuratie

Van ruw naar gebruiksklaar in vier stappen

U stuurt ons uw ruwe data. Wij leveren productierijpe trainingsdatasets binnen uw planning, volledig gedocumenteerd.

01

Ruwe data aanleveren

Pdf's, HTML, CSV-bestanden, audiotranscripten, webscrapes: elk formaat, elke taal, elk volume.

02

Wij schonen op en structureren

Deduplicatie, normalisatie, schemaontwerp, persoonsgegevens verwijderen, kwaliteitsfiltering en annotatie.

03

Formaatconversie

Uitvoer als JSONL, Parquet of een eigen schema, geoptimaliseerd en gevalideerd voor uw pipeline.

04

Levering

Elke dataset wordt geleverd met een data card, een rapport met kwaliteitsstatistieken en een validatiebestand met een sample.

Zo werkt de dienst

Uw data blijft altijd binnen onze muren

Elke dataset wordt on-premise verwerkt in Duitsland en de EU. Op geen enkel moment cloudopslag. Bij elk project een verwerkersovereenkomst volgens art. 28 AVG. Geen doorgifte van data naar de VS of derde landen.

AES-256-versleuteling

Opgeslagen data wordt versleuteld met AES-256-GCM. Sleutels worden per sessie ingesteld en nooit naar schijf geschreven.

De EU voorop · Ingericht volgens art. 28 AVG

Onderneming geregistreerd in Berlijn. Voor elk project zijn een verwerkersovereenkomst volgens art. 28 AVG en een NDA beschikbaar.

AES-256-GCM Art. 28 AVG Dataopslag in de EU NDA Standard
Diensten

Formaten en diensten voor uw pipeline

JSONL-datasets maken

Instructie-, chat- en completion-formaten en DPO-paren, afgestemd op uw modelarchitectuur.

Parquet-conversie

Kolomgeoriënteerde Parquet-bestanden met geoptimaliseerd schema voor grootschalige pre-training via Hugging Face, S3 of BigQuery.

Data opschonen

Deduplicatie, taaldetectie, normalisatie, persoonsgegevens verwijderen, filtering op toxiciteit en kwaliteitsbeoordeling.

RAG-chunking

Documentsegmentatie, chunkingstrategie en verrijking met metadata voor de pipeline van uw vectordatabase.

Bekijk alle diensten

Vertel ons welke data u nodig hebt, of welke data u hebt

Wij reageren binnen één werkdag met een dataset card, een voorstel voor een sample of een scope voor uw project.

Vraag de dataset card aan Bekijk prijzen