Gelicentieerde AI-trainingsdata.
En de pipeline om uw eigen data op te schonen.
CurateLM levert tekst- en codecorpora met geverifieerde licentie voor het trainen van LLM's. Dezelfde curatiepipeline zetten wij ook in op uw eigen data: persoonsgegevens verwijderen, deduplicatie, taaldetectie en kwaliteitsbeoordeling, verwerkt in Duitsland en de EU.
De corpora groeien elke dag. De exacte actuele cijfers staan in de dataset card.
Drie manieren om met CurateLM te werken
Kant-en-klare corpora in licentie nemen
Meertalige tekst in 150+ talen, broncode inclusief legacy-talen uit het bedrijfsleven, en biomedische data. Elk record bevat zijn licentie, taal en kwaliteitsscore.
Bekijk de datasetsUw eigen data laten cureren
Wij zetten uw documenten, scans, audio en video om in gestructureerde trainingsdata. Persoonsgegevens worden verwijderd en er ligt een verwerkersovereenkomst. In de EU of op uw eigen locatie.
Zo werkt de dienstEen dataset laten meten
Een rapport met meetresultaten over elke tekst- of codedataset: duplicaten, persoonsgegevens, licentieconformiteit, syntactische geldigheid en overlap met evaluatiesets. Voor en na curatie.
Wat het rapport omvatCorpora die u vandaag in licentie kunt nemen
Drie corpora, opgebouwd volgens één licentiebeleid: alleen publiek domein, CC0, CC BY en permissieve codelicenties. Materiaal met een niet-commerciële, geen-afgeleide-werken-, gelijk-delen- of copyleftlicentie wordt al bij het verzamelen geweigerd.
Meertalige tekst
- Meer dan 5,5 miljard tokens, groeit dagelijks
- 150+ talen in 140 domeinniches
- Nadruk op zeldzame talen en talen met weinig beschikbare data
- Wetenschap, recht, overheid, geneeskunde, financiën, techniek
Broncode
- 2 miljard+ tokens, en groeiend
- Legacy: COBOL, Fortran, JCL, PL/I
- Modern: Rust, Go, Java, C, C++, TypeScript en meer
- Alleen permissieve licenties, gecontroleerd per repository
Biomedisch en life sciences
- Meer dan 700 miljoen tokens in 31 niches
- Farmacologie, neurologie, biochemie, immunologie
- Gestructureerde records: geneesmiddeletikettering, trials, bindingsaffiniteiten
- Geen data op patiëntniveau
Een kwaliteitsrapport voor elke dataset
De meeste datasets worden verkocht op basis van het aantal tokens. Wij meten wat erin zit: hoeveel is gedupliceerd, welke persoonsgegevens worden gedetecteerd, of de licenties bij uw beleid passen, of de code te parsen is en of er evaluatiebenchmarks in zijn gelekt. Het rapport bevat alleen cijfers, nooit uw tekst.
- Tekst en code in één rapport
- Voor en na curatie, naast elkaar
- Controles tegen openbare evaluatiesets en uw eigen besloten evaluatiesets
- Draait lokaal: er verlaat geen data de machine
Van ruw naar gebruiksklaar in vier stappen
U stuurt ons uw ruwe data. Wij leveren productierijpe trainingsdatasets binnen uw planning, volledig gedocumenteerd.
Ruwe data aanleveren
Pdf's, HTML, CSV-bestanden, audiotranscripten, webscrapes: elk formaat, elke taal, elk volume.
Wij schonen op en structureren
Deduplicatie, normalisatie, schemaontwerp, persoonsgegevens verwijderen, kwaliteitsfiltering en annotatie.
Formaatconversie
Uitvoer als JSONL, Parquet of een eigen schema, geoptimaliseerd en gevalideerd voor uw pipeline.
Levering
Elke dataset wordt geleverd met een data card, een rapport met kwaliteitsstatistieken en een validatiebestand met een sample.
Uw data blijft altijd binnen onze muren
Elke dataset wordt on-premise verwerkt in Duitsland en de EU. Op geen enkel moment cloudopslag. Bij elk project een verwerkersovereenkomst volgens art. 28 AVG. Geen doorgifte van data naar de VS of derde landen.
AES-256-versleuteling
Opgeslagen data wordt versleuteld met AES-256-GCM. Sleutels worden per sessie ingesteld en nooit naar schijf geschreven.
De EU voorop · Ingericht volgens art. 28 AVG
Onderneming geregistreerd in Berlijn. Voor elk project zijn een verwerkersovereenkomst volgens art. 28 AVG en een NDA beschikbaar.
Formaten en diensten voor uw pipeline
JSONL-datasets maken
Instructie-, chat- en completion-formaten en DPO-paren, afgestemd op uw modelarchitectuur.
Parquet-conversie
Kolomgeoriënteerde Parquet-bestanden met geoptimaliseerd schema voor grootschalige pre-training via Hugging Face, S3 of BigQuery.
Data opschonen
Deduplicatie, taaldetectie, normalisatie, persoonsgegevens verwijderen, filtering op toxiciteit en kwaliteitsbeoordeling.
RAG-chunking
Documentsegmentatie, chunkingstrategie en verrijking met metadata voor de pipeline van uw vectordatabase.
Vertel ons welke data u nodig hebt, of welke data u hebt
Wij reageren binnen één werkdag met een dataset card, een voorstel voor een sample of een scope voor uw project.