On-Premise in Deutschland und der EU · Kein Cloud-Speicher

Lizenzierte KI-Trainingsdaten.
Und die Pipeline für Ihre eigenen Daten.

CurateLM liefert lizenzgeprüfte Text- und Code-Korpora für das Training von Sprachmodellen. Dieselbe Pipeline bereitet auch Ihre eigenen Daten auf: Entfernung personenbezogener Daten, Deduplizierung, Spracherkennung und Qualitätsbewertung, verarbeitet in Deutschland und der EU.

5.5B+Tokens mehrsprachiger Text in über 150 Sprachen
corpus_sample.jsonl { "text": "Die Studie untersucht, wie …", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "pii_scrubbed": true }
2B+Tokens lizenzgeprüfter Code, von COBOL bis Rust
payroll.cbl · COBOL · Apache-2.0 · parses cleanly IDENTIFICATION DIVISION. PROGRAM-ID. PAYCALC. PROCEDURE DIVISION. COMPUTE NET-PAY = GROSS-PAY - TAX-AMT. DISPLAY "NET PAY: " NET-PAY. STOP RUN.
700M+Tokens biomedizinischer Text in 31 Fachgebieten
biomedical_sample.jsonl { "text": "The compound inhibits …", "language": "en", "niche": "pharmacology", "license": "CC-BY-4.0", "quality_score": 0.93, "pii_scrubbed": true }
Wächst täglich
5.5B+Tokens mehrsprachiger Text
150+Sprachen, darunter viele seltene und ressourcenarme
2B+Tokens lizenzgeprüfter Quellcode
700M+Tokens biomedizinischer Text

Die Korpora wachsen täglich. Die genauen aktuellen Zahlen stehen in der Dataset Card.

Berlin · Datenhaltung in der EU · Lizenz je Datensatz geprüft · Auftragsverarbeitung nach Art. 28 DSGVO
Was wir tun

Drei Wege der Zusammenarbeit

Datensätze

Fertige Korpora lizenzieren

Mehrsprachiger Text in über 150 Sprachen, Quellcode einschließlich älterer Unternehmenssprachen und biomedizinische Daten. Jeder Datensatz trägt Lizenz, Sprache und Qualitätswert.

Zu den Datensätzen
B2B-Datenaufbereitung

Eigene Daten aufbereiten lassen

Wir machen aus Ihren Dokumenten, Scans, Audio- und Videodateien strukturierte Trainingsdaten, ohne personenbezogene Daten und mit Auftragsverarbeitungsvertrag. In der EU oder bei Ihnen vor Ort.

So läuft der Service ab
Qualitäts-Benchmark

Einen Datensatz vermessen lassen

Ein gemessener Bericht zu jedem Text- oder Code-Datensatz: Duplikate, personenbezogene Daten, Lizenzkonformität, Syntaxprüfung und Überschneidung mit Evaluationsdatensätzen. Vor und nach der Aufbereitung.

Was der Bericht abdeckt
Unsere Daten

Korpora, die Sie heute lizenzieren können

Drei Korpora, eine Lizenzrichtlinie: ausschließlich gemeinfreie Werke, CC0, CC BY und permissive Code-Lizenzen. Material mit NC-, ND-, SA- oder Copyleft-Lizenz wird bereits bei der Erfassung abgelehnt.

Mehrsprachiger Text

  • Über 5,5 Milliarden Tokens, täglich wachsend
  • Über 150 Sprachen in 140 Fachgebieten
  • Schwerpunkt auf seltenen und ressourcenarmen Sprachen
  • Wissenschaft, Recht, Verwaltung, Medizin, Finanzen, Technik

Quellcode

  • Über 2 Milliarden Tokens, wachsend
  • Legacy: COBOL, Fortran, JCL, PL/I
  • Modern: Rust, Go, Java, C, C++, TypeScript und weitere
  • Nur permissive Lizenzen, je Repository geprüft

Biomedizin und Life Sciences

  • Über 700 Millionen Tokens in 31 Fachgebieten
  • Pharmakologie, Neurologie, Biochemie, Immunologie
  • Strukturierte Daten: Arzneimittelkennzeichnung, Studien, Bindungsaffinitäten
  • Keine Daten auf Patientenebene
Alle Datensätze und Lizenzrichtlinie
Benchmark

Ein Qualitätsbericht für jeden Datensatz

Die meisten Datensätze werden über die Tokenzahl verkauft. Wir messen, was darin steckt: wie viel doppelt vorkommt, welche personenbezogenen Daten erkannt werden, ob Lizenzen zu Ihrer Richtlinie passen, ob Code syntaktisch gültig ist und ob Evaluations-Benchmarks eingesickert sind. Der Bericht enthält nur Zahlen, nie Ihren Text.

  • Text und Code in einem Bericht
  • Vor und nach der Aufbereitung im direkten Vergleich
  • Abgleich mit öffentlichen und Ihren eigenen Evaluationsdatensätzen
  • Lokal ausgeführt: keine Daten verlassen den Rechner
Datenaufbereitung

In vier Schritten von Rohdaten zu Trainingsdaten

Sie senden uns Ihre Rohdaten. Wir liefern produktionsreife Trainingsdatensätze zu Ihrem Termin, vollständig dokumentiert.

01

Rohdaten senden

PDFs, HTML, CSV-Dateien, Audio-Transkripte, Web-Scrapes: jedes Format, jede Sprache, jede Menge.

02

Wir bereinigen und strukturieren

Deduplizierung, Normalisierung, Schema-Design, Entfernung personenbezogener Daten, Qualitätsfilter und Annotation.

03

Formatkonvertierung

Ausgabe als JSONL, Parquet oder in Ihrem eigenen Schema, optimiert und validiert für Ihre Pipeline.

04

Lieferung

Jeder Datensatz wird mit Data Card, Qualitätsbericht mit Kennzahlen und einer Validierungsstichprobe geliefert.

So läuft der Service ab

Ihre Daten verlassen das Haus nicht

Jeder Datensatz wird on-premise in Deutschland und der EU verarbeitet. Zu keinem Zeitpunkt liegen Daten in einem Cloud-Speicher. Auftragsverarbeitungsvertrag (AVV) nach Art. 28 DSGVO bei jedem Projekt. Keine Datenübermittlung in die USA oder andere Drittländer.

AES-256-Verschlüsselung

Daten werden im Ruhezustand mit AES-256-GCM verschlüsselt. Schlüssel werden pro Sitzung gesetzt und nie auf einem Datenträger gespeichert.

EU zuerst · Ausgelegt auf Art. 28 DSGVO

In Berlin angemeldetes Unternehmen. Auftragsverarbeitungsvertrag nach Art. 28 DSGVO und NDA sind für jedes Projekt verfügbar.

AES-256-GCM Art. 28 DSGVO Datenhaltung in der EU NDA Standard
Services

Formate und Services für Ihre Pipeline

JSONL-Erstellung

Instruction-, Chat- und Completion-Formate sowie DPO-Paare, zugeschnitten auf Ihre Modellarchitektur.

Parquet-Konvertierung

Schema-optimierte, spaltenorientierte Parquet-Dateien für Pre-Training im großen Maßstab über Hugging Face, S3 oder BigQuery.

Datenbereinigung

Deduplizierung, Spracherkennung, Normalisierung, Entfernung personenbezogener Daten, Toxizitätsfilter und Qualitätsbewertung.

RAG-Chunking

Dokumentsegmentierung, Chunking-Strategie und Metadaten-Anreicherung für Ihre Pipeline mit Vektordatenbank.

Alle Services ansehen

Sagen Sie uns, welche Daten Sie brauchen oder welche Sie haben

Wir antworten innerhalb eines Werktags mit einer Dataset Card, einem Vorschlag für eine Stichprobe oder einem Projektumfang.

Dataset Card anfordern Preise ansehen