Lizenzierte KI-Trainingsdaten.
Und die Pipeline für Ihre eigenen Daten.
CurateLM liefert lizenzgeprüfte Text- und Code-Korpora für das Training von Sprachmodellen. Dieselbe Pipeline bereitet auch Ihre eigenen Daten auf: Entfernung personenbezogener Daten, Deduplizierung, Spracherkennung und Qualitätsbewertung, verarbeitet in Deutschland und der EU.
Die Korpora wachsen täglich. Die genauen aktuellen Zahlen stehen in der Dataset Card.
Drei Wege der Zusammenarbeit
Fertige Korpora lizenzieren
Mehrsprachiger Text in über 150 Sprachen, Quellcode einschließlich älterer Unternehmenssprachen und biomedizinische Daten. Jeder Datensatz trägt Lizenz, Sprache und Qualitätswert.
Zu den DatensätzenEigene Daten aufbereiten lassen
Wir machen aus Ihren Dokumenten, Scans, Audio- und Videodateien strukturierte Trainingsdaten, ohne personenbezogene Daten und mit Auftragsverarbeitungsvertrag. In der EU oder bei Ihnen vor Ort.
So läuft der Service abEinen Datensatz vermessen lassen
Ein gemessener Bericht zu jedem Text- oder Code-Datensatz: Duplikate, personenbezogene Daten, Lizenzkonformität, Syntaxprüfung und Überschneidung mit Evaluationsdatensätzen. Vor und nach der Aufbereitung.
Was der Bericht abdecktKorpora, die Sie heute lizenzieren können
Drei Korpora, eine Lizenzrichtlinie: ausschließlich gemeinfreie Werke, CC0, CC BY und permissive Code-Lizenzen. Material mit NC-, ND-, SA- oder Copyleft-Lizenz wird bereits bei der Erfassung abgelehnt.
Mehrsprachiger Text
- Über 5,5 Milliarden Tokens, täglich wachsend
- Über 150 Sprachen in 140 Fachgebieten
- Schwerpunkt auf seltenen und ressourcenarmen Sprachen
- Wissenschaft, Recht, Verwaltung, Medizin, Finanzen, Technik
Quellcode
- Über 2 Milliarden Tokens, wachsend
- Legacy: COBOL, Fortran, JCL, PL/I
- Modern: Rust, Go, Java, C, C++, TypeScript und weitere
- Nur permissive Lizenzen, je Repository geprüft
Biomedizin und Life Sciences
- Über 700 Millionen Tokens in 31 Fachgebieten
- Pharmakologie, Neurologie, Biochemie, Immunologie
- Strukturierte Daten: Arzneimittelkennzeichnung, Studien, Bindungsaffinitäten
- Keine Daten auf Patientenebene
Ein Qualitätsbericht für jeden Datensatz
Die meisten Datensätze werden über die Tokenzahl verkauft. Wir messen, was darin steckt: wie viel doppelt vorkommt, welche personenbezogenen Daten erkannt werden, ob Lizenzen zu Ihrer Richtlinie passen, ob Code syntaktisch gültig ist und ob Evaluations-Benchmarks eingesickert sind. Der Bericht enthält nur Zahlen, nie Ihren Text.
- Text und Code in einem Bericht
- Vor und nach der Aufbereitung im direkten Vergleich
- Abgleich mit öffentlichen und Ihren eigenen Evaluationsdatensätzen
- Lokal ausgeführt: keine Daten verlassen den Rechner
In vier Schritten von Rohdaten zu Trainingsdaten
Sie senden uns Ihre Rohdaten. Wir liefern produktionsreife Trainingsdatensätze zu Ihrem Termin, vollständig dokumentiert.
Rohdaten senden
PDFs, HTML, CSV-Dateien, Audio-Transkripte, Web-Scrapes: jedes Format, jede Sprache, jede Menge.
Wir bereinigen und strukturieren
Deduplizierung, Normalisierung, Schema-Design, Entfernung personenbezogener Daten, Qualitätsfilter und Annotation.
Formatkonvertierung
Ausgabe als JSONL, Parquet oder in Ihrem eigenen Schema, optimiert und validiert für Ihre Pipeline.
Lieferung
Jeder Datensatz wird mit Data Card, Qualitätsbericht mit Kennzahlen und einer Validierungsstichprobe geliefert.
Ihre Daten verlassen das Haus nicht
Jeder Datensatz wird on-premise in Deutschland und der EU verarbeitet. Zu keinem Zeitpunkt liegen Daten in einem Cloud-Speicher. Auftragsverarbeitungsvertrag (AVV) nach Art. 28 DSGVO bei jedem Projekt. Keine Datenübermittlung in die USA oder andere Drittländer.
AES-256-Verschlüsselung
Daten werden im Ruhezustand mit AES-256-GCM verschlüsselt. Schlüssel werden pro Sitzung gesetzt und nie auf einem Datenträger gespeichert.
EU zuerst · Ausgelegt auf Art. 28 DSGVO
In Berlin angemeldetes Unternehmen. Auftragsverarbeitungsvertrag nach Art. 28 DSGVO und NDA sind für jedes Projekt verfügbar.
Formate und Services für Ihre Pipeline
JSONL-Erstellung
Instruction-, Chat- und Completion-Formate sowie DPO-Paare, zugeschnitten auf Ihre Modellarchitektur.
Parquet-Konvertierung
Schema-optimierte, spaltenorientierte Parquet-Dateien für Pre-Training im großen Maßstab über Hugging Face, S3 oder BigQuery.
Datenbereinigung
Deduplizierung, Spracherkennung, Normalisierung, Entfernung personenbezogener Daten, Toxizitätsfilter und Qualitätsbewertung.
RAG-Chunking
Dokumentsegmentierung, Chunking-Strategie und Metadaten-Anreicherung für Ihre Pipeline mit Vektordatenbank.
Sagen Sie uns, welche Daten Sie brauchen oder welche Sie haben
Wir antworten innerhalb eines Werktags mit einer Dataset Card, einem Vorschlag für eine Stichprobe oder einem Projektumfang.