Services

Was wir tun

Datenstrukturierung aus einer Hand für LLM-Fine-Tuning, Pre-Training, Evaluation und RAG-Pipelines.

01 · Erstellung von JSONL-Datensätzen

Trainingsdaten, aus denen Ihr Modell wirklich lernt

Wir entwerfen, erstellen und validieren JSONL-Datensätze für das Fine-Tuning. Das Schema jedes Datensatzes ist auf Ihre Modellarchitektur abgestimmt, Format, Qualitätsfilter und Annotation auf Ihren Anwendungsfall.

instruction-tuning DPO pairs RLHF chat format completion
Service anfragen
1

Schema-Design

Wir legen die genaue JSON-Struktur fest, die Ihr Trainings-Framework braucht, zum Beispiel OpenAI, Hugging Face oder Axolotl.

2

Datentransformation

Rohdaten werden konvertiert, bereinigt und in das vereinbarte Schema gebracht, einschließlich Deduplizierung und Normalisierung.

3

Qualitätsprüfung

Jede Zeile wird gegen das Schema geprüft. Sie erhält einen Qualitätswert, markierte Zeilen werden manuell geprüft.

4

Lieferung mit Data Card

Fertige JSONL-Datei, Data Card, Statistikbericht und ein Validierungsset als Stichprobe.

02 · Parquet-Konvertierung

Große Datensätze, spaltenorientiert und schnell

Wir konvertieren große Rohdatenbestände in schema-optimierte Parquet-Dateien, bereit für den Import über Hugging Face Datasets, Apache Spark, S3, BigQuery oder einen anderen spaltenorientierten Datenspeicher.

Pre-Training columnar HuggingFace Spark
Service anfragen

Ausgabeformate, die wir liefern

.parquetspaltenbasiert, komprimiert
.jsonlJSON, eine Zeile pro Datensatz
.arrowApache Arrow IPC
.csvauf Anfrage
HF Datasetpush_to_hub ready
IndividuellIhr Schema
03 · Datenbereinigung und QA

Saubere Daten sind die Grundlage jedes guten Modells

Ihr Rohkorpus durchläuft unsere vollständige Bereinigungspipeline: Deduplizierung, Spracherkennung, Normalisierung, Entfernung personenbezogener Daten, Toxizitätsfilter und Qualitätsbewertung. Sie erhalten einen bereinigten, geprüften Datensatz mit vollständigem Bericht.

Deduplizierung PII-Entfernung Sprachfilter Qualitätswert Toxizitätsfilter
Service anfragen
Entfernte doppelte Zeilen 12.4%
Entfernte personenbezogene Angaben 847
Aussortierte Zeilen geringer Qualität 3.1%
Qualitätswert nach Bereinigung 0.97 / 1.00
04 · Evaluationsdatensätze

Wissen, ob Ihr Modell wirklich besser wird

Wir erstellen zurückgehaltene Evaluations- und Benchmark-Datensätze mit von Menschen geprüften Ground-Truth-Labels. Sie sind darauf ausgelegt, Schwächen des Modells aufzudecken und den Fortschritt des Fine-Tunings über mehrere Trainingsläufe zu verfolgen.

benchmarks menschliche Labels Held-out-Sets Annotator-Übereinstimmung
Service anfragen
1

Aufgabendefinition

Gemeinsam mit Ihnen legen wir Bewertungsdimensionen, Bewertungsraster und die Abdeckung von Grenzfällen fest.

2

Menschliche Annotation

Labels werden von menschlichen Prüfern erstellt und geprüft, die Übereinstimmung zwischen den Annotatoren wird gemessen.

3

Lieferung des Benchmarks

Evaluationsdatensatz als JSONL und Parquet mit Bewertungsskript. Direkt in Ihre Evaluationsumgebung einsetzbar.

05 · RAG-Chunking

Retrieval-Daten, die wirklich gefunden werden

Wir segmentieren und chunken Dokumente für Pipelines mit Retrieval-Augmented Generation und reichern sie mit Metadaten an. Chunking-Strategie, Überlappung und Metadaten-Anreicherung stimmen wir auf Ihre Vektordatenbank und Ihr Embedding-Modell ab.

RAG embeddings chunking Metadaten bereit für Vektordatenbanken
Service anfragen
"chunk_id": "doc_42_chunk_7",
"text": "The transformer architecture...",
"tokens": 256,
"overlap": 32,
"source_page": 14

Kompatibel mit Pinecone, Weaviate, Qdrant, pgvector, Chroma und weiteren.

06 · Individuelle Pipelines

Wiederkehrende Pipelines, passend zu Ihrem Workflow

Für Teams mit laufendem Datenbedarf bauen wir wiederholbare Pipelines für die Stapelverarbeitung: wöchentliche Jobs, Formatkonverter, Annotationswerkzeuge und automatisierte QA-Berichte, die ohne manuelles Eingreifen laufen.

wiederkehrende Aufträge Automatisierung Annotationswerkzeuge QA-Berichte
Sprechen wir darüber
Wöchentlicher Lauf · jeden Montag 02:00 UTC
Automatischer QA-Bericht per E-Mail
2 Zeilen zur manuellen Prüfung markiert
48.291 Zeilen geliefert · Durchschnittswert 0,97
07 · Datenaufbereitung vor Ort
On-Premise in Deutschland und der EU · kein Cloud-Speicher

Für Organisationen, deren Daten das Haus nicht verlassen dürfen

Banken, Gesundheitseinrichtungen, Behörden und andere regulierte Organisationen können unsere vollständige Aufbereitungspipeline komplett on-premise laufen lassen: Entfernung personenbezogener Daten, Deduplizierung, Strukturierung und Qualitätsbewertung. Kein Cloud-Speicher, keine US-Server, durchgehend AES-256-Verschlüsselung, geliefert auf Grundlage eines unterzeichneten Auftragsverarbeitungsvertrags (AVV) nach Art. 28 DSGVO.

on-premise keine Cloud AES-256 AVV nach Art. 28 Banken & Gesundheitswesen Behörden
Aufbereitung vor Ort besprechen Mehr zur Datenaufbereitung
Ihre Server oder unsere in Deutschland, nie in der Cloud
AES-256-Verschlüsselung im Ruhezustand, während der gesamten Verarbeitung
Unterzeichneter Auftragsverarbeitungsvertrag (Art. 28 DSGVO)
Keine Übertragung in die Cloud, technisch ausgeschlossen und nicht nur per Richtlinie
Loslegen

Noch unsicher, welchen Service Sie brauchen?

Beschreiben Sie uns Ihre Daten und Ihr Ziel. Wir sagen Ihnen genau, was damit zu tun ist.

Anfragen Preise ansehen