Datenstrukturierung aus einer Hand für LLM-Fine-Tuning, Pre-Training, Evaluation und RAG-Pipelines.
Wir entwerfen, erstellen und validieren JSONL-Datensätze für das Fine-Tuning. Das Schema jedes Datensatzes ist auf Ihre Modellarchitektur abgestimmt, Format, Qualitätsfilter und Annotation auf Ihren Anwendungsfall.
Service anfragenWir legen die genaue JSON-Struktur fest, die Ihr Trainings-Framework braucht, zum Beispiel OpenAI, Hugging Face oder Axolotl.
Rohdaten werden konvertiert, bereinigt und in das vereinbarte Schema gebracht, einschließlich Deduplizierung und Normalisierung.
Jede Zeile wird gegen das Schema geprüft. Sie erhält einen Qualitätswert, markierte Zeilen werden manuell geprüft.
Fertige JSONL-Datei, Data Card, Statistikbericht und ein Validierungsset als Stichprobe.
Wir konvertieren große Rohdatenbestände in schema-optimierte Parquet-Dateien, bereit für den Import über Hugging Face Datasets, Apache Spark, S3, BigQuery oder einen anderen spaltenorientierten Datenspeicher.
Service anfragenAusgabeformate, die wir liefern
Ihr Rohkorpus durchläuft unsere vollständige Bereinigungspipeline: Deduplizierung, Spracherkennung, Normalisierung, Entfernung personenbezogener Daten, Toxizitätsfilter und Qualitätsbewertung. Sie erhalten einen bereinigten, geprüften Datensatz mit vollständigem Bericht.
Service anfragenWir erstellen zurückgehaltene Evaluations- und Benchmark-Datensätze mit von Menschen geprüften Ground-Truth-Labels. Sie sind darauf ausgelegt, Schwächen des Modells aufzudecken und den Fortschritt des Fine-Tunings über mehrere Trainingsläufe zu verfolgen.
Service anfragenGemeinsam mit Ihnen legen wir Bewertungsdimensionen, Bewertungsraster und die Abdeckung von Grenzfällen fest.
Labels werden von menschlichen Prüfern erstellt und geprüft, die Übereinstimmung zwischen den Annotatoren wird gemessen.
Evaluationsdatensatz als JSONL und Parquet mit Bewertungsskript. Direkt in Ihre Evaluationsumgebung einsetzbar.
Wir segmentieren und chunken Dokumente für Pipelines mit Retrieval-Augmented Generation und reichern sie mit Metadaten an. Chunking-Strategie, Überlappung und Metadaten-Anreicherung stimmen wir auf Ihre Vektordatenbank und Ihr Embedding-Modell ab.
Service anfragenKompatibel mit Pinecone, Weaviate, Qdrant, pgvector, Chroma und weiteren.
Für Teams mit laufendem Datenbedarf bauen wir wiederholbare Pipelines für die Stapelverarbeitung: wöchentliche Jobs, Formatkonverter, Annotationswerkzeuge und automatisierte QA-Berichte, die ohne manuelles Eingreifen laufen.
Sprechen wir darüberBanken, Gesundheitseinrichtungen, Behörden und andere regulierte Organisationen können unsere vollständige Aufbereitungspipeline komplett on-premise laufen lassen: Entfernung personenbezogener Daten, Deduplizierung, Strukturierung und Qualitätsbewertung. Kein Cloud-Speicher, keine US-Server, durchgehend AES-256-Verschlüsselung, geliefert auf Grundlage eines unterzeichneten Auftragsverarbeitungsvertrags (AVV) nach Art. 28 DSGVO.
Aufbereitung vor Ort besprechen Mehr zur DatenaufbereitungBeschreiben Sie uns Ihre Daten und Ihr Ziel. Wir sagen Ihnen genau, was damit zu tun ist.