Ihre unstrukturierten Daten, bereit für KI
Wir lassen unsere Pipeline über Ihre Dokumente, Scans, Audio- und Videodateien laufen: Textextraktion, Entfernung personenbezogener Daten, Deduplizierung, Spracherkennung und Qualitätsbewertung. Verarbeitet in Deutschland und der EU mit Auftragsverarbeitungsvertrag oder bei Ihnen vor Ort.
Was hineingeht
- PDFs, auch gescannte Seiten
- Office-Dokumente, HTML und E-Mail-Exporte
- CSV-Dateien, Logs und Datenbank-Exporte
- Audio- und Videoaufnahmen
Was herauskommt
- Strukturiertes JSONL oder Parquet in einem vereinbarten Schema
- Personenbezogene Daten entfernt oder maskiert, nach Ihrer Vorgabe
- Sprache, Qualitätswert und Inhalts-Hash an jedem Datensatz
- Eine Data Card und ein Qualitätsbericht mit Vorher-Nachher-Vergleich
Acht Schritte von Rohdateien zu Trainingsdaten
Dieselbe Pipeline, mit der wir unsere eigenen Korpora aufbauen. Jeder Schritt lässt sich für Ihr Projekt ein- oder ausschalten.
Extrahieren
Text wird aus Dokumenten gelöst. Gescannte Seiten durchlaufen eine Texterkennung (OCR).
Transkribieren
Audio und Video werden konvertiert und in Text transkribiert.
Bereinigen
Kodierungsfehler, Markup, Seitenelemente und Textbausteine werden entfernt. Der Text wird normalisiert.
Personenbezogene Daten entfernen
Namen, E-Mail-Adressen, Telefonnummern, Bankdaten und Kennungen werden erkannt und entfernt oder maskiert.
Deduplizieren
Exakte und nahezu identische Kopien werden gefunden und entfernt, damit im Training nichts übergewichtet wird.
Sprache erkennen
Vier unabhängige Detektoren stimmen ab. Ein Dokument wird akzeptiert, wenn mindestens zwei übereinstimmen.
Qualität bewerten
Jeder Datensatz erhält einen Qualitätswert. Schwache Datensätze werden markiert oder entfernt, ganz nach Ihrer Entscheidung.
Strukturieren und berichten
Ausgabe in Ihrem Schema als JSONL oder Parquet, mit Data Card und Benchmark-Bericht.
Was wir nicht versprechen: Automatische Erkennung personenbezogener Daten findet nicht alles. Wir berichten Erkennungsraten und bekannte Grenzen und vereinbaren für sensible Daten vor der Lieferung einen Prüfschritt mit Ihnen.
Gemacht für Daten, die unter Kontrolle bleiben müssen
Regulierte Organisationen können Daten nicht an einen Cloud-Dienst in einem Drittland geben. Dieser Service ist genau darauf ausgelegt.
Auftragsverarbeitungsvertrag
Ein Vertrag nach Art. 28 DSGVO wird unterzeichnet, bevor Daten verarbeitet werden. Ein NDA ist Standard.
Verarbeitung in Deutschland und der EU
Ihre Daten werden auf unseren eigenen Rechnern in Deutschland und der EU verarbeitet oder auf Ihren. Keine Übermittlung in Drittländer.
Verschlüsselung
Verschlüsselung im Ruhezustand mit AES-256-GCM. Schlüssel werden pro Sitzung gehalten und nie gespeichert.
Löschung
Nach der Lieferung werden Ihre Daten gelöscht, und Sie erhalten eine schriftliche Bestätigung.
Auf unseren Rechnern oder auf Ihren
| Auf unseren Rechnern | Bei Ihnen vor Ort | |
|---|---|---|
| Ablauf | Sie übertragen die Daten verschlüsselt. Wir verarbeiten sie in Deutschland und der EU und löschen sie nach der Lieferung. | Wir betreiben die Pipeline in Ihrer Umgebung, per Fernzugriff auf einem von Ihnen gestellten Rechner oder vor Ort. |
| Geeignet für | KI-Teams, Softwareunternehmen und Daten, die Ihr Netzwerk vertraglich geregelt verlassen dürfen. | Banken, Versicherungen, Gesundheitswesen, Pharma und Behörden, deren Daten das Haus nicht verlassen dürfen. |
| Ihre Daten | Nur für die Projektdauer verschlüsselt vorgehalten. | Verlassen Ihre Infrastruktur zu keinem Zeitpunkt. |
Organisationen mit Archiven, die KI noch nicht nutzen kann
Banken und Versicherungen
Verträge, Korrespondenz und Akten werden zu Trainings- und Retrieval-Daten ohne personenbezogene Angaben.
Gesundheitswesen und Pharma
Berichte, Studienunterlagen und Sprachaufnahmen, aufbereitet für Fachmodelle unter strengem Datenschutz.
Öffentliche Hand und Recht
Gescannte Akten, Entscheidungen und Verwaltungsdokumente werden durchsuchbar und nutzbar.
Beratungen und Datenanbieter
Die Pipeline ist als White-Label verfügbar. So bieten Sie Datenaufbereitung Ihren eigenen Kunden unter Ihrem Namen an.
Klein anfangen, dann skalieren
Klärung
Ein Gespräch über Ihre Daten, Formate, Mengen und Datenschutzanforderungen.
Pilot
Wir bereiten eine Stichprobe von rund 1.000 Datensätzen auf und zeigen das Ergebnis mit Qualitätsbericht.
Angebot
Ein Festpreis auf Grundlage des Piloten, nicht auf Grundlage einer Schätzung.
Vollständiger Lauf
Der gesamte Datenbestand durchläuft die Pipeline. Sie sehen Fortschritt und Zwischenstände.
Lieferung
Daten, Data Card und Bericht werden geliefert. Ihre Ausgangsdaten werden gelöscht, mit Bestätigung.
Fragen zur Datenaufbereitung
Müssen unsere Daten unser Haus verlassen?
Nein. Die Pipeline kann in Ihrer Umgebung auf einem von Ihnen gestellten Rechner laufen. Alternativ übertragen Sie die Daten mit Auftragsverarbeitungsvertrag an uns, und wir verarbeiten sie in Deutschland und der EU.
Schließen Sie einen Auftragsverarbeitungsvertrag ab?
Ja. Ein Vertrag nach Art. 28 DSGVO wird unterzeichnet, bevor wir Daten erhalten, zusammen mit einem NDA.
Welche Dateitypen können Sie verarbeiten?
PDF einschließlich Scans, Office-Dokumente, HTML, reiner Text, CSV und Datenbank-Exporte sowie Audio- und Videodateien. Scans durchlaufen OCR, Aufnahmen eine Spracherkennung.
Welche Sprachen werden unterstützt?
Die Spracherkennung deckt sehr viele Sprachen ab, auch ressourcenarme, denn die Pipeline wurde für ein Korpus mit 150 Sprachen gebaut. Die Qualität von OCR und Spracherkennung hängt von der Sprache ab. Auch deshalb beginnen wir mit einem Piloten.
Was kostet das?
Der Preis wird je Projekt festgelegt und hängt von Menge, Formaten und Betriebsmodell ab. Der Pilot liefert beiden Seiten belastbare Zahlen, daraus folgt das Angebot.
Beschreiben Sie uns Ihre Daten
Formate, ungefähre Menge und der geplante Einsatz. Wir antworten mit einem Vorschlag für einen Piloten.
Pilot anfragen