Vos données non structurées, prêtes pour l'IA
Nous appliquons notre pipeline de curation à vos documents, scans, fichiers audio et vidéo : extraction du texte, suppression des données personnelles, déduplication, détection de la langue et score de qualité. Le traitement a lieu en Allemagne et dans l'UE dans le cadre d'un contrat de sous-traitance, ou sur site, dans vos locaux.
Ce qui entre
- PDF, y compris les pages scannées
- Documents bureautiques, HTML et exports d'e-mails
- Fichiers CSV, journaux et exports de bases de données
- Enregistrements audio et vidéo
Ce qui sort
- JSONL ou Parquet structuré selon un schéma convenu
- Données personnelles supprimées ou masquées selon votre politique
- Langue, score de qualité et empreinte du contenu pour chaque enregistrement
- Une fiche du jeu de données et un rapport de qualité avant et après
Huit étapes, des fichiers bruts aux données d'entraînement
C'est le pipeline qui produit nos propres corpus. Chaque étape peut être activée ou désactivée pour votre projet.
Extraire
Le texte est extrait des documents. Les pages scannées passent par la reconnaissance optique de caractères.
Transcrire
Les fichiers audio et vidéo sont convertis, puis transcrits en texte.
Nettoyer
Les erreurs d'encodage, le balisage, les éléments de page récurrents et les textes passe-partout sont supprimés. Le texte est normalisé.
Supprimer les données personnelles
Noms, adresses e-mail, numéros de téléphone, coordonnées bancaires et identifiants sont détectés, puis supprimés ou masqués.
Dédupliquer
Les copies exactes et les quasi-copies sont repérées et supprimées, afin qu'aucun contenu ne soit surpondéré à l'entraînement.
Détecter la langue
Quatre détecteurs indépendants votent. Un document est accepté lorsqu'au moins deux d'entre eux concordent.
Évaluer la qualité
Chaque enregistrement reçoit un score de qualité. Les enregistrements mal notés sont signalés ou supprimés, selon votre choix.
Structurer et documenter
Livraison dans votre schéma, en JSONL ou Parquet, avec une fiche du jeu de données et un rapport de benchmark.
Ce que nous ne promettons pas : la détection automatique des données personnelles ne trouve pas tout. Nous communiquons les taux détectés et les limites connues. Pour les données sensibles, nous convenons avec vous d'une étape de relecture avant la livraison.
Conçu pour les données qui doivent rester sous contrôle
Les organisations réglementées ne peuvent pas confier leurs données à un service cloud situé dans un pays tiers. Ce service est conçu autour de cette contrainte.
Contrat de sous-traitance
Un contrat au sens de l'art. 28 du RGPD est signé avant toute manipulation de données. Un NDA est systématique.
Traitement en Allemagne et dans l'UE
Vos données sont traitées sur nos propres machines en Allemagne et dans l'UE, ou sur les vôtres. Aucun transfert vers des pays tiers.
Chiffrement
Chiffrement au repos en AES-256-GCM. Les clés sont conservées par session et ne sont jamais écrites sur disque.
Suppression
Après la livraison, vos données sont supprimées et vous en recevez la confirmation écrite.
Sur nos machines ou sur les vôtres
| Sur nos machines | Sur site | |
|---|---|---|
| Fonctionnement | Vous nous envoyez les données par transfert chiffré. Nous les traitons en Allemagne et dans l'UE, puis nous les supprimons après la livraison. | Nous exécutons le pipeline dans votre environnement, à distance sur une machine que vous mettez à disposition, ou dans vos locaux. |
| Adapté à | Équipes IA, éditeurs de logiciels et données pouvant quitter votre réseau dans un cadre contractuel. | Banques, assureurs, santé, industrie pharmaceutique et organismes publics dont les données ne doivent pas sortir des murs. |
| Vos données | Conservées chiffrées, uniquement pendant la durée du projet. | Ne quittent jamais votre infrastructure. |
Aux organisations dont les archives ne sont pas encore exploitables par l'IA
Banques et assureurs
Contrats, correspondance et dossiers transformés en données d'entraînement et de recherche documentaire, sans informations personnelles.
Santé et pharma
Comptes rendus, documents d'étude et enregistrements vocaux préparés pour des modèles spécialisés, sous une protection stricte des données.
Secteur public et juridique
Dossiers scannés, décisions de justice et documents administratifs rendus interrogeables et exploitables.
Cabinets de conseil et fournisseurs de données
Le pipeline est disponible en marque blanche. Vous pouvez ainsi proposer la curation à vos propres clients, sous votre nom.
Commencer petit, puis monter en charge
Cadrage
Un échange sur vos données, vos formats, vos volumes et vos exigences de protection des données.
Pilote
Nous traitons un échantillon d'environ 1 000 enregistrements et présentons le résultat avec un rapport de qualité.
Devis
Un prix fixe fondé sur les résultats du pilote, pas sur une supposition.
Traitement complet
L'ensemble du jeu de données passe par le pipeline. Vous suivez l'avancement et les chiffres intermédiaires.
Livraison
Les données, la fiche du jeu de données et le rapport sont livrés. Vos données sources sont supprimées et la suppression vous est confirmée.
Questions sur la curation de données
Nos données doivent-elles quitter nos locaux ?
Non. Le pipeline peut s'exécuter dans votre environnement, sur une machine que vous mettez à disposition. Si vous préférez, vous nous envoyez les données dans le cadre d'un contrat de sous-traitance et nous les traitons en Allemagne et dans l'UE.
Signez-vous un contrat de sous-traitance ?
Oui. Un contrat au sens de l'art. 28 du RGPD est signé avant que nous ne recevions la moindre donnée, accompagné d'un NDA.
Quels types de fichiers pouvez-vous traiter ?
Les PDF, scans compris, les documents bureautiques, le HTML, le texte brut, les exports CSV et de bases de données, ainsi que les fichiers audio et vidéo. Les scans passent par l'OCR et les enregistrements par la transcription automatique de la parole.
Quelles langues sont prises en charge ?
La détection de la langue couvre un très large éventail de langues, y compris des langues peu dotées, car le pipeline a été conçu pour un corpus de 150 langues. La qualité de l'OCR et de la transcription de la parole varie selon la langue. C'est l'une des raisons pour lesquelles nous commençons par un pilote.
Combien cela coûte-t-il ?
Le tarif est établi par projet et dépend du volume, des formats et du mode de livraison. Le pilote fournit aux deux parties des chiffres réels, et le devis en découle.
Envoyez-nous une description de vos données
Formats, volume approximatif et usage prévu. Nous vous répondons avec une proposition de pilote.
Demander un pilote