Curation de données B2B

Vos données non structurées, prêtes pour l'IA

Nous appliquons notre pipeline de curation à vos documents, scans, fichiers audio et vidéo : extraction du texte, suppression des données personnelles, déduplication, détection de la langue et score de qualité. Le traitement a lieu en Allemagne et dans l'UE dans le cadre d'un contrat de sous-traitance, ou sur site, dans vos locaux.

Ce qui entre

  • PDF, y compris les pages scannées
  • Documents bureautiques, HTML et exports d'e-mails
  • Fichiers CSV, journaux et exports de bases de données
  • Enregistrements audio et vidéo

Ce qui sort

  • JSONL ou Parquet structuré selon un schéma convenu
  • Données personnelles supprimées ou masquées selon votre politique
  • Langue, score de qualité et empreinte du contenu pour chaque enregistrement
  • Une fiche du jeu de données et un rapport de qualité avant et après
Le pipeline

Huit étapes, des fichiers bruts aux données d'entraînement

C'est le pipeline qui produit nos propres corpus. Chaque étape peut être activée ou désactivée pour votre projet.

Extraire

Le texte est extrait des documents. Les pages scannées passent par la reconnaissance optique de caractères.

Tesseract OCR

Transcrire

Les fichiers audio et vidéo sont convertis, puis transcrits en texte.

ffmpegWhisper

Nettoyer

Les erreurs d'encodage, le balisage, les éléments de page récurrents et les textes passe-partout sont supprimés. Le texte est normalisé.

pandas

Supprimer les données personnelles

Noms, adresses e-mail, numéros de téléphone, coordonnées bancaires et identifiants sont détectés, puis supprimés ou masqués.

NERpattern rules

Dédupliquer

Les copies exactes et les quasi-copies sont repérées et supprimées, afin qu'aucun contenu ne soit surpondéré à l'entraînement.

content hashMinHash

Détecter la langue

Quatre détecteurs indépendants votent. Un document est accepté lorsqu'au moins deux d'entre eux concordent.

GlotLIDfastTextLingualangdetect

Évaluer la qualité

Chaque enregistrement reçoit un score de qualité. Les enregistrements mal notés sont signalés ou supprimés, selon votre choix.

Structurer et documenter

Livraison dans votre schéma, en JSONL ou Parquet, avec une fiche du jeu de données et un rapport de benchmark.

JSONLParquet

Ce que nous ne promettons pas : la détection automatique des données personnelles ne trouve pas tout. Nous communiquons les taux détectés et les limites connues. Pour les données sensibles, nous convenons avec vous d'une étape de relecture avant la livraison.

Protection des données

Conçu pour les données qui doivent rester sous contrôle

Les organisations réglementées ne peuvent pas confier leurs données à un service cloud situé dans un pays tiers. Ce service est conçu autour de cette contrainte.

Contrat de sous-traitance

Un contrat au sens de l'art. 28 du RGPD est signé avant toute manipulation de données. Un NDA est systématique.

Traitement en Allemagne et dans l'UE

Vos données sont traitées sur nos propres machines en Allemagne et dans l'UE, ou sur les vôtres. Aucun transfert vers des pays tiers.

Chiffrement

Chiffrement au repos en AES-256-GCM. Les clés sont conservées par session et ne sont jamais écrites sur disque.

Suppression

Après la livraison, vos données sont supprimées et vous en recevez la confirmation écrite.

Deux modes d'exécution

Sur nos machines ou sur les vôtres

Sur nos machinesSur site
FonctionnementVous nous envoyez les données par transfert chiffré. Nous les traitons en Allemagne et dans l'UE, puis nous les supprimons après la livraison.Nous exécutons le pipeline dans votre environnement, à distance sur une machine que vous mettez à disposition, ou dans vos locaux.
Adapté àÉquipes IA, éditeurs de logiciels et données pouvant quitter votre réseau dans un cadre contractuel.Banques, assureurs, santé, industrie pharmaceutique et organismes publics dont les données ne doivent pas sortir des murs.
Vos donnéesConservées chiffrées, uniquement pendant la durée du projet.Ne quittent jamais votre infrastructure.
À qui s'adresse ce service

Aux organisations dont les archives ne sont pas encore exploitables par l'IA

Banques et assureurs

Contrats, correspondance et dossiers transformés en données d'entraînement et de recherche documentaire, sans informations personnelles.

Santé et pharma

Comptes rendus, documents d'étude et enregistrements vocaux préparés pour des modèles spécialisés, sous une protection stricte des données.

Secteur public et juridique

Dossiers scannés, décisions de justice et documents administratifs rendus interrogeables et exploitables.

Cabinets de conseil et fournisseurs de données

Le pipeline est disponible en marque blanche. Vous pouvez ainsi proposer la curation à vos propres clients, sous votre nom.

Déroulement d'une mission

Commencer petit, puis monter en charge

Cadrage

Un échange sur vos données, vos formats, vos volumes et vos exigences de protection des données.

Pilote

Nous traitons un échantillon d'environ 1 000 enregistrements et présentons le résultat avec un rapport de qualité.

Devis

Un prix fixe fondé sur les résultats du pilote, pas sur une supposition.

Traitement complet

L'ensemble du jeu de données passe par le pipeline. Vous suivez l'avancement et les chiffres intermédiaires.

Livraison

Les données, la fiche du jeu de données et le rapport sont livrés. Vos données sources sont supprimées et la suppression vous est confirmée.

Questions sur la curation de données

Nos données doivent-elles quitter nos locaux ?

Non. Le pipeline peut s'exécuter dans votre environnement, sur une machine que vous mettez à disposition. Si vous préférez, vous nous envoyez les données dans le cadre d'un contrat de sous-traitance et nous les traitons en Allemagne et dans l'UE.

Signez-vous un contrat de sous-traitance ?

Oui. Un contrat au sens de l'art. 28 du RGPD est signé avant que nous ne recevions la moindre donnée, accompagné d'un NDA.

Quels types de fichiers pouvez-vous traiter ?

Les PDF, scans compris, les documents bureautiques, le HTML, le texte brut, les exports CSV et de bases de données, ainsi que les fichiers audio et vidéo. Les scans passent par l'OCR et les enregistrements par la transcription automatique de la parole.

Quelles langues sont prises en charge ?

La détection de la langue couvre un très large éventail de langues, y compris des langues peu dotées, car le pipeline a été conçu pour un corpus de 150 langues. La qualité de l'OCR et de la transcription de la parole varie selon la langue. C'est l'une des raisons pour lesquelles nous commençons par un pilote.

Combien cela coûte-t-il ?

Le tarif est établi par projet et dépend du volume, des formats et du mode de livraison. Le pilote fournit aux deux parties des chiffres réels, et le devis en découle.

Envoyez-nous une description de vos données

Formats, volume approximatif et usage prévu. Nous vous répondons avec une proposition de pilote.

Demander un pilote