Data curation B2B

I vostri dati non strutturati, pronti per l'IA

Applichiamo la nostra pipeline di curation a documenti, scansioni, audio e video: estrazione del testo, rimozione dei dati personali, deduplicazione, rilevamento della lingua e punteggio di qualità. Trattamento in Germania e nell'UE con un accordo sul trattamento dei dati, oppure presso la vostra sede.

Cosa entra

  • PDF, comprese le pagine scansionate
  • Documenti Office, HTML ed esportazioni di e-mail
  • File CSV, log ed esportazioni di database
  • Registrazioni audio e video

Cosa esce

  • JSONL o Parquet strutturati secondo uno schema concordato
  • Dati personali rimossi o mascherati secondo la vostra policy
  • Lingua, punteggio di qualità e hash del contenuto su ogni record
  • Una scheda dei dati e un report di qualità prima e dopo
La pipeline

Otto passaggi dai file grezzi ai dati di addestramento

La stessa pipeline con cui costruiamo i nostri corpora. Ogni passaggio può essere attivato o disattivato per il vostro progetto.

Estrazione

Il testo viene estratto dai documenti. Le pagine scansionate passano dal riconoscimento ottico dei caratteri.

Tesseract OCR

Trascrizione

Audio e video vengono convertiti e trascritti in testo.

ffmpegWhisper

Pulizia

Vengono rimossi errori di codifica, markup, elementi di impaginazione e testo standard ripetuto. Il testo viene normalizzato.

pandas

Rimozione dei dati personali

Nomi, indirizzi e-mail, numeri di telefono, coordinate bancarie e identificativi vengono rilevati e rimossi o mascherati.

NERpattern rules

Deduplicazione

Le copie esatte e quelle quasi identiche vengono individuate e rimosse, così nulla pesa troppo nell'addestramento.

content hashMinHash

Rilevamento della lingua

Votano quattro rilevatori indipendenti. Un documento viene accettato quando almeno due concordano.

GlotLIDfastTextLingualangdetect

Punteggio di qualità

Ogni record riceve un punteggio di qualità. I record con punteggio basso vengono segnalati o rimossi, a vostra scelta.

Struttura e report

Output nel vostro schema in JSONL o Parquet, con una scheda dei dati e un report di benchmark.

JSONLParquet

Cosa non promettiamo: il rilevamento automatico dei dati personali non trova tutto. Riportiamo i tassi di rilevamento e i limiti noti e, per i dati sensibili, concordiamo con voi una fase di revisione prima della consegna.

Protezione dei dati

Pensato per i dati che devono restare sotto controllo

Le organizzazioni regolamentate non possono affidare i dati a un servizio cloud in un paese terzo. Questo servizio è progettato attorno a questo vincolo.

Accordo sul trattamento dei dati

Un accordo ai sensi dell'art. 28 del GDPR viene firmato prima di toccare qualsiasi dato. L'NDA è la prassi.

Trattamento in Germania e nell'UE

I vostri dati vengono trattati sulle nostre macchine in Germania e nell'UE, oppure sulle vostre. Nessun trasferimento verso paesi terzi.

Cifratura

Cifratura dei dati a riposo con AES-256-GCM. Le chiavi sono mantenute per sessione e non vengono mai scritte su disco.

Cancellazione

Dopo la consegna i vostri dati vengono cancellati e ricevete una conferma scritta.

Due modalità operative

Sulle nostre macchine o sulle vostre

Sulle nostre macchinePresso la vostra sede
Come funzionaInviate i dati con un trasferimento cifrato. Li trattiamo in Germania e nell'UE e li cancelliamo dopo la consegna.Eseguiamo la pipeline nel vostro ambiente, da remoto su una macchina messa a disposizione da voi oppure in sede.
Adatto aTeam di IA, aziende di software e dati che possono uscire dalla vostra rete in base a un contratto.Banche, assicurazioni, sanità, settore farmaceutico ed enti pubblici i cui dati non possono lasciare l'edificio.
I vostri datiConservati in forma cifrata solo per la durata del progetto.Non lasciano mai la vostra infrastruttura.
A chi si rivolge

Organizzazioni con archivi che l'IA non può ancora usare

Banche e assicurazioni

Contratti, corrispondenza e fascicoli trasformati in dati per l'addestramento e il retrieval, senza dati personali.

Sanità e settore farmaceutico

Referti, documenti di studio e registrazioni vocali preparati per modelli di dominio, nel rispetto di una rigorosa protezione dei dati.

Settore pubblico e legale

Atti scansionati, sentenze e documenti amministrativi resi ricercabili e utilizzabili.

Società di consulenza e fornitori di dati

La pipeline è disponibile in white label, così potete offrire la data curation ai vostri clienti con il vostro marchio.

Come si svolge un progetto

Iniziare in piccolo, poi scalare

Analisi iniziale

Una chiamata sui vostri dati, i formati, i volumi e le esigenze di protezione dei dati.

Pilota

Curiamo un campione di circa 1.000 record e mostriamo il risultato con un report di qualità.

Preventivo

Un prezzo fisso basato su ciò che il pilota ha mostrato, non su una stima a occhio.

Elaborazione completa

L'intero dataset passa attraverso la pipeline. Vedete l'avanzamento e i dati intermedi.

Consegna

Vengono consegnati i dati, la scheda dei dati e il report. I vostri dati di origine vengono cancellati, con conferma.

Domande sulla data curation

I nostri dati devono uscire dalla nostra sede?

No. La pipeline può essere eseguita nel vostro ambiente, su una macchina messa a disposizione da voi. Se preferite, ci inviate i dati con un accordo sul trattamento dei dati e li trattiamo in Germania e nell'UE.

Firmate un accordo sul trattamento dei dati?

Sì. Un accordo ai sensi dell'art. 28 del GDPR viene firmato prima che riceviamo qualsiasi dato, insieme a un NDA.

Quali tipi di file potete elaborare?

PDF comprese le scansioni, documenti Office, HTML, testo semplice, CSV ed esportazioni di database, oltre a file audio e video. Le scansioni passano dall'OCR e le registrazioni dalla trascrizione automatica del parlato.

Quali lingue sono supportate?

Il rilevamento della lingua copre una gamma molto ampia di lingue, comprese quelle a basse risorse, perché la pipeline è stata costruita per un corpus di 150 lingue. La qualità dell'OCR e della trascrizione del parlato varia da lingua a lingua: è uno dei motivi per cui iniziamo con un pilota.

Quanto costa?

Il prezzo è definito per progetto e dipende da volume, formati e modalità operativa. Il pilota fornisce a entrambe le parti numeri reali, e il preventivo ne deriva.

Inviateci una descrizione dei vostri dati

Formati, volume approssimativo e uso previsto. Rispondiamo con una proposta di pilota.

Richiedi un pilota