B2B-datacuratie

Uw ongestructureerde data, klaar voor AI

Wij draaien onze curatiepipeline op uw documenten, scans, audio en video: tekstextractie, persoonsgegevens verwijderen, deduplicatie, taaldetectie en kwaliteitsbeoordeling. Verwerkt in Duitsland en de EU onder een verwerkersovereenkomst, of op uw eigen locatie.

Wat erin gaat

  • Pdf's, ook gescande pagina's
  • Office-documenten, HTML en e-mailexports
  • CSV-bestanden, logs en database-exports
  • Audio- en video-opnamen

Wat eruit komt

  • Gestructureerde JSONL of Parquet in een afgesproken schema
  • Persoonsgegevens verwijderd of gemaskeerd volgens uw beleid
  • Taal, kwaliteitsscore en contenthash bij elk record
  • Een data card en een kwaliteitsrapport van voor en na
De pipeline

Acht stappen van ruwe bestanden naar trainingsdata

Dezelfde pipeline waarmee wij onze eigen corpora opbouwen. Elke stap kan voor uw project worden in- of uitgeschakeld.

Extraheren

De tekst wordt uit documenten gehaald. Gescande pagina's gaan door optische tekenherkenning.

Tesseract OCR

Transcriberen

Audio en video worden geconverteerd en naar tekst getranscribeerd.

ffmpegWhisper

Opschonen

Coderingsfouten, markup, pagina-elementen en standaardtekst worden verwijderd. De tekst wordt genormaliseerd.

pandas

Persoonsgegevens verwijderen

Namen, e-mailadressen, telefoonnummers, bankgegevens en identificatoren worden gedetecteerd en verwijderd of gemaskeerd.

NERpattern rules

Dedupliceren

Exacte en bijna identieke kopieën worden opgespoord en verwijderd, zodat niets te zwaar meeweegt in de training.

content hashMinHash

Taal detecteren

Vier onafhankelijke detectoren stemmen. Een document wordt geaccepteerd als er minstens twee overeenkomen.

GlotLIDfastTextLingualangdetect

Kwaliteit beoordelen

Elk record krijgt een kwaliteitsscore. Records met een lage score worden gemarkeerd of verwijderd. U bepaalt welke van de twee.

Structureren en rapporteren

Uitvoer in uw schema als JSONL of Parquet, met een data card en een benchmarkrapport.

JSONLParquet

Wat wij niet beloven: geautomatiseerde detectie van persoonsgegevens vindt niet alles. Wij rapporteren de gedetecteerde percentages en de bekende beperkingen. Voor gevoelige data spreken wij met u een reviewstap af vóór de levering.

Gegevensbescherming

Gebouwd voor data die onder controle moet blijven

Gereguleerde organisaties kunnen hun data niet overdragen aan een clouddienst in een derde land. Deze dienst is rond die beperking ontworpen.

Verwerkersovereenkomst

Een overeenkomst volgens art. 28 AVG wordt getekend voordat er data wordt aangeraakt. Een NDA is standaard.

Verwerking in Duitsland en de EU

Uw data wordt verwerkt op onze eigen machines in Duitsland en de EU, of op die van u. Geen doorgifte naar derde landen.

Versleuteling

Opgeslagen data is versleuteld met AES-256-GCM. Sleutels bestaan per sessie en worden nooit naar schijf geschreven.

Verwijdering

Na levering wordt uw data verwijderd en ontvangt u een schriftelijke bevestiging.

Twee manieren van uitvoeren

Op onze machines of op die van u

Op onze machinesOp uw eigen locatie
Zo werkt hetU stuurt de data via een versleutelde overdracht. Wij verwerken deze in Duitsland en de EU en verwijderen deze na levering.Wij draaien de pipeline binnen uw omgeving: op afstand op een machine die u beschikbaar stelt, of bij u op locatie.
Geschikt voorAI-teams, softwarebedrijven en data die uw netwerk op basis van een overeenkomst mag verlaten.Banken, verzekeraars, zorg, farma en overheidsinstanties waarvan de data het gebouw niet mag verlaten.
Uw dataWordt alleen voor de duur van het project versleuteld bewaard.Verlaat uw infrastructuur nooit.
Voor wie

Organisaties met archieven die AI nog niet kan gebruiken

Banken en verzekeraars

Contracten, correspondentie en dossiers omgezet in data voor training en retrieval, zonder persoonlijke details.

Zorg en farma

Rapporten, studiedocumenten en opgenomen spraak, voorbereid voor domeinmodellen onder strikte gegevensbescherming.

Publieke sector en juridische sector

Gescande dossiers, uitspraken en bestuurlijke documenten doorzoekbaar en bruikbaar gemaakt.

Adviesbureaus en dataleveranciers

De pipeline is als white label beschikbaar. Zo kunt u curatie onder uw eigen naam aan uw klanten aanbieden.

Zo verloopt een opdracht

Klein beginnen, daarna opschalen

Scope bepalen

Een gesprek over uw data, formaten, volumes en eisen aan gegevensbescherming.

Pilot

Wij cureren een sample van ongeveer 1.000 records en tonen het resultaat met een kwaliteitsrapport.

Offerte

Een vaste prijs op basis van wat de pilot heeft laten zien, niet op basis van een schatting.

Volledige run

De hele dataset gaat door de pipeline. U ziet de voortgang en tussentijdse cijfers.

Levering

Data, data card en rapport worden geleverd. Uw brondata wordt verwijderd en dat wordt bevestigd.

Vragen over datacuratie

Moet onze data onze locatie verlaten?

Nee. De pipeline kan binnen uw omgeving draaien, op een machine die u beschikbaar stelt. Als u dat liever hebt, stuurt u de data onder een verwerkersovereenkomst naar ons en verwerken wij deze in Duitsland en de EU.

Tekent u een verwerkersovereenkomst?

Ja. Een overeenkomst volgens art. 28 AVG wordt getekend voordat wij data ontvangen, samen met een NDA.

Welke bestandstypen kunt u verwerken?

Pdf inclusief scans, Office-documenten, HTML, platte tekst, CSV en database-exports, en audio- en videobestanden. Scans gaan door OCR en opnamen door spraak-naar-tekst.

Welke talen worden ondersteund?

De taaldetectie dekt een zeer breed scala aan talen, ook talen met weinig beschikbare data, omdat de pipeline is gebouwd voor een corpus van 150 talen. De kwaliteit van OCR en spraak-naar-tekst verschilt per taal. Dat is één van de redenen waarom wij met een pilot beginnen.

Wat kost het?

De prijs wordt per project bepaald en hangt af van volume, formaten en leveringsmodel. De pilot levert beide partijen echte cijfers op, en de offerte volgt daaruit.

Stuur ons een beschrijving van uw data

Formaten, het geschatte volume en waarvoor u de data wilt gebruiken. Wij reageren met een voorstel voor een pilot.

Vraag een pilot aan