Uw ongestructureerde data, klaar voor AI
Wij draaien onze curatiepipeline op uw documenten, scans, audio en video: tekstextractie, persoonsgegevens verwijderen, deduplicatie, taaldetectie en kwaliteitsbeoordeling. Verwerkt in Duitsland en de EU onder een verwerkersovereenkomst, of op uw eigen locatie.
Wat erin gaat
- Pdf's, ook gescande pagina's
- Office-documenten, HTML en e-mailexports
- CSV-bestanden, logs en database-exports
- Audio- en video-opnamen
Wat eruit komt
- Gestructureerde JSONL of Parquet in een afgesproken schema
- Persoonsgegevens verwijderd of gemaskeerd volgens uw beleid
- Taal, kwaliteitsscore en contenthash bij elk record
- Een data card en een kwaliteitsrapport van voor en na
Acht stappen van ruwe bestanden naar trainingsdata
Dezelfde pipeline waarmee wij onze eigen corpora opbouwen. Elke stap kan voor uw project worden in- of uitgeschakeld.
Extraheren
De tekst wordt uit documenten gehaald. Gescande pagina's gaan door optische tekenherkenning.
Transcriberen
Audio en video worden geconverteerd en naar tekst getranscribeerd.
Opschonen
Coderingsfouten, markup, pagina-elementen en standaardtekst worden verwijderd. De tekst wordt genormaliseerd.
Persoonsgegevens verwijderen
Namen, e-mailadressen, telefoonnummers, bankgegevens en identificatoren worden gedetecteerd en verwijderd of gemaskeerd.
Dedupliceren
Exacte en bijna identieke kopieën worden opgespoord en verwijderd, zodat niets te zwaar meeweegt in de training.
Taal detecteren
Vier onafhankelijke detectoren stemmen. Een document wordt geaccepteerd als er minstens twee overeenkomen.
Kwaliteit beoordelen
Elk record krijgt een kwaliteitsscore. Records met een lage score worden gemarkeerd of verwijderd. U bepaalt welke van de twee.
Structureren en rapporteren
Uitvoer in uw schema als JSONL of Parquet, met een data card en een benchmarkrapport.
Wat wij niet beloven: geautomatiseerde detectie van persoonsgegevens vindt niet alles. Wij rapporteren de gedetecteerde percentages en de bekende beperkingen. Voor gevoelige data spreken wij met u een reviewstap af vóór de levering.
Gebouwd voor data die onder controle moet blijven
Gereguleerde organisaties kunnen hun data niet overdragen aan een clouddienst in een derde land. Deze dienst is rond die beperking ontworpen.
Verwerkersovereenkomst
Een overeenkomst volgens art. 28 AVG wordt getekend voordat er data wordt aangeraakt. Een NDA is standaard.
Verwerking in Duitsland en de EU
Uw data wordt verwerkt op onze eigen machines in Duitsland en de EU, of op die van u. Geen doorgifte naar derde landen.
Versleuteling
Opgeslagen data is versleuteld met AES-256-GCM. Sleutels bestaan per sessie en worden nooit naar schijf geschreven.
Verwijdering
Na levering wordt uw data verwijderd en ontvangt u een schriftelijke bevestiging.
Op onze machines of op die van u
| Op onze machines | Op uw eigen locatie | |
|---|---|---|
| Zo werkt het | U stuurt de data via een versleutelde overdracht. Wij verwerken deze in Duitsland en de EU en verwijderen deze na levering. | Wij draaien de pipeline binnen uw omgeving: op afstand op een machine die u beschikbaar stelt, of bij u op locatie. |
| Geschikt voor | AI-teams, softwarebedrijven en data die uw netwerk op basis van een overeenkomst mag verlaten. | Banken, verzekeraars, zorg, farma en overheidsinstanties waarvan de data het gebouw niet mag verlaten. |
| Uw data | Wordt alleen voor de duur van het project versleuteld bewaard. | Verlaat uw infrastructuur nooit. |
Organisaties met archieven die AI nog niet kan gebruiken
Banken en verzekeraars
Contracten, correspondentie en dossiers omgezet in data voor training en retrieval, zonder persoonlijke details.
Zorg en farma
Rapporten, studiedocumenten en opgenomen spraak, voorbereid voor domeinmodellen onder strikte gegevensbescherming.
Publieke sector en juridische sector
Gescande dossiers, uitspraken en bestuurlijke documenten doorzoekbaar en bruikbaar gemaakt.
Adviesbureaus en dataleveranciers
De pipeline is als white label beschikbaar. Zo kunt u curatie onder uw eigen naam aan uw klanten aanbieden.
Klein beginnen, daarna opschalen
Scope bepalen
Een gesprek over uw data, formaten, volumes en eisen aan gegevensbescherming.
Pilot
Wij cureren een sample van ongeveer 1.000 records en tonen het resultaat met een kwaliteitsrapport.
Offerte
Een vaste prijs op basis van wat de pilot heeft laten zien, niet op basis van een schatting.
Volledige run
De hele dataset gaat door de pipeline. U ziet de voortgang en tussentijdse cijfers.
Levering
Data, data card en rapport worden geleverd. Uw brondata wordt verwijderd en dat wordt bevestigd.
Vragen over datacuratie
Moet onze data onze locatie verlaten?
Nee. De pipeline kan binnen uw omgeving draaien, op een machine die u beschikbaar stelt. Als u dat liever hebt, stuurt u de data onder een verwerkersovereenkomst naar ons en verwerken wij deze in Duitsland en de EU.
Tekent u een verwerkersovereenkomst?
Ja. Een overeenkomst volgens art. 28 AVG wordt getekend voordat wij data ontvangen, samen met een NDA.
Welke bestandstypen kunt u verwerken?
Pdf inclusief scans, Office-documenten, HTML, platte tekst, CSV en database-exports, en audio- en videobestanden. Scans gaan door OCR en opnamen door spraak-naar-tekst.
Welke talen worden ondersteund?
De taaldetectie dekt een zeer breed scala aan talen, ook talen met weinig beschikbare data, omdat de pipeline is gebouwd voor een corpus van 150 talen. De kwaliteit van OCR en spraak-naar-tekst verschilt per taal. Dat is één van de redenen waarom wij met een pilot beginnen.
Wat kost het?
De prijs wordt per project bepaald en hangt af van volume, formaten en leveringsmodel. De pilot levert beide partijen echte cijfers op, en de offerte volgt daaruit.
Stuur ons een beschrijving van uw data
Formaten, het geschatte volume en waarvoor u de data wilt gebruiken. Wij reageren met een voorstel voor een pilot.
Vraag een pilot aan