Kuracja danych B2B

Państwa dane nieustrukturyzowane, przygotowane dla AI

Uruchamiamy nasz pipeline kuracji na Państwa dokumentach, skanach, nagraniach audio i wideo: ekstrakcja tekstu, usuwanie danych osobowych, deduplikacja, wykrywanie języka i ocena jakości. Przetwarzanie w Niemczech i UE na podstawie umowy powierzenia przetwarzania danych albo w Państwa siedzibie.

Co trafia na wejście

  • Pliki PDF, także zeskanowane strony
  • Dokumenty Office, HTML i eksporty poczty e-mail
  • Pliki CSV, logi i eksporty z baz danych
  • Nagrania audio i wideo

Co otrzymują Państwo na wyjściu

  • Ustrukturyzowane pliki JSONL lub Parquet w uzgodnionym schemacie
  • Dane osobowe usunięte lub zamaskowane zgodnie z Państwa polityką
  • Język, ocena jakości i hash treści w każdym rekordzie
  • Karta danych oraz raport jakości przed kuracją i po niej
Pipeline

Osiem kroków od surowych plików do danych treningowych

Ten sam pipeline, który buduje nasze własne korpusy. Każdy krok można w Państwa projekcie włączyć lub wyłączyć.

Ekstrakcja

Z dokumentów wyodrębniamy tekst. Zeskanowane strony przechodzą przez optyczne rozpoznawanie znaków.

Tesseract OCR

Transkrypcja

Nagrania audio i wideo są konwertowane i transkrybowane na tekst.

ffmpegWhisper

Czyszczenie

Usuwamy błędy kodowania, znaczniki, stałe elementy stron i powtarzalne formułki. Tekst jest normalizowany.

pandas

Usuwanie danych osobowych

Imiona i nazwiska, adresy e-mail, numery telefonów, dane bankowe i identyfikatory są wykrywane, a następnie usuwane lub maskowane.

NERpattern rules

Deduplikacja

Wyszukujemy i usuwamy dokładne kopie oraz kopie niemal identyczne, aby nic nie miało nadmiernej wagi w treningu.

content hashMinHash

Wykrywanie języka

Głosują cztery niezależne detektory. Dokument jest przyjmowany, gdy co najmniej dwa są zgodne.

GlotLIDfastTextLingualangdetect

Ocena jakości

Każdy rekord otrzymuje ocenę jakości. Rekordy z niską oceną są oznaczane lub usuwane, zgodnie z Państwa decyzją.

Struktura i raport

Dane wyjściowe w Państwa schemacie, w formacie JSONL lub Parquet, wraz z kartą danych i raportem z benchmarku.

JSONLParquet

Czego nie obiecujemy: automatyczne wykrywanie danych osobowych nie znajduje wszystkiego. Podajemy wskaźniki wykrycia i znane ograniczenia, a w przypadku danych wrażliwych uzgadniamy z Państwem etap weryfikacji przed dostawą.

Ochrona danych

Dla danych, które muszą pozostać pod kontrolą

Organizacje regulowane nie mogą przekazywać danych usłudze chmurowej w państwie trzecim. Ta usługa została zaprojektowana z uwzględnieniem tego ograniczenia.

Umowa powierzenia przetwarzania danych

Umowę zgodnie z art. 28 RODO podpisujemy, zanim zaczniemy pracę z jakimikolwiek danymi. NDA jest standardem.

Przetwarzanie w Niemczech i UE

Państwa dane przetwarzamy na własnych maszynach w Niemczech i UE albo na Państwa maszynach. Bez przekazywania do państw trzecich.

Szyfrowanie

Szyfrowanie danych w spoczynku algorytmem AES-256-GCM. Klucze są przechowywane w ramach sesji i nigdy nie są zapisywane na dysku.

Usunięcie danych

Po dostawie Państwa dane są usuwane, a Państwo otrzymują pisemne potwierdzenie.

Dwa modele realizacji

Na naszych maszynach lub na Państwa

Na naszych maszynachW Państwa siedzibie
Jak to działaPrzesyłają Państwo dane szyfrowanym transferem. Przetwarzamy je w Niemczech i UE, a po dostawie usuwamy.Uruchamiamy pipeline w Państwa środowisku: zdalnie na udostępnionej przez Państwa maszynie lub na miejscu.
Dla kogoZespoły AI, firmy programistyczne oraz dane, które na podstawie umowy mogą opuścić Państwa sieć.Banki, ubezpieczyciele, ochrona zdrowia, farmacja i instytucje publiczne, których dane nie mogą opuścić budynku.
Państwa danePrzechowywane w postaci zaszyfrowanej wyłącznie na czas trwania projektu.Nigdy nie opuszczają Państwa infrastruktury.
Dla kogo

Organizacje z archiwami, z których AI jeszcze nie może korzystać

Banki i ubezpieczyciele

Umowy, korespondencja i akta spraw przekształcone w dane do treningu i wyszukiwania, bez danych osobowych.

Ochrona zdrowia i farmacja

Raporty, dokumentacja badań i nagrania mowy przygotowane dla modeli dziedzinowych, z zachowaniem ścisłej ochrony danych.

Sektor publiczny i prawo

Zeskanowane akta, orzeczenia i dokumenty administracyjne, które stają się przeszukiwalne i użyteczne.

Firmy doradcze i dostawcy danych

Pipeline jest dostępny w modelu white-label, dzięki czemu mogą Państwo oferować kurację własnym klientom pod swoją marką.

Jak przebiega współpraca

Mały start, potem skalowanie

Ustalenie zakresu

Rozmowa o Państwa danych, formatach, wolumenach i wymaganiach w zakresie ochrony danych.

Pilotaż

Poddajemy kuracji próbkę około 1000 rekordów i pokazujemy wynik wraz z raportem jakości.

Oferta

Stała cena oparta na wynikach pilotażu, a nie na szacunkach.

Pełna realizacja

Cały zbiór danych przechodzi przez pipeline. Widzą Państwo postęp i wyniki cząstkowe.

Dostawa

Dostarczamy dane, kartę danych i raport. Państwa dane źródłowe są usuwane, co potwierdzamy.

Pytania o kurację danych

Czy nasze dane muszą opuścić naszą siedzibę?

Nie. Pipeline może działać w Państwa środowisku, na udostępnionej przez Państwa maszynie. Mogą też Państwo przesłać nam dane na podstawie umowy powierzenia przetwarzania danych. Wtedy przetwarzamy je w Niemczech i UE.

Czy podpisują Państwo umowę powierzenia przetwarzania danych?

Tak. Umowę zgodnie z art. 28 RODO podpisujemy wraz z NDA, zanim otrzymamy jakiekolwiek dane.

Jakie typy plików mogą Państwo przetwarzać?

PDF, w tym skany, dokumenty Office, HTML, zwykły tekst, CSV i eksporty z baz danych oraz pliki audio i wideo. Skany przechodzą przez OCR, a nagrania przez zamianę mowy na tekst.

Jakie języki są obsługiwane?

Wykrywanie języka obejmuje bardzo szeroki zakres języków, w tym języki o ograniczonych zasobach, ponieważ pipeline powstał dla korpusu w 150 językach. Jakość OCR i zamiany mowy na tekst zależy od języka. To jeden z powodów, dla których zaczynamy od pilotażu.

Ile to kosztuje?

Cena jest ustalana dla projektu i zależy od wolumenu, formatów i modelu realizacji. Pilotaż daje obu stronom rzeczywiste liczby, a oferta z nich wynika.

Proszę przesłać nam opis swoich danych

Formaty, przybliżony wolumen i planowane zastosowanie. W odpowiedzi prześlemy propozycję pilotażu.

Zamów pilotaż