Państwa dane nieustrukturyzowane, przygotowane dla AI
Uruchamiamy nasz pipeline kuracji na Państwa dokumentach, skanach, nagraniach audio i wideo: ekstrakcja tekstu, usuwanie danych osobowych, deduplikacja, wykrywanie języka i ocena jakości. Przetwarzanie w Niemczech i UE na podstawie umowy powierzenia przetwarzania danych albo w Państwa siedzibie.
Co trafia na wejście
- Pliki PDF, także zeskanowane strony
- Dokumenty Office, HTML i eksporty poczty e-mail
- Pliki CSV, logi i eksporty z baz danych
- Nagrania audio i wideo
Co otrzymują Państwo na wyjściu
- Ustrukturyzowane pliki JSONL lub Parquet w uzgodnionym schemacie
- Dane osobowe usunięte lub zamaskowane zgodnie z Państwa polityką
- Język, ocena jakości i hash treści w każdym rekordzie
- Karta danych oraz raport jakości przed kuracją i po niej
Osiem kroków od surowych plików do danych treningowych
Ten sam pipeline, który buduje nasze własne korpusy. Każdy krok można w Państwa projekcie włączyć lub wyłączyć.
Ekstrakcja
Z dokumentów wyodrębniamy tekst. Zeskanowane strony przechodzą przez optyczne rozpoznawanie znaków.
Transkrypcja
Nagrania audio i wideo są konwertowane i transkrybowane na tekst.
Czyszczenie
Usuwamy błędy kodowania, znaczniki, stałe elementy stron i powtarzalne formułki. Tekst jest normalizowany.
Usuwanie danych osobowych
Imiona i nazwiska, adresy e-mail, numery telefonów, dane bankowe i identyfikatory są wykrywane, a następnie usuwane lub maskowane.
Deduplikacja
Wyszukujemy i usuwamy dokładne kopie oraz kopie niemal identyczne, aby nic nie miało nadmiernej wagi w treningu.
Wykrywanie języka
Głosują cztery niezależne detektory. Dokument jest przyjmowany, gdy co najmniej dwa są zgodne.
Ocena jakości
Każdy rekord otrzymuje ocenę jakości. Rekordy z niską oceną są oznaczane lub usuwane, zgodnie z Państwa decyzją.
Struktura i raport
Dane wyjściowe w Państwa schemacie, w formacie JSONL lub Parquet, wraz z kartą danych i raportem z benchmarku.
Czego nie obiecujemy: automatyczne wykrywanie danych osobowych nie znajduje wszystkiego. Podajemy wskaźniki wykrycia i znane ograniczenia, a w przypadku danych wrażliwych uzgadniamy z Państwem etap weryfikacji przed dostawą.
Dla danych, które muszą pozostać pod kontrolą
Organizacje regulowane nie mogą przekazywać danych usłudze chmurowej w państwie trzecim. Ta usługa została zaprojektowana z uwzględnieniem tego ograniczenia.
Umowa powierzenia przetwarzania danych
Umowę zgodnie z art. 28 RODO podpisujemy, zanim zaczniemy pracę z jakimikolwiek danymi. NDA jest standardem.
Przetwarzanie w Niemczech i UE
Państwa dane przetwarzamy na własnych maszynach w Niemczech i UE albo na Państwa maszynach. Bez przekazywania do państw trzecich.
Szyfrowanie
Szyfrowanie danych w spoczynku algorytmem AES-256-GCM. Klucze są przechowywane w ramach sesji i nigdy nie są zapisywane na dysku.
Usunięcie danych
Po dostawie Państwa dane są usuwane, a Państwo otrzymują pisemne potwierdzenie.
Na naszych maszynach lub na Państwa
| Na naszych maszynach | W Państwa siedzibie | |
|---|---|---|
| Jak to działa | Przesyłają Państwo dane szyfrowanym transferem. Przetwarzamy je w Niemczech i UE, a po dostawie usuwamy. | Uruchamiamy pipeline w Państwa środowisku: zdalnie na udostępnionej przez Państwa maszynie lub na miejscu. |
| Dla kogo | Zespoły AI, firmy programistyczne oraz dane, które na podstawie umowy mogą opuścić Państwa sieć. | Banki, ubezpieczyciele, ochrona zdrowia, farmacja i instytucje publiczne, których dane nie mogą opuścić budynku. |
| Państwa dane | Przechowywane w postaci zaszyfrowanej wyłącznie na czas trwania projektu. | Nigdy nie opuszczają Państwa infrastruktury. |
Organizacje z archiwami, z których AI jeszcze nie może korzystać
Banki i ubezpieczyciele
Umowy, korespondencja i akta spraw przekształcone w dane do treningu i wyszukiwania, bez danych osobowych.
Ochrona zdrowia i farmacja
Raporty, dokumentacja badań i nagrania mowy przygotowane dla modeli dziedzinowych, z zachowaniem ścisłej ochrony danych.
Sektor publiczny i prawo
Zeskanowane akta, orzeczenia i dokumenty administracyjne, które stają się przeszukiwalne i użyteczne.
Firmy doradcze i dostawcy danych
Pipeline jest dostępny w modelu white-label, dzięki czemu mogą Państwo oferować kurację własnym klientom pod swoją marką.
Mały start, potem skalowanie
Ustalenie zakresu
Rozmowa o Państwa danych, formatach, wolumenach i wymaganiach w zakresie ochrony danych.
Pilotaż
Poddajemy kuracji próbkę około 1000 rekordów i pokazujemy wynik wraz z raportem jakości.
Oferta
Stała cena oparta na wynikach pilotażu, a nie na szacunkach.
Pełna realizacja
Cały zbiór danych przechodzi przez pipeline. Widzą Państwo postęp i wyniki cząstkowe.
Dostawa
Dostarczamy dane, kartę danych i raport. Państwa dane źródłowe są usuwane, co potwierdzamy.
Pytania o kurację danych
Czy nasze dane muszą opuścić naszą siedzibę?
Nie. Pipeline może działać w Państwa środowisku, na udostępnionej przez Państwa maszynie. Mogą też Państwo przesłać nam dane na podstawie umowy powierzenia przetwarzania danych. Wtedy przetwarzamy je w Niemczech i UE.
Czy podpisują Państwo umowę powierzenia przetwarzania danych?
Tak. Umowę zgodnie z art. 28 RODO podpisujemy wraz z NDA, zanim otrzymamy jakiekolwiek dane.
Jakie typy plików mogą Państwo przetwarzać?
PDF, w tym skany, dokumenty Office, HTML, zwykły tekst, CSV i eksporty z baz danych oraz pliki audio i wideo. Skany przechodzą przez OCR, a nagrania przez zamianę mowy na tekst.
Jakie języki są obsługiwane?
Wykrywanie języka obejmuje bardzo szeroki zakres języków, w tym języki o ograniczonych zasobach, ponieważ pipeline powstał dla korpusu w 150 językach. Jakość OCR i zamiany mowy na tekst zależy od języka. To jeden z powodów, dla których zaczynamy od pilotażu.
Ile to kosztuje?
Cena jest ustalana dla projektu i zależy od wolumenu, formatów i modelu realizacji. Pilotaż daje obu stronom rzeczywiste liczby, a oferta z nich wynika.
Proszę przesłać nam opis swoich danych
Formaty, przybliżony wolumen i planowane zastosowanie. W odpowiedzi prześlemy propozycję pilotażu.
Zamów pilotaż