Licencjonowane dane treningowe dla AI.
I pipeline, który oczyści Państwa dane.
CurateLM dostarcza korpusy tekstu i kodu ze zweryfikowaną licencją do trenowania modeli LLM. Ten sam pipeline kuracji uruchamiamy także na Państwa danych: usuwanie danych osobowych, deduplikacja, wykrywanie języka i ocena jakości. Przetwarzanie odbywa się w Niemczech i UE.
Korpusy rosną każdego dnia. Dokładne aktualne liczby podaje karta zbioru danych.
Trzy formy współpracy z CurateLM
Licencja na gotowe korpusy
Tekst wielojęzyczny w ponad 150 językach, kod źródłowy, w tym starsze języki korporacyjne, oraz dane biomedyczne. Każdy rekord ma przypisaną licencję, język i ocenę jakości.
Zobacz zbiory danychKuracja Państwa własnych danych
Z Państwa dokumentów, skanów, nagrań audio i wideo tworzymy ustrukturyzowane dane treningowe. Usuwamy dane osobowe i pracujemy na podstawie umowy powierzenia przetwarzania danych. W UE lub w Państwa siedzibie.
Jak działa usługaPomiar zbioru danych
Raport z pomiarów dowolnego zbioru danych tekstowych lub kodu: duplikaty, dane osobowe, zgodność licencyjna, poprawność składni i pokrycie ze zbiorami ewaluacyjnymi. Przed kuracją i po niej.
Co obejmuje raportKorpusy dostępne w licencji już dziś
Trzy korpusy zbudowane według jednej polityki licencyjnej: wyłącznie domena publiczna, CC0, CC BY i permisywne licencje na kod. Materiały na licencjach niekomercyjnych, bez utworów zależnych, share-alike i copyleft odrzucamy już na etapie pozyskiwania.
Tekst wielojęzyczny
- Ponad 5,5 mld tokenów, rośnie codziennie
- 150+ języków w 140 niszach dziedzinowych
- Nacisk na języki rzadkie i o ograniczonych zasobach
- Nauka, prawo, administracja, medycyna, finanse, inżynieria
Kod źródłowy
- Ponad 2 mld tokenów, rośnie
- Starsze języki: COBOL, Fortran, JCL, PL/I
- Nowoczesne: Rust, Go, Java, C, C++, TypeScript i inne
- Tylko licencje permisywne, sprawdzane dla każdego repozytorium
Biomedycyna i nauki o życiu
- Ponad 700 mln tokenów w 31 niszach
- Farmakologia, neurologia, biochemia, immunologia
- Rekordy ustrukturyzowane: oznakowanie leków, badania kliniczne, powinowactwa wiązania
- Bez danych na poziomie pacjenta
Raport jakości dla dowolnego zbioru danych
Większość zbiorów danych sprzedaje się na podstawie liczby tokenów. My mierzymy to, co jest w środku: jaka część to duplikaty, jakie dane osobowe wykryto, czy licencje są zgodne z Państwa polityką, czy kod się parsuje i czy do zbioru nie przeciekły benchmarki ewaluacyjne. Raport zawiera wyłącznie liczby, nigdy Państwa tekst.
- Tekst i kod w jednym raporcie
- Stan przed kuracją i po niej, obok siebie
- Porównanie z publicznymi i Państwa prywatnymi zbiorami ewaluacyjnymi
- Uruchamiany lokalnie: dane nie opuszczają maszyny
Od surowych danych do gotowego zbioru w czterech krokach
Przesyłają nam Państwo surowe dane. My zwracamy zbiory danych treningowych klasy produkcyjnej, w uzgodnionym z Państwem terminie i z pełną dokumentacją.
Przesłanie surowych danych
Pliki PDF, HTML, CSV, transkrypcje audio, dane zebrane z sieci: dowolny format, dowolny język, dowolny wolumen.
Czyścimy i strukturyzujemy
Deduplikacja, normalizacja, projekt schematu, usuwanie danych osobowych, filtrowanie jakości i anotacja.
Konwersja formatu
Dane wyjściowe w formacie JSONL, Parquet lub we własnym schemacie, zoptymalizowane i zwalidowane pod Państwa pipeline.
Dostawa
Do każdego zbioru danych dołączamy kartę danych, raport ze statystykami jakości i przykładowy plik walidacyjny.
Państwa dane nigdy nie opuszczają infrastruktury lokalnej
Każdy zbiór danych przetwarzamy on-premise w Niemczech i UE. Na żadnym etapie nie przechowujemy danych w chmurze. W każdym projekcie zawieramy umowę powierzenia przetwarzania danych zgodnie z art. 28 RODO. Żadnego przekazywania danych do USA ani do państw trzecich.
Szyfrowanie AES-256
Dane w spoczynku są szyfrowane algorytmem AES-256-GCM. Klucze są ustalane dla każdej sesji i nigdy nie są zapisywane na dysku.
UE na pierwszym miejscu · Zgodnie z art. 28 RODO
Firma zarejestrowana w Berlinie. Dla każdego projektu dostępne są umowa powierzenia przetwarzania danych zgodnie z art. 28 RODO oraz NDA.
Formaty i usługi dla Państwa pipeline'u
Tworzenie JSONL
Formaty instrukcyjne, czatowe, pary DPO i formaty uzupełniania tekstu, dopasowane do architektury Państwa modelu.
Konwersja do Parquet
Kolumnowe pliki Parquet ze zoptymalizowanym schematem do pre-treningu na dużą skalę, dostarczane przez Hugging Face, S3 lub BigQuery.
Czyszczenie danych
Deduplikacja, wykrywanie języka, normalizacja, usuwanie danych osobowych, filtrowanie treści toksycznych i ocena jakości.
Chunking dla RAG
Segmentacja dokumentów, strategia chunkingu i wzbogacanie metadanych dla pipeline'u Państwa wektorowej bazy danych.
Proszę napisać, jakich danych Państwo potrzebują lub jakie dane Państwo mają
Odpowiadamy w ciągu jednego dnia roboczego. Przesyłamy kartę zbioru danych, plan próbki lub zakres Państwa projektu.