On-premise w Niemczech i UE · Bez przechowywania w chmurze

Licencjonowane dane treningowe dla AI.
I pipeline, który oczyści Państwa dane.

CurateLM dostarcza korpusy tekstu i kodu ze zweryfikowaną licencją do trenowania modeli LLM. Ten sam pipeline kuracji uruchamiamy także na Państwa danych: usuwanie danych osobowych, deduplikacja, wykrywanie języka i ocena jakości. Przetwarzanie odbywa się w Niemczech i UE.

5.5B+tokenów tekstu wielojęzycznego w ponad 150 językach
corpus_sample.jsonl { "text": "Die Studie untersucht, wie …", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "pii_scrubbed": true }
2B+tokenów kodu ze zweryfikowaną licencją, od COBOL po Rust
payroll.cbl · COBOL · Apache-2.0 · parses cleanly IDENTIFICATION DIVISION. PROGRAM-ID. PAYCALC. PROCEDURE DIVISION. COMPUTE NET-PAY = GROSS-PAY - TAX-AMT. DISPLAY "NET PAY: " NET-PAY. STOP RUN.
700M+tokenów tekstu biomedycznego w 31 niszach
biomedical_sample.jsonl { "text": "The compound inhibits …", "language": "en", "niche": "pharmacology", "license": "CC-BY-4.0", "quality_score": 0.93, "pii_scrubbed": true }
Rośnie codziennie
5.5B+tokenów tekstu wielojęzycznego
150+języków, w tym wiele rzadkich i o ograniczonych zasobach
2B+tokenów kodu źródłowego ze zweryfikowaną licencją
700M+tokenów tekstu biomedycznego

Korpusy rosną każdego dnia. Dokładne aktualne liczby podaje karta zbioru danych.

Berlin · Dane przechowywane w UE · Licencja zweryfikowana dla każdego rekordu · Umowa powierzenia przetwarzania danych zgodnie z art. 28 RODO
Czym się zajmujemy

Trzy formy współpracy z CurateLM

Zbiory danych

Licencja na gotowe korpusy

Tekst wielojęzyczny w ponad 150 językach, kod źródłowy, w tym starsze języki korporacyjne, oraz dane biomedyczne. Każdy rekord ma przypisaną licencję, język i ocenę jakości.

Zobacz zbiory danych
Kuracja danych B2B

Kuracja Państwa własnych danych

Z Państwa dokumentów, skanów, nagrań audio i wideo tworzymy ustrukturyzowane dane treningowe. Usuwamy dane osobowe i pracujemy na podstawie umowy powierzenia przetwarzania danych. W UE lub w Państwa siedzibie.

Jak działa usługa
Benchmark jakości

Pomiar zbioru danych

Raport z pomiarów dowolnego zbioru danych tekstowych lub kodu: duplikaty, dane osobowe, zgodność licencyjna, poprawność składni i pokrycie ze zbiorami ewaluacyjnymi. Przed kuracją i po niej.

Co obejmuje raport
Nasze dane

Korpusy dostępne w licencji już dziś

Trzy korpusy zbudowane według jednej polityki licencyjnej: wyłącznie domena publiczna, CC0, CC BY i permisywne licencje na kod. Materiały na licencjach niekomercyjnych, bez utworów zależnych, share-alike i copyleft odrzucamy już na etapie pozyskiwania.

Tekst wielojęzyczny

  • Ponad 5,5 mld tokenów, rośnie codziennie
  • 150+ języków w 140 niszach dziedzinowych
  • Nacisk na języki rzadkie i o ograniczonych zasobach
  • Nauka, prawo, administracja, medycyna, finanse, inżynieria

Kod źródłowy

  • Ponad 2 mld tokenów, rośnie
  • Starsze języki: COBOL, Fortran, JCL, PL/I
  • Nowoczesne: Rust, Go, Java, C, C++, TypeScript i inne
  • Tylko licencje permisywne, sprawdzane dla każdego repozytorium

Biomedycyna i nauki o życiu

  • Ponad 700 mln tokenów w 31 niszach
  • Farmakologia, neurologia, biochemia, immunologia
  • Rekordy ustrukturyzowane: oznakowanie leków, badania kliniczne, powinowactwa wiązania
  • Bez danych na poziomie pacjenta
Wszystkie zbiory danych i polityka licencyjna
Benchmark

Raport jakości dla dowolnego zbioru danych

Większość zbiorów danych sprzedaje się na podstawie liczby tokenów. My mierzymy to, co jest w środku: jaka część to duplikaty, jakie dane osobowe wykryto, czy licencje są zgodne z Państwa polityką, czy kod się parsuje i czy do zbioru nie przeciekły benchmarki ewaluacyjne. Raport zawiera wyłącznie liczby, nigdy Państwa tekst.

  • Tekst i kod w jednym raporcie
  • Stan przed kuracją i po niej, obok siebie
  • Porównanie z publicznymi i Państwa prywatnymi zbiorami ewaluacyjnymi
  • Uruchamiany lokalnie: dane nie opuszczają maszyny
Kuracja danych

Od surowych danych do gotowego zbioru w czterech krokach

Przesyłają nam Państwo surowe dane. My zwracamy zbiory danych treningowych klasy produkcyjnej, w uzgodnionym z Państwem terminie i z pełną dokumentacją.

01

Przesłanie surowych danych

Pliki PDF, HTML, CSV, transkrypcje audio, dane zebrane z sieci: dowolny format, dowolny język, dowolny wolumen.

02

Czyścimy i strukturyzujemy

Deduplikacja, normalizacja, projekt schematu, usuwanie danych osobowych, filtrowanie jakości i anotacja.

03

Konwersja formatu

Dane wyjściowe w formacie JSONL, Parquet lub we własnym schemacie, zoptymalizowane i zwalidowane pod Państwa pipeline.

04

Dostawa

Do każdego zbioru danych dołączamy kartę danych, raport ze statystykami jakości i przykładowy plik walidacyjny.

Jak działa usługa

Państwa dane nigdy nie opuszczają infrastruktury lokalnej

Każdy zbiór danych przetwarzamy on-premise w Niemczech i UE. Na żadnym etapie nie przechowujemy danych w chmurze. W każdym projekcie zawieramy umowę powierzenia przetwarzania danych zgodnie z art. 28 RODO. Żadnego przekazywania danych do USA ani do państw trzecich.

Szyfrowanie AES-256

Dane w spoczynku są szyfrowane algorytmem AES-256-GCM. Klucze są ustalane dla każdej sesji i nigdy nie są zapisywane na dysku.

UE na pierwszym miejscu · Zgodnie z art. 28 RODO

Firma zarejestrowana w Berlinie. Dla każdego projektu dostępne są umowa powierzenia przetwarzania danych zgodnie z art. 28 RODO oraz NDA.

AES-256-GCM Art. 28 RODO Dane przechowywane w UE NDA Standard
Usługi

Formaty i usługi dla Państwa pipeline'u

Tworzenie JSONL

Formaty instrukcyjne, czatowe, pary DPO i formaty uzupełniania tekstu, dopasowane do architektury Państwa modelu.

Konwersja do Parquet

Kolumnowe pliki Parquet ze zoptymalizowanym schematem do pre-treningu na dużą skalę, dostarczane przez Hugging Face, S3 lub BigQuery.

Czyszczenie danych

Deduplikacja, wykrywanie języka, normalizacja, usuwanie danych osobowych, filtrowanie treści toksycznych i ocena jakości.

Chunking dla RAG

Segmentacja dokumentów, strategia chunkingu i wzbogacanie metadanych dla pipeline'u Państwa wektorowej bazy danych.

Zobacz wszystkie usługi

Proszę napisać, jakich danych Państwo potrzebują lub jakie dane Państwo mają

Odpowiadamy w ciągu jednego dnia roboczego. Przesyłamy kartę zbioru danych, plan próbki lub zakres Państwa projektu.

Poproś o kartę zbioru danych Zobacz cennik