Usługi

Czym się zajmujemy

Kompleksowa strukturyzacja danych na potrzeby fine-tuningu LLM, pre-treningu, ewaluacji i pipeline'ów RAG.

01 · Tworzenie zbiorów danych JSONL

Dane treningowe, z których model naprawdę może się uczyć

Projektujemy, budujemy i walidujemy zbiory danych JSONL do fine-tuningu. Schemat każdego zbioru dopasowujemy do architektury Państwa modelu, a format, filtry jakości i anotację do Państwa zastosowania.

instruction-tuning DPO pairs RLHF chat format completion
Zapytaj o tę usługę
1

Projekt schematu

Ustalamy dokładną strukturę JSON, której wymaga Państwa framework treningowy, na przykład OpenAI, Hugging Face lub Axolotl.

2

Transformacja danych

Dane surowe są konwertowane, czyszczone i zapisywane w uzgodnionym schemacie, z deduplikacją i normalizacją.

3

Walidacja jakości

Każdy wiersz jest sprawdzany pod kątem zgodności ze schematem. Otrzymuje ocenę jakości, a oznaczone wiersze są weryfikowane ręcznie.

4

Dostawa z kartą danych

Końcowy plik JSONL, karta danych, raport statystyczny i próbny zbiór walidacyjny.

02 · Konwersja do Parquet

Duże zbiory danych, kolumnowo i szybko

Duże surowe zbiory danych konwertujemy do plików Parquet ze zoptymalizowanym schematem, gotowych do załadowania przez Hugging Face Datasets, Apache Spark, S3, BigQuery lub dowolny inny kolumnowy magazyn danych.

pre-trening columnar HuggingFace Spark
Zapytaj o tę usługę

Dostarczane formaty wyjściowe

.parquetkolumnowy, skompresowany
.jsonlJSON rozdzielany znakami nowej linii
.arrowApache Arrow IPC
.csvna życzenie
HF Datasetpush_to_hub ready
IndywidualniePaństwa schemat
03 · Czyszczenie danych i QA

Czyste dane to fundament każdego dobrego modelu

Państwa surowy korpus przechodzi przez pełny pipeline czyszczenia: deduplikację, wykrywanie języka, normalizację, usuwanie danych osobowych, filtrowanie treści toksycznych i ocenę jakości. Otrzymują Państwo czysty, zaudytowany zbiór danych wraz z pełnym raportem.

deduplikacja usuwanie danych osobowych filtr językowy ocena jakości filtr toksyczności
Zapytaj o tę usługę
Usunięte zduplikowane wiersze 12.4%
Usunięte dane osobowe 847
Odfiltrowane wiersze niskiej jakości 3.1%
Końcowa ocena jakości 0.97 / 1.00
04 · Zbiory ewaluacyjne

Rzetelna odpowiedź, czy model naprawdę się poprawia

Budujemy wydzielone zbiory ewaluacyjne i benchmarkowe z etykietami referencyjnymi zweryfikowanymi przez ludzi. Projektujemy je tak, aby ujawniały słabe strony modelu i pozwalały śledzić postępy fine-tuningu między kolejnymi przebiegami treningu.

benchmarks etykiety od ludzi zbiory held-out zgodność annotatorów
Zapytaj o tę usługę
1

Definicja zadania

Wspólnie z Państwem ustalamy wymiary oceny, kryteria punktacji i pokrycie przypadków brzegowych.

2

Annotacja przez ludzi

Etykiety tworzą i weryfikują ludzie, a zgodność między annotatorami jest mierzona.

3

Dostawa benchmarku

Zbiór ewaluacyjny w formatach JSONL i Parquet ze skryptem oceniającym. Gotowy do użycia w Państwa środowisku ewaluacyjnym.

05 · Chunking dla RAG

Dane, dzięki którym wyszukiwanie naprawdę działa

Segmentujemy, dzielimy na fragmenty i wzbogacamy dokumenty dla pipeline'ów Retrieval-Augmented Generation. Strategię chunkingu, ustawienia nakładania się fragmentów i wzbogacanie metadanych dostrajamy do Państwa wektorowej bazy danych i modelu embeddingów.

RAG embeddings chunking metadane gotowe dla baz wektorowych
Zapytaj o tę usługę
"chunk_id": "doc_42_chunk_7",
"text": "The transformer architecture...",
"tokens": 256,
"overlap": 32,
"source_page": 14

Zgodne z Pinecone, Weaviate, Qdrant, pgvector, Chroma i innymi.

06 · Pipeline'y na zamówienie

Cykliczne pipeline'y dopasowane do Państwa sposobu pracy

Zespołom ze stałym zapotrzebowaniem na dane budujemy powtarzalne pipeline'y przetwarzania wsadowego: cotygodniowe zadania, konwertery formatów, narzędzia do anotacji i automatyczne raporty QA. Działają one bez ręcznej obsługi.

zadania cykliczne automatyzacja narzędzia do annotacji raporty QA
Porozmawiajmy
Partia tygodniowa · w każdy poniedziałek o 02:00 UTC
Automatyczny raport QA wysyłany e-mailem
2 wiersze oznaczone do ręcznej weryfikacji
48 291 wierszy dostarczonych · średnia ocena 0,97
07 · Kuracja danych on-premise
On-premise w Niemczech i UE · bez przechowywania w chmurze

Dla organizacji, które nie mogą wysyłać danych na zewnątrz

Dla banków, placówek ochrony zdrowia, instytucji publicznych i innych organizacji regulowanych cały nasz pipeline kuracji, czyli usuwanie danych osobowych, deduplikacja, strukturyzacja i ocena jakości, może działać w całości on-premise. Bez przechowywania w chmurze, bez serwerów w USA, z szyfrowaniem AES-256 na każdym etapie i na podstawie podpisanej umowy powierzenia przetwarzania danych zgodnie z art. 28 RODO.

on-premise bez chmury AES-256 art. 28 RODO banki i ochrona zdrowia sektor publiczny
Porozmawiajmy o kuracji on-premise Więcej o kuracji danych
Państwa serwery lub nasze w Niemczech, nigdy w chmurze
Szyfrowanie AES-256 danych w spoczynku, przez cały czas przetwarzania
Podpisana umowa powierzenia przetwarzania (art. 28 RODO)
Brak transferu do chmury, z założenia, a nie tylko na mocy polityki
Zacznij

Nie wiedzą Państwo, której usługi potrzebują?

Proszę opisać swoje dane i swój cel. Powiemy dokładnie, co z nimi zrobić.

Porozmawiajmy Zobacz cennik