Diensten

Wat wij doen

Datastructurering van begin tot eind voor het finetunen, pre-trainen en evalueren van LLM's en voor RAG-pipelines.

01 · JSONL-datasets maken

Trainingsdata waar uw model echt van leert

Wij ontwerpen, bouwen en valideren JSONL-datasets voor finetuning. Het schema van elke dataset sluit aan op uw modelarchitectuur, en formaat, kwaliteitsfilters en annotatie zijn afgestemd op uw toepassing.

instruction-tuning DPO pairs RLHF chat format completion
Vraag deze dienst aan
1

Schema-ontwerp

We leggen de exacte JSON-structuur vast die uw trainingsframework nodig heeft, bijvoorbeeld OpenAI, Hugging Face of Axolotl.

2

Datatransformatie

Ruwe invoer wordt geconverteerd, opgeschoond en in het afgesproken schema gezet, met deduplicatie en normalisatie.

3

Kwaliteitscontrole

Elke rij wordt tegen het schema gevalideerd. Er wordt een kwaliteitsscore toegekend en gemarkeerde rijen worden handmatig gecontroleerd.

4

Levering met datakaart

Definitief JSONL-bestand, datakaart, statistiekrapport en een validatieset als steekproef.

02 · Parquet-conversie

Grootschalige datasets, kolomgeoriënteerd en snel

Wij zetten grote ruwe datasets om in Parquet-bestanden met geoptimaliseerd schema, klaar om in te laden via Hugging Face Datasets, Apache Spark, S3, BigQuery of een andere kolomgeoriënteerde dataopslag.

pre-training columnar HuggingFace Spark
Vraag deze dienst aan

Uitvoerformaten die we leveren

.parquetkolomgebaseerd, gecomprimeerd
.jsonlJSON, één record per regel
.arrowApache Arrow IPC
.csvop aanvraag
HF Datasetpush_to_hub ready
Op maatuw schema
03 · Data opschonen en QA

Schone data is de basis van elk goed model

Uw ruwe corpus doorloopt een volledige opschoonpipeline: deduplicatie, taaldetectie, normalisatie, persoonsgegevens verwijderen, filtering op toxiciteit en kwaliteitsbeoordeling. U ontvangt een schone, gecontroleerde dataset met een volledig rapport.

deduplicatie verwijdering persoonsgegevens taalfilter kwaliteitsscore toxiciteitsfilter
Vraag deze dienst aan
Dubbele rijen verwijderd 12.4%
Persoonsgegevens verwijderd 847
Rijen van lage kwaliteit gefilterd 3.1%
Uiteindelijke kwaliteitsscore 0.97 / 1.00
04 · Evaluatiedatasets

Weet of uw model echt beter wordt

Wij bouwen afgezonderde evaluatie- en benchmarksets met door mensen geverifieerde ground-truth-labels. Ze zijn ontworpen om zwakke plekken van het model bloot te leggen en de voortgang van het finetunen over trainingsruns heen te volgen.

benchmarks menselijke labels held-out-sets overeenstemming tussen annotatoren
Vraag deze dienst aan
1

Taakdefinitie

Samen met u bepalen we de evaluatiedimensies, de beoordelingsrubrieken en de dekking van randgevallen.

2

Menselijke annotatie

Labels worden gemaakt en gecontroleerd door menselijke reviewers, met meting van de overeenstemming tussen annotatoren.

3

Levering van de benchmark

Evaluatieset in JSONL en Parquet met een scoringsscript. Direct te gebruiken in uw evaluatieomgeving.

05 · RAG-chunking

Retrievaldata die ook echt iets terugvindt

Wij segmenteren, chunken en verrijken documenten voor pipelines voor Retrieval-Augmented Generation. Chunkingstrategie, overlap en verrijking met metadata worden afgestemd op uw vectordatabase en embeddingmodel.

RAG embeddings chunking metadata klaar voor vectordatabases
Vraag deze dienst aan
"chunk_id": "doc_42_chunk_7",
"text": "The transformer architecture...",
"tokens": 256,
"overlap": 32,
"source_page": 14

Compatibel met Pinecone, Weaviate, Qdrant, pgvector, Chroma en andere.

06 · Pipelines op maat

Terugkerende pipelines, gebouwd rond uw workflow

Voor teams met een doorlopende databehoefte bouwen wij herhaalbare pipelines voor batchverwerking die zonder tussenkomst draaien: wekelijkse jobs, formaatconverters, annotatietooling en geautomatiseerde QA-rapportage.

terugkerende taken automatisering annotatietools QA-rapporten
Laten we praten
Wekelijkse batch · elke maandag 02:00 UTC
Automatisch QA-rapport per e-mail
2 rijen gemarkeerd voor handmatige controle
48.291 rijen geleverd · gemiddelde score 0,97
07 · On-premise datacuratie
On-premise in Duitsland en de EU · geen cloudopslag

Voor organisaties die data niet naar buiten mogen sturen

Banken, zorgaanbieders, overheidsinstanties en andere gereguleerde organisaties kunnen onze volledige curatiepipeline geheel on-premise laten draaien: persoonsgegevens verwijderen, deduplicatie, structurering en kwaliteitsbeoordeling. Geen cloudopslag, geen Amerikaanse servers, overal AES-256-versleuteling, geleverd onder een getekende verwerkersovereenkomst volgens art. 28 AVG.

on-premise geen cloud AES-256 art. 28 AVG banken en zorg overheid
Bespreek on-premise curatie Meer over datacuratie
Uw servers of de onze in Duitsland, nooit in de cloud
AES-256-versleuteling in rust, gedurende de hele verwerking
Getekende verwerkersovereenkomst (art. 28 AVG)
Geen overdracht naar de cloud, technisch uitgesloten en niet alleen per beleid
Aan de slag

Weet u niet zeker welke dienst u nodig hebt?

Beschrijf uw data en uw doel. Wij vertellen u precies wat u ermee moet doen.

Neem contact op Bekijk prijzen