Services

Ce que nous faisons

Structuration de données de bout en bout pour le fine-tuning de LLM, le pré-entraînement, l'évaluation et les pipelines RAG.

01 · Création de jeux de données JSONL

Des données d'entraînement dont votre modèle apprend vraiment

Nous concevons, construisons et validons des jeux de données JSONL pour le fine-tuning. Le schéma de chaque jeu de données correspond à l'architecture de votre modèle. Le format, les filtres de qualité et l'annotation sont adaptés à votre cas d'usage.

instruction-tuning DPO pairs RLHF chat format completion
Demander ce service
1

Conception du schéma

Nous définissons la structure JSON exacte dont votre framework d'entraînement a besoin, par exemple OpenAI, Hugging Face ou Axolotl.

2

Transformation des données

Les données brutes sont converties, nettoyées et mises au format du schéma convenu, avec déduplication et normalisation.

3

Validation de la qualité

Chaque ligne est validée par rapport au schéma. Un score de qualité est attribué et les lignes signalées sont vérifiées manuellement.

4

Livraison avec fiche de données

Fichier JSONL final, fiche de données, rapport statistique et jeu de validation d'échantillon.

02 · Conversion Parquet

Des jeux de données volumineux, en colonnes et rapides

Nous convertissons de grands jeux de données brutes en fichiers Parquet au schéma optimisé, prêts à être chargés via Hugging Face Datasets, Apache Spark, S3, BigQuery ou tout autre stockage de données en colonnes.

pré-entraînement columnar HuggingFace Spark
Demander ce service

Formats de sortie livrés

.parqueten colonnes, compressé
.jsonlJSON délimité par des sauts de ligne
.arrowApache Arrow IPC
.csvsur demande
HF Datasetpush_to_hub ready
Sur mesurevotre schéma
03 · Nettoyage et contrôle qualité des données

Des données propres sont la base de tout bon modèle

Nous faisons passer votre corpus brut par un pipeline de nettoyage complet : déduplication, détection de la langue, normalisation, suppression des données personnelles, filtrage des contenus toxiques et score de qualité. Vous recevez un jeu de données propre et audité, accompagné d'un rapport complet.

déduplication suppression des données personnelles filtre de langue score de qualité filtre de toxicité
Demander ce service
Lignes en double supprimées 12.4%
Données personnelles supprimées 847
Lignes de faible qualité filtrées 3.1%
Score de qualité final 0.97 / 1.00
04 · Jeux d'évaluation

Sachez si votre modèle progresse réellement

Nous construisons des jeux d'évaluation et de benchmark tenus à l'écart de l'entraînement, dont les étiquettes de référence sont vérifiées par des humains. Ils sont conçus pour révéler les faiblesses du modèle et suivre les progrès du fine-tuning d'un cycle d'entraînement à l'autre.

benchmarks étiquettes humaines jeux de test réservés accord inter-annotateurs
Demander ce service
1

Définition de la tâche

Nous définissons avec vous les dimensions d'évaluation, les grilles de notation et la couverture des cas limites.

2

Annotation humaine

Les étiquettes sont créées et vérifiées par des relecteurs humains, avec mesure de l'accord inter-annotateurs.

3

Livraison du benchmark

Jeu d'évaluation en JSONL et Parquet avec un script de notation. Prêt à être intégré à votre environnement d'évaluation.

05 · Découpage RAG

Des données de recherche qui retrouvent vraiment l'information

Nous segmentons, découpons et enrichissons vos documents pour les pipelines de génération augmentée par récupération (RAG). La stratégie de découpage, les paramètres de chevauchement et l'enrichissement des métadonnées sont réglés en fonction de votre base vectorielle et de votre modèle d'embedding.

RAG embeddings chunking métadonnées prêt pour base vectorielle
Demander ce service
"chunk_id": "doc_42_chunk_7",
"text": "The transformer architecture...",
"tokens": 256,
"overlap": 32,
"source_page": 14

Compatible avec Pinecone, Weaviate, Qdrant, pgvector, Chroma et d'autres.

06 · Pipelines sur mesure

Des pipelines récurrents conçus autour de vos processus

Pour les équipes dont les besoins en données sont continus, nous construisons des pipelines de traitement par lots reproductibles, qui tournent sans intervention : traitements hebdomadaires, convertisseurs de formats, outils d'annotation et rapports de contrôle qualité automatisés.

tâches récurrentes automatisation outils d'annotation rapports QA
Parlons-en
Lot hebdomadaire · chaque lundi à 02:00 UTC
Rapport QA automatique envoyé par e-mail
2 lignes signalées pour vérification manuelle
48 291 lignes livrées · score moyen 0,97
07 · Curation de données sur site
Sur site en Allemagne et dans l'UE · Aucun stockage cloud

Pour les organisations dont les données ne peuvent pas sortir

Banques, établissements de santé, administrations et autres organisations réglementées peuvent faire exécuter l'intégralité de notre pipeline de curation sur site : suppression des données personnelles, déduplication, structuration et score de qualité. Aucun stockage cloud, aucun serveur américain, un chiffrement AES-256 de bout en bout et un contrat de sous-traitance signé au sens de l'art. 28 du RGPD.

on-premise sans cloud AES-256 art. 28 RGPD banques et santé secteur public
Parler de la curation sur site En savoir plus sur la curation de données
Vos serveurs ou les nôtres en Allemagne, jamais dans le cloud
Chiffrement AES-256 au repos, pendant tout le traitement
Contrat de sous-traitance signé (art. 28 RGPD)
Aucun transfert vers le cloud, par conception et pas seulement par règle
Pour commencer

Vous ne savez pas quel service vous convient ?

Décrivez vos données et votre objectif. Nous vous dirons précisément quoi en faire.

Nous contacter Voir les tarifs