Servicios

Qué hacemos

Estructuración de datos de principio a fin para pipelines de fine-tuning, preentrenamiento, evaluación y RAG de LLM.

01 · Creación de conjuntos de datos JSONL

Datos de entrenamiento de los que su modelo puede aprender de verdad

Diseñamos, creamos y validamos conjuntos de datos JSONL para fine-tuning. El esquema de cada conjunto de datos se ajusta a la arquitectura de su modelo, con el formato, los filtros de calidad y la anotación adaptados a su caso de uso.

instruction-tuning DPO pairs RLHF chat format completion
Solicitar este servicio
1

Diseño del esquema

Definimos la estructura JSON exacta que necesita su framework de entrenamiento, por ejemplo OpenAI, Hugging Face o Axolotl.

2

Transformación de datos

Los datos en bruto se convierten, se limpian y se adaptan al esquema acordado, con deduplicación y normalización.

3

Validación de calidad

Cada fila se valida contra el esquema. Se asigna una puntuación de calidad y las filas marcadas se revisan manualmente.

4

Entrega con ficha de datos

Archivo JSONL final, ficha de datos, informe estadístico y un conjunto de validación de muestra.

02 · Conversión a Parquet

Conjuntos de datos a gran escala, columnares y rápidos

Convertimos grandes conjuntos de datos en bruto en archivos Parquet con esquema optimizado, listos para su ingesta mediante Hugging Face Datasets, Apache Spark, S3, BigQuery o cualquier otro almacén de datos columnar.

preentrenamiento columnar HuggingFace Spark
Solicitar este servicio

Formatos de salida que entregamos

.parquetcolumnar, comprimido
.jsonlJSON delimitado por saltos de línea
.arrowApache Arrow IPC
.csva petición
HF Datasetpush_to_hub ready
A medidasu esquema
03 · Limpieza de datos y control de calidad

Los datos limpios son la base de todo buen modelo

Pasamos su corpus en bruto por un pipeline de limpieza completo: deduplicación, detección de idioma, normalización, eliminación de datos personales, filtrado de toxicidad y puntuación de calidad. Usted recibe un conjunto de datos limpio y auditado, con un informe completo.

deduplicación eliminación de datos personales filtro de idioma puntuación de calidad filtro de toxicidad
Solicitar este servicio
Filas duplicadas eliminadas 12.4%
Datos personales eliminados 847
Filas de baja calidad filtradas 3.1%
Puntuación de calidad final 0.97 / 1.00
04 · Conjuntos de evaluación

Sepa si su modelo está mejorando de verdad

Creamos conjuntos de evaluación reservados y de benchmark con etiquetas de referencia verificadas por personas, diseñados para sacar a la luz los puntos débiles del modelo y seguir el avance del fine-tuning de una ejecución de entrenamiento a otra.

benchmarks etiquetas humanas conjuntos reservados acuerdo entre anotadores
Solicitar este servicio
1

Definición de la tarea

Definimos con usted las dimensiones de evaluación, las rúbricas de puntuación y la cobertura de casos límite.

2

Anotación humana

Las etiquetas las crean y verifican revisores humanos, con medición del acuerdo entre anotadores.

3

Entrega del benchmark

Conjunto de evaluación en JSONL y Parquet con un script de puntuación. Listo para integrarse en su entorno de evaluación.

05 · Chunking para RAG

Datos de recuperación que recuperan de verdad

Segmentamos, fragmentamos y enriquecemos documentos para pipelines de generación aumentada por recuperación (RAG). La estrategia de chunking, el solapamiento y el enriquecimiento de metadatos se ajustan a su base de datos vectorial y a su modelo de embeddings.

RAG embeddings chunking metadatos listo para bases vectoriales
Solicitar este servicio
"chunk_id": "doc_42_chunk_7",
"text": "The transformer architecture...",
"tokens": 256,
"overlap": 32,
"source_page": 14

Compatible con Pinecone, Weaviate, Qdrant, pgvector, Chroma y otros.

06 · Pipelines a medida

Pipelines recurrentes creados en torno a su flujo de trabajo

Para los equipos con necesidades de datos continuas creamos pipelines de procesamiento por lotes repetibles que funcionan sin intervención: tareas semanales, conversores de formato, herramientas de anotación e informes automáticos de control de calidad.

tareas recurrentes automatización herramientas de anotación informes de QA
Hablemos
Lote semanal · cada lunes a las 02:00 UTC
Informe de QA automático enviado por correo
2 filas marcadas para revisión manual
48.291 filas entregadas · puntuación media 0,97
07 · Curación de datos on-premise
On-premise en Alemania y la UE · sin almacenamiento en la nube

Para organizaciones que no pueden enviar datos fuera

Bancos, proveedores sanitarios, organismos públicos y otras organizaciones reguladas pueden ejecutar nuestro pipeline de curación completo íntegramente on-premise: eliminación de datos personales, deduplicación, estructuración y puntuación de calidad. Sin almacenamiento en la nube, sin servidores en EE. UU., con cifrado AES-256 en todo el proceso y al amparo de un contrato de encargo del tratamiento firmado conforme al art. 28 del RGPD.

on-premise sin nube AES-256 art. 28 RGPD banca y sanidad sector público
Hablar de la curación on-premise Más sobre la curación de datos
Sus servidores o los nuestros en Alemania, nunca en la nube
Cifrado AES-256 en reposo, durante todo el tratamiento
Contrato de encargo del tratamiento firmado (art. 28 RGPD)
Sin transferencia a la nube, por diseño y no solo por política
Empezar

¿No sabe qué servicio necesita?

Describa sus datos y su objetivo. Le diremos exactamente qué hacer con ellos.

Hable con nosotros Ver precios