Estructuración de datos de principio a fin para pipelines de fine-tuning, preentrenamiento, evaluación y RAG de LLM.
Diseñamos, creamos y validamos conjuntos de datos JSONL para fine-tuning. El esquema de cada conjunto de datos se ajusta a la arquitectura de su modelo, con el formato, los filtros de calidad y la anotación adaptados a su caso de uso.
Solicitar este servicioDefinimos la estructura JSON exacta que necesita su framework de entrenamiento, por ejemplo OpenAI, Hugging Face o Axolotl.
Los datos en bruto se convierten, se limpian y se adaptan al esquema acordado, con deduplicación y normalización.
Cada fila se valida contra el esquema. Se asigna una puntuación de calidad y las filas marcadas se revisan manualmente.
Archivo JSONL final, ficha de datos, informe estadístico y un conjunto de validación de muestra.
Convertimos grandes conjuntos de datos en bruto en archivos Parquet con esquema optimizado, listos para su ingesta mediante Hugging Face Datasets, Apache Spark, S3, BigQuery o cualquier otro almacén de datos columnar.
Solicitar este servicioFormatos de salida que entregamos
Pasamos su corpus en bruto por un pipeline de limpieza completo: deduplicación, detección de idioma, normalización, eliminación de datos personales, filtrado de toxicidad y puntuación de calidad. Usted recibe un conjunto de datos limpio y auditado, con un informe completo.
Solicitar este servicioCreamos conjuntos de evaluación reservados y de benchmark con etiquetas de referencia verificadas por personas, diseñados para sacar a la luz los puntos débiles del modelo y seguir el avance del fine-tuning de una ejecución de entrenamiento a otra.
Solicitar este servicioDefinimos con usted las dimensiones de evaluación, las rúbricas de puntuación y la cobertura de casos límite.
Las etiquetas las crean y verifican revisores humanos, con medición del acuerdo entre anotadores.
Conjunto de evaluación en JSONL y Parquet con un script de puntuación. Listo para integrarse en su entorno de evaluación.
Segmentamos, fragmentamos y enriquecemos documentos para pipelines de generación aumentada por recuperación (RAG). La estrategia de chunking, el solapamiento y el enriquecimiento de metadatos se ajustan a su base de datos vectorial y a su modelo de embeddings.
Solicitar este servicioCompatible con Pinecone, Weaviate, Qdrant, pgvector, Chroma y otros.
Para los equipos con necesidades de datos continuas creamos pipelines de procesamiento por lotes repetibles que funcionan sin intervención: tareas semanales, conversores de formato, herramientas de anotación e informes automáticos de control de calidad.
HablemosBancos, proveedores sanitarios, organismos públicos y otras organizaciones reguladas pueden ejecutar nuestro pipeline de curación completo íntegramente on-premise: eliminación de datos personales, deduplicación, estructuración y puntuación de calidad. Sin almacenamiento en la nube, sin servidores en EE. UU., con cifrado AES-256 en todo el proceso y al amparo de un contrato de encargo del tratamiento firmado conforme al art. 28 del RGPD.
Hablar de la curación on-premise Más sobre la curación de datosDescriba sus datos y su objetivo. Le diremos exactamente qué hacer con ellos.