Datos de entrenamiento para IA con licencia.
Y el pipeline para limpiar los suyos.
CurateLM suministra corpus de texto y código con licencia verificada para el entrenamiento de LLM. También aplicamos el mismo pipeline de curación a sus propios datos: eliminación de datos personales, deduplicación, detección de idioma y puntuación de calidad, con tratamiento en Alemania y la UE.
Los corpus crecen cada día. Las cifras exactas y actualizadas figuran en la ficha del conjunto de datos.
Tres formas de trabajar con CurateLM
Licencie corpus ya preparados
Texto multilingüe en más de 150 idiomas, código fuente que incluye lenguajes empresariales heredados y datos biomédicos. Cada registro lleva su licencia, su idioma y su puntuación de calidad.
Ver los conjuntos de datosEncargue la curación de sus datos
Convertimos sus documentos, escaneos, audio y vídeo en datos de entrenamiento estructurados, sin datos personales y con un contrato de encargo del tratamiento firmado. En la UE o en sus instalaciones.
Cómo funciona el servicioHaga medir un conjunto de datos
Un informe con mediciones sobre cualquier conjunto de datos de texto o código: duplicados, datos personales, cumplimiento de licencias, validez sintáctica y solapamiento con conjuntos de evaluación. Antes y después de la curación.
Qué incluye el informeCorpus que puede licenciar hoy
Tres corpus creados con una única política de licencias: solo dominio público, CC0, CC BY y licencias de código permisivas. El material no comercial, sin obras derivadas, de compartir igual y copyleft se rechaza en la recogida.
Texto multilingüe
- Más de 5500 millones de tokens, en crecimiento diario
- Más de 150 idiomas en 140 nichos temáticos
- Especial atención a lenguas minoritarias y de pocos recursos
- Ciencia, derecho, administración pública, medicina, finanzas, ingeniería
Código fuente
- Más de 2000 millones de tokens, en crecimiento
- Heredados: COBOL, Fortran, JCL, PL/I
- Modernos: Rust, Go, Java, C, C++, TypeScript y otros
- Solo licencias permisivas, comprobadas en cada repositorio
Biomedicina y ciencias de la vida
- Más de 700 millones de tokens en 31 nichos
- Farmacología, neurología, bioquímica, inmunología
- Registros estructurados: etiquetado de medicamentos, ensayos, afinidades de unión
- Sin datos a nivel de paciente
Un informe de calidad para cualquier conjunto de datos
La mayoría de los conjuntos de datos se venden por número de tokens. Nosotros medimos lo que hay dentro: cuánto está duplicado, qué datos personales se detectan, si las licencias se ajustan a su política, si el código se puede analizar sintácticamente y si se han filtrado benchmarks de evaluación. El informe solo contiene cifras, nunca su texto.
- Texto y código en un solo informe
- Antes y después de la curación, en paralelo
- Comprobaciones con conjuntos de evaluación públicos y con los suyos privados
- Ejecución local: ningún dato sale de la máquina
De los datos en bruto a los datos listos en cuatro pasos
Usted nos envía sus datos en bruto. Nosotros le devolvemos conjuntos de datos de entrenamiento listos para producción, en el plazo que necesite y totalmente documentados.
Envíe los datos en bruto
PDF, HTML, CSV, transcripciones de audio, extracciones web: cualquier formato, cualquier idioma, cualquier volumen.
Limpiamos y estructuramos
Deduplicación, normalización, diseño del esquema, eliminación de datos personales, filtrado de calidad y anotación.
Conversión de formato
Salida en JSONL, Parquet o un esquema a medida, optimizada y validada para su pipeline.
Entrega
Cada conjunto de datos se entrega con una ficha de datos, un informe de estadísticas de calidad y un archivo de validación de muestra.
Sus datos nunca salen de las instalaciones
Todos los conjuntos de datos se tratan on-premise en Alemania y la UE. Sin almacenamiento en la nube en ningún momento. Contrato de encargo del tratamiento conforme al art. 28 del RGPD en todos los proyectos. Ninguna transferencia de datos a EE. UU. ni a terceros países.
Cifrado AES-256
Los datos se cifran en reposo con AES-256-GCM. Las claves se definen por sesión y nunca se escriben en disco.
La UE primero · Conforme al art. 28 del RGPD
Empresa registrada en Berlín. En todos los proyectos ofrecemos un contrato de encargo del tratamiento conforme al art. 28 del RGPD y un NDA.
Formatos y servicios para su pipeline
Creación de JSONL
Formatos de instrucciones, chat, pares DPO y completado, adaptados a la arquitectura de su modelo.
Conversión a Parquet
Archivos Parquet columnares con esquema optimizado para el preentrenamiento a gran escala mediante Hugging Face, S3 o BigQuery.
Limpieza de datos
Deduplicación, detección de idioma, normalización, eliminación de datos personales, filtrado de toxicidad y puntuación de calidad.
Chunking para RAG
Segmentación de documentos, estrategia de chunking y enriquecimiento de metadatos para el pipeline de su base de datos vectorial.
Díganos qué datos necesita o qué datos tiene
Respondemos en el plazo de un día hábil con la ficha del conjunto de datos, un plan de muestra o una propuesta de alcance para su proyecto.