On-premise en Alemania y la UE · Sin almacenamiento en la nube

Datos de entrenamiento para IA con licencia.
Y el pipeline para limpiar los suyos.

CurateLM suministra corpus de texto y código con licencia verificada para el entrenamiento de LLM. También aplicamos el mismo pipeline de curación a sus propios datos: eliminación de datos personales, deduplicación, detección de idioma y puntuación de calidad, con tratamiento en Alemania y la UE.

5.5B+tokens de texto multilingüe en más de 150 idiomas
corpus_sample.jsonl { "text": "Die Studie untersucht, wie …", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "pii_scrubbed": true }
2B+tokens de código con licencia verificada, de COBOL a Rust
payroll.cbl · COBOL · Apache-2.0 · parses cleanly IDENTIFICATION DIVISION. PROGRAM-ID. PAYCALC. PROCEDURE DIVISION. COMPUTE NET-PAY = GROSS-PAY - TAX-AMT. DISPLAY "NET PAY: " NET-PAY. STOP RUN.
700M+tokens de texto biomédico en 31 nichos
biomedical_sample.jsonl { "text": "The compound inhibits …", "language": "en", "niche": "pharmacology", "license": "CC-BY-4.0", "quality_score": 0.93, "pii_scrubbed": true }
Crece a diario
5.5B+tokens de texto multilingüe
150+idiomas, muchos de ellos lenguas minoritarias y de pocos recursos
2B+tokens de código fuente con licencia verificada
700M+tokens de texto biomédico

Los corpus crecen cada día. Las cifras exactas y actualizadas figuran en la ficha del conjunto de datos.

Berlín · Residencia de datos en la UE · Licencia verificada en cada registro · Contrato de encargo del tratamiento conforme al art. 28 del RGPD
Qué hacemos

Tres formas de trabajar con CurateLM

Conjuntos de datos

Licencie corpus ya preparados

Texto multilingüe en más de 150 idiomas, código fuente que incluye lenguajes empresariales heredados y datos biomédicos. Cada registro lleva su licencia, su idioma y su puntuación de calidad.

Ver los conjuntos de datos
Curación de datos B2B

Encargue la curación de sus datos

Convertimos sus documentos, escaneos, audio y vídeo en datos de entrenamiento estructurados, sin datos personales y con un contrato de encargo del tratamiento firmado. En la UE o en sus instalaciones.

Cómo funciona el servicio
Benchmark de calidad

Haga medir un conjunto de datos

Un informe con mediciones sobre cualquier conjunto de datos de texto o código: duplicados, datos personales, cumplimiento de licencias, validez sintáctica y solapamiento con conjuntos de evaluación. Antes y después de la curación.

Qué incluye el informe
Nuestros datos

Corpus que puede licenciar hoy

Tres corpus creados con una única política de licencias: solo dominio público, CC0, CC BY y licencias de código permisivas. El material no comercial, sin obras derivadas, de compartir igual y copyleft se rechaza en la recogida.

Texto multilingüe

  • Más de 5500 millones de tokens, en crecimiento diario
  • Más de 150 idiomas en 140 nichos temáticos
  • Especial atención a lenguas minoritarias y de pocos recursos
  • Ciencia, derecho, administración pública, medicina, finanzas, ingeniería

Código fuente

  • Más de 2000 millones de tokens, en crecimiento
  • Heredados: COBOL, Fortran, JCL, PL/I
  • Modernos: Rust, Go, Java, C, C++, TypeScript y otros
  • Solo licencias permisivas, comprobadas en cada repositorio

Biomedicina y ciencias de la vida

  • Más de 700 millones de tokens en 31 nichos
  • Farmacología, neurología, bioquímica, inmunología
  • Registros estructurados: etiquetado de medicamentos, ensayos, afinidades de unión
  • Sin datos a nivel de paciente
Todos los conjuntos de datos y la política de licencias
Benchmark

Un informe de calidad para cualquier conjunto de datos

La mayoría de los conjuntos de datos se venden por número de tokens. Nosotros medimos lo que hay dentro: cuánto está duplicado, qué datos personales se detectan, si las licencias se ajustan a su política, si el código se puede analizar sintácticamente y si se han filtrado benchmarks de evaluación. El informe solo contiene cifras, nunca su texto.

  • Texto y código en un solo informe
  • Antes y después de la curación, en paralelo
  • Comprobaciones con conjuntos de evaluación públicos y con los suyos privados
  • Ejecución local: ningún dato sale de la máquina
Curación de datos

De los datos en bruto a los datos listos en cuatro pasos

Usted nos envía sus datos en bruto. Nosotros le devolvemos conjuntos de datos de entrenamiento listos para producción, en el plazo que necesite y totalmente documentados.

01

Envíe los datos en bruto

PDF, HTML, CSV, transcripciones de audio, extracciones web: cualquier formato, cualquier idioma, cualquier volumen.

02

Limpiamos y estructuramos

Deduplicación, normalización, diseño del esquema, eliminación de datos personales, filtrado de calidad y anotación.

03

Conversión de formato

Salida en JSONL, Parquet o un esquema a medida, optimizada y validada para su pipeline.

04

Entrega

Cada conjunto de datos se entrega con una ficha de datos, un informe de estadísticas de calidad y un archivo de validación de muestra.

Cómo funciona el servicio

Sus datos nunca salen de las instalaciones

Todos los conjuntos de datos se tratan on-premise en Alemania y la UE. Sin almacenamiento en la nube en ningún momento. Contrato de encargo del tratamiento conforme al art. 28 del RGPD en todos los proyectos. Ninguna transferencia de datos a EE. UU. ni a terceros países.

Cifrado AES-256

Los datos se cifran en reposo con AES-256-GCM. Las claves se definen por sesión y nunca se escriben en disco.

La UE primero · Conforme al art. 28 del RGPD

Empresa registrada en Berlín. En todos los proyectos ofrecemos un contrato de encargo del tratamiento conforme al art. 28 del RGPD y un NDA.

AES-256-GCM Art. 28 RGPD Residencia de datos en la UE NDA Standard
Servicios

Formatos y servicios para su pipeline

Creación de JSONL

Formatos de instrucciones, chat, pares DPO y completado, adaptados a la arquitectura de su modelo.

Conversión a Parquet

Archivos Parquet columnares con esquema optimizado para el preentrenamiento a gran escala mediante Hugging Face, S3 o BigQuery.

Limpieza de datos

Deduplicación, detección de idioma, normalización, eliminación de datos personales, filtrado de toxicidad y puntuación de calidad.

Chunking para RAG

Segmentación de documentos, estrategia de chunking y enriquecimiento de metadatos para el pipeline de su base de datos vectorial.

Ver todos los servicios

Díganos qué datos necesita o qué datos tiene

Respondemos en el plazo de un día hábil con la ficha del conjunto de datos, un plan de muestra o una propuesta de alcance para su proyecto.

Solicitar la ficha Ver precios