Conjuntos de datos

Datos de entrenamiento para LLM con licencia

Corpus de texto, código y biomedicina recogidos con una única y estricta política de licencias, sin datos personales, deduplicados y puntuados. Se entregan en JSONL o Parquet con la ficha del conjunto de datos.

01 · Texto multilingüe

Más de 5500 millones de tokens en más de 150 idiomas

Un corpus de texto creado para los idiomas y las materias que los rastreos web generales cubren mal. Se centra en lenguas minoritarias y de pocos recursos y en material institucional y especializado: ciencia, derecho, administración pública, medicina, finanzas e ingeniería.

Tokens
Más de 5500 millones, en crecimiento diario
Idiomas
Más de 150, incluidas muchas lenguas de pocos recursos
Nichos temáticos
140
Licencias
Dominio público, CC0, CC BY
Formatos
JSONL, Apache Parquet
02 · Código fuente

Código con licencia verificada, incluidos los lenguajes heredados

Bancos, aseguradoras y organismos públicos siguen funcionando con COBOL, Fortran, JCL y PL/I, y los modelos que modernizan esos sistemas necesitan datos de entrenamiento en esos lenguajes. Este corpus combina código empresarial heredado con lenguajes modernos. Solo se aceptan licencias permisivas, y la licencia se comprueba en cada repositorio.

Tokens
Más de 2000 millones, en crecimiento diario
Lenguajes heredados
COBOL, Fortran, JCL, PL/I
Lenguajes modernos
Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
Licencias
MIT, Apache-2.0, BSD, ISC, Unlicense. Sin GPL ni AGPL
Formatos
JSONL, Apache Parquet
03 · Biomedicina y ciencias de la vida

Más de 700 millones de tokens de texto biomédico, además de registros estructurados

Texto biomédico en 31 nichos y 33 idiomas, desde farmacología y neurología hasta medicina tropical y bioquímica. Junto a él se ofrecen registros estructurados para el descubrimiento de fármacos y el trabajo clínico. Este corpus no contiene datos a nivel de paciente.

No se ofrecen datos a nivel de paciente para gemelos digitales. Los informes de eventos adversos son expedientes regulatorios desidentificados, no una cohorte de pacientes, y no deben analizarse como tal.

Tokens
Más de 700 millones, en crecimiento
Documentos
Más de 2800
Nichos temáticos
31, entre ellos medicina, farmacología, neurología, medicina tropical, bioquímica, inmunología y epidemiología
Idiomas
33
Registros estructurados
Etiquetado regulatorio de medicamentos, informes de eventos adversos desidentificados, registros de ensayos clínicos, afinidades de unión medidas, anotaciones de genes y rutas
Casos de uso
Descubrimiento de dianas, mecanismos de acción de fármacos, optimización de moléculas, predicción de biomarcadores, selección de pacientes
Cobertura

Idiomas y materias del corpus de texto

Datos de entrenamiento para idiomas y materias difíciles de encontrar en otros lugares. Los volúmenes varían mucho según el idioma. Solicite la ficha del conjunto de datos para ver qué hay disponible en los que necesita.

Algunos de los idiomas

Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu

Algunas de las materias

Ciencia e investigación · Derecho, tribunales y legislación · Documentos gubernamentales y parlamentarios · Medicina · Medicina tradicional, ayurveda y medicina islámica (Tibb Nabawi) · Conocimiento indígena · Banca, finanzas y fiscalidad · Ingeniería y aeronáutica · Agricultura · Arquitectura · Astronomía y química · Lingüística · Teología y humanidades · Educación · Sistemas informáticos heredados

Qué lleva cada registro

Cada registro se entrega con su licencia, idioma, dominio, puntuación de calidad, número de tokens y un hash del contenido, para que pueda filtrar, auditar y reproducir su selección.

{ "text": "…", "language": "de", "niche": "medical", "license": "CC0-1.0", "quality_score": 0.91, "token_count": 1842, "text_hash": "9f2c…e41a" }
Política de licencias

Una sola regla para todo lo que recogemos

Un registro solo se admite si su propia licencia permite el uso comercial y la redistribución. Un registro sin licencia se rechaza, no se da por abierto.

Aceptado

  • Dominio público y CC0
  • CC BY, con la atribución entregada junto a los datos
  • Código: MIT, Apache-2.0, BSD, ISC, Unlicense

Rechazado

  • Licencias no comerciales (NC) y sin obras derivadas (ND)
  • Licencias de compartir igual (SA)
  • GPL, AGPL y otras licencias de código copyleft
  • Todo lo que no tenga licencia o la tenga poco clara
Cómo funciona la licencia

Del primer vistazo a la entrega

Ficha del conjunto de datos

Recibe la ficha del conjunto de datos con volúmenes, idiomas, nichos y distribución de licencias.

Muestra

Una muestra en el formato de entrega enseña el esquema y la calidad.

NDA y contrato

Firmamos un NDA y después acordamos el alcance, las condiciones de licencia y el precio.

Entrega

Transferencia cifrada de archivos JSONL o Parquet con documentación.

Preguntas habituales de los compradores

¿Podemos ver una muestra antes de firmar nada?

Sí. La ficha del conjunto de datos está disponible previa solicitud, y después enviamos una muestra breve en el formato de entrega. Los paquetes de evaluación más amplios se comparten bajo NDA.

¿Revelan de dónde proceden los datos?

No. El origen de los datos es confidencial. Cada registro lleva su licencia, y la atribución se entrega siempre que una licencia la exige. CurateLM garantiza en el contrato el cumplimiento de las licencias.

¿Se eliminan los datos personales?

El texto se limpia con detección automática de nombres, direcciones de correo electrónico, números de teléfono e identificadores similares. La detección automática no lo encuentra todo. Por eso informamos de las tasas detectadas y no afirmamos que no quede ninguno.

¿Podemos licenciar un solo idioma o nicho?

Sí. Cada registro está etiquetado con idioma y nicho, de modo que se puede extraer una parte por idioma, materia, clase de licencia o puntuación de calidad.

¿Entregan un informe de calidad con los datos?

Sí. Con el conjunto de datos se puede entregar un informe de benchmark. Mide duplicados, datos personales detectados, distribución de licencias y solapamiento con conjuntos de evaluación.

Solicite la ficha del conjunto de datos

Díganos qué idiomas, materias o lenguajes de programación necesita.

Solicitar la ficha