Datos de entrenamiento para LLM con licencia
Corpus de texto, código y biomedicina recogidos con una única y estricta política de licencias, sin datos personales, deduplicados y puntuados. Se entregan en JSONL o Parquet con la ficha del conjunto de datos.
Más de 5500 millones de tokens en más de 150 idiomas
Un corpus de texto creado para los idiomas y las materias que los rastreos web generales cubren mal. Se centra en lenguas minoritarias y de pocos recursos y en material institucional y especializado: ciencia, derecho, administración pública, medicina, finanzas e ingeniería.
- Tokens
- Más de 5500 millones, en crecimiento diario
- Idiomas
- Más de 150, incluidas muchas lenguas de pocos recursos
- Nichos temáticos
- 140
- Licencias
- Dominio público, CC0, CC BY
- Formatos
- JSONL, Apache Parquet
Código con licencia verificada, incluidos los lenguajes heredados
Bancos, aseguradoras y organismos públicos siguen funcionando con COBOL, Fortran, JCL y PL/I, y los modelos que modernizan esos sistemas necesitan datos de entrenamiento en esos lenguajes. Este corpus combina código empresarial heredado con lenguajes modernos. Solo se aceptan licencias permisivas, y la licencia se comprueba en cada repositorio.
- Tokens
- Más de 2000 millones, en crecimiento diario
- Lenguajes heredados
- COBOL, Fortran, JCL, PL/I
- Lenguajes modernos
- Rust, Go, Java, C, C++, JavaScript, TypeScript, MATLAB, Perl, Shell, SQL
- Licencias
- MIT, Apache-2.0, BSD, ISC, Unlicense. Sin GPL ni AGPL
- Formatos
- JSONL, Apache Parquet
Más de 700 millones de tokens de texto biomédico, además de registros estructurados
Texto biomédico en 31 nichos y 33 idiomas, desde farmacología y neurología hasta medicina tropical y bioquímica. Junto a él se ofrecen registros estructurados para el descubrimiento de fármacos y el trabajo clínico. Este corpus no contiene datos a nivel de paciente.
No se ofrecen datos a nivel de paciente para gemelos digitales. Los informes de eventos adversos son expedientes regulatorios desidentificados, no una cohorte de pacientes, y no deben analizarse como tal.
- Tokens
- Más de 700 millones, en crecimiento
- Documentos
- Más de 2800
- Nichos temáticos
- 31, entre ellos medicina, farmacología, neurología, medicina tropical, bioquímica, inmunología y epidemiología
- Idiomas
- 33
- Registros estructurados
- Etiquetado regulatorio de medicamentos, informes de eventos adversos desidentificados, registros de ensayos clínicos, afinidades de unión medidas, anotaciones de genes y rutas
- Casos de uso
- Descubrimiento de dianas, mecanismos de acción de fármacos, optimización de moléculas, predicción de biomarcadores, selección de pacientes
Idiomas y materias del corpus de texto
Datos de entrenamiento para idiomas y materias difíciles de encontrar en otros lugares. Los volúmenes varían mucho según el idioma. Solicite la ficha del conjunto de datos para ver qué hay disponible en los que necesita.
Algunos de los idiomas
Abkhazian · Acehnese · Afrikaans · Albanian · Amharic · Ancient Greek · Arabic · Armenian · Avar · Aymara · Azerbaijani · Bambara · Bashkir · Basque · Belarusian · Bengali · Bislama · Breton · Bulgarian · Burmese · Catalan · Cebuano · Chamorro · Chechen · Chichewa · Chinese · Cornish · Croatian · Czech · Danish · Dutch · Dzongkha · English · Esperanto · Estonian · Fijian · Finnish · French · Fula · Galician · Ge'ez · Georgian · German · Gothic · Greek · Guaraní · Gujarati · Hausa · Hawaiian · Hebrew · Hindi · Hungarian · Icelandic · Igbo · Indonesian · Inuktitut · Irish · Italian · Japanese · Javanese · Kazakh · Khmer · Kinyarwanda · Korean · Kyrgyz · Lao · Latin · Latvian · Lezgian · Lingala · Lithuanian · Lower Sorbian · Luganda · Macedonian · Maithili · Malay · Malayalam · Maltese · Manx · Māori · Marathi · Marshallese · Mon · Mongolian · Nahuatl · Nepali · Norwegian · Occitan · Odia · Oromo · Ossetian · Persian · Polish · Portuguese · Punjabi · Quechua · Romanian · Russian · Samoan · Sanskrit · Serbian · Sesotho · Shona · Sindhi · Sinhala · Slovak · Slovenian · Somali · Spanish · Sundanese · Swahili · Swedish · Tagalog · Tajik · Tamil · Tatar · Telugu · Thai · Tibetan · Tigrinya · Tok Pisin · Tongan · Tsonga · Tswana · Turkish · Turkmen · Ukrainian · Urdu · Uyghur · Uzbek · Vietnamese · Welsh · Wolof · Xhosa · Yoruba · Zulu
Algunas de las materias
Ciencia e investigación · Derecho, tribunales y legislación · Documentos gubernamentales y parlamentarios · Medicina · Medicina tradicional, ayurveda y medicina islámica (Tibb Nabawi) · Conocimiento indígena · Banca, finanzas y fiscalidad · Ingeniería y aeronáutica · Agricultura · Arquitectura · Astronomía y química · Lingüística · Teología y humanidades · Educación · Sistemas informáticos heredados
Qué lleva cada registro
Cada registro se entrega con su licencia, idioma, dominio, puntuación de calidad, número de tokens y un hash del contenido, para que pueda filtrar, auditar y reproducir su selección.
Una sola regla para todo lo que recogemos
Un registro solo se admite si su propia licencia permite el uso comercial y la redistribución. Un registro sin licencia se rechaza, no se da por abierto.
Aceptado
- Dominio público y CC0
- CC BY, con la atribución entregada junto a los datos
- Código: MIT, Apache-2.0, BSD, ISC, Unlicense
Rechazado
- Licencias no comerciales (NC) y sin obras derivadas (ND)
- Licencias de compartir igual (SA)
- GPL, AGPL y otras licencias de código copyleft
- Todo lo que no tenga licencia o la tenga poco clara
Del primer vistazo a la entrega
Ficha del conjunto de datos
Recibe la ficha del conjunto de datos con volúmenes, idiomas, nichos y distribución de licencias.
Muestra
Una muestra en el formato de entrega enseña el esquema y la calidad.
NDA y contrato
Firmamos un NDA y después acordamos el alcance, las condiciones de licencia y el precio.
Entrega
Transferencia cifrada de archivos JSONL o Parquet con documentación.
Preguntas habituales de los compradores
¿Podemos ver una muestra antes de firmar nada?
Sí. La ficha del conjunto de datos está disponible previa solicitud, y después enviamos una muestra breve en el formato de entrega. Los paquetes de evaluación más amplios se comparten bajo NDA.
¿Revelan de dónde proceden los datos?
No. El origen de los datos es confidencial. Cada registro lleva su licencia, y la atribución se entrega siempre que una licencia la exige. CurateLM garantiza en el contrato el cumplimiento de las licencias.
¿Se eliminan los datos personales?
El texto se limpia con detección automática de nombres, direcciones de correo electrónico, números de teléfono e identificadores similares. La detección automática no lo encuentra todo. Por eso informamos de las tasas detectadas y no afirmamos que no quede ninguno.
¿Podemos licenciar un solo idioma o nicho?
Sí. Cada registro está etiquetado con idioma y nicho, de modo que se puede extraer una parte por idioma, materia, clase de licencia o puntuación de calidad.
¿Entregan un informe de calidad con los datos?
Sí. Con el conjunto de datos se puede entregar un informe de benchmark. Mide duplicados, datos personales detectados, distribución de licencias y solapamiento con conjuntos de evaluación.
Solicite la ficha del conjunto de datos
Díganos qué idiomas, materias o lenguajes de programación necesita.
Solicitar la ficha