Curación de datos B2B

Sus datos no estructurados, listos para la IA

Aplicamos nuestro pipeline de curación a sus documentos, escaneos, audio y vídeo: extracción de texto, eliminación de datos personales, deduplicación, detección de idioma y puntuación de calidad. El tratamiento se realiza en Alemania y la UE con un contrato de encargo del tratamiento, o en sus propias instalaciones.

Qué entra

  • PDF, incluidas páginas escaneadas
  • Documentos de Office, HTML y exportaciones de correo electrónico
  • Archivos CSV, registros de log y exportaciones de bases de datos
  • Grabaciones de audio y vídeo

Qué sale

  • JSONL o Parquet estructurado según un esquema acordado
  • Datos personales eliminados o enmascarados según su política
  • Idioma, puntuación de calidad y hash del contenido en cada registro
  • Una ficha de datos y un informe de calidad del antes y el después
El pipeline

Ocho pasos de los archivos en bruto a los datos de entrenamiento

El mismo pipeline con el que creamos nuestros propios corpus. Cada paso se puede activar o desactivar para su proyecto.

Extraer

Se extrae el texto de los documentos. Las páginas escaneadas pasan por reconocimiento óptico de caracteres.

Tesseract OCR

Transcribir

El audio y el vídeo se convierten y se transcriben a texto.

ffmpegWhisper

Limpiar

Se eliminan los errores de codificación, el marcado, los encabezados y pies de página y el texto repetitivo. El texto se normaliza.

pandas

Eliminar datos personales

Se detectan nombres, direcciones de correo electrónico, números de teléfono, datos bancarios e identificadores, y se eliminan o enmascaran.

NERpattern rules

Deduplicar

Se localizan y eliminan las copias exactas y las casi idénticas, para que nada tenga un peso excesivo en el entrenamiento.

content hashMinHash

Detectar el idioma

Votan cuatro detectores independientes. Un documento se acepta cuando al menos dos coinciden.

GlotLIDfastTextLingualangdetect

Puntuar la calidad

Cada registro recibe una puntuación de calidad. Los registros con puntuación baja se marcan o se eliminan, según usted decida.

Estructurar e informar

Salida en su esquema como JSONL o Parquet, con una ficha de datos y un informe de benchmark.

JSONLParquet

Lo que no prometemos: la detección automática de datos personales no lo encuentra todo. Informamos de las tasas detectadas y de los límites conocidos, y para los datos sensibles acordamos con usted un paso de revisión antes de la entrega.

Protección de datos

Pensado para datos que deben permanecer bajo control

Las organizaciones reguladas no pueden entregar datos a un servicio en la nube situado en un tercer país. Este servicio está diseñado a partir de esa restricción.

Contrato de encargo del tratamiento

Antes de tocar ningún dato se firma un contrato conforme al art. 28 del RGPD. El NDA forma parte del procedimiento habitual.

Tratamiento en Alemania y la UE

Sus datos se tratan en nuestras propias máquinas en Alemania y la UE, o en las suyas. Sin transferencias a terceros países.

Cifrado

Cifrado AES-256-GCM en reposo. Las claves se mantienen por sesión y nunca se escriben en disco.

Eliminación

Tras la entrega, sus datos se eliminan y usted recibe una confirmación por escrito.

Dos modalidades

En nuestras máquinas o en las suyas

En nuestras máquinasEn sus instalaciones
Cómo funcionaUsted envía los datos mediante una transferencia cifrada. Los tratamos en Alemania y la UE y los eliminamos tras la entrega.Ejecutamos el pipeline dentro de su entorno, en remoto sobre una máquina que usted facilita o de forma presencial.
Adecuado paraEquipos de IA, empresas de software y datos que pueden salir de su red al amparo de un contrato.Bancos, aseguradoras, sanidad, industria farmacéutica y organismos públicos cuyos datos no pueden salir del edificio.
Sus datosSe conservan cifrados solo durante el proyecto.Nunca salen de su infraestructura.
A quién va dirigido

Organizaciones con archivos que la IA aún no puede usar

Bancos y aseguradoras

Contratos, correspondencia y expedientes convertidos en datos de entrenamiento y de recuperación sin datos personales.

Sanidad e industria farmacéutica

Informes, documentos de estudios y grabaciones de voz preparados para modelos especializados con una protección de datos estricta.

Sector público y jurídico

Expedientes escaneados, resoluciones y documentos administrativos convertidos en material consultable y utilizable.

Consultoras y proveedores de datos

El pipeline está disponible en marca blanca, para que pueda ofrecer la curación a sus propios clientes con su nombre.

Cómo se desarrolla un proyecto

Empezar en pequeño y después ampliar

Definición del alcance

Una llamada sobre sus datos, formatos, volúmenes y requisitos de protección de datos.

Piloto

Curamos una muestra de unos 1000 registros y presentamos el resultado con un informe de calidad.

Presupuesto

Un precio fijo basado en lo que ha mostrado el piloto, no en una estimación.

Ejecución completa

Todo el conjunto de datos pasa por el pipeline. Usted ve el avance y las cifras provisionales.

Entrega

Se entregan los datos, la ficha de datos y el informe. Sus datos de origen se eliminan y se lo confirmamos.

Preguntas sobre la curación de datos

¿Tienen que salir nuestros datos de nuestras instalaciones?

No. El pipeline puede ejecutarse dentro de su entorno, en una máquina que usted facilite. Si lo prefiere, nos envía los datos al amparo de un contrato de encargo del tratamiento y los tratamos en Alemania y la UE.

¿Firman un contrato de encargo del tratamiento?

Sí. Antes de recibir ningún dato se firma un contrato conforme al art. 28 del RGPD, junto con un NDA.

¿Qué tipos de archivo pueden procesar?

PDF, incluidos los escaneados, documentos de Office, HTML, texto plano, CSV y exportaciones de bases de datos, además de archivos de audio y vídeo. Los escaneos pasan por OCR y las grabaciones por transcripción de voz a texto.

¿Qué idiomas se admiten?

La detección de idioma cubre un abanico muy amplio de idiomas, incluidas las lenguas de pocos recursos, porque el pipeline se creó para un corpus de 150 idiomas. La calidad del OCR y de la transcripción de voz a texto varía según el idioma, y esa es una de las razones por las que empezamos con un piloto.

¿Cuánto cuesta?

El precio se fija por proyecto y depende del volumen, los formatos y la modalidad de entrega. El piloto da cifras reales a ambas partes, y el presupuesto se elabora a partir de él.

Envíenos una descripción de sus datos

Formatos, volumen aproximado y para qué quiere utilizarlos. Le respondemos con una propuesta de piloto.

Solicitar un piloto