Un corpus útil empieza por saber de dónde salió cada dato.
Construimos un pipeline de datos orientado a Paraguay con procedencia, derechos de uso, idioma, privacidad, calidad, deduplicación y contaminación como gates de publicación.
Dos recursos SPL están registrados y sus bytes exactos fueron verificados mediante un intake reproducible. El pipeline técnico de procedencia, derechos, screening mecánico de privacidad y control de contaminación está implementado. Siguen pendientes la revisión humana de idioma y privacidad antes de cualquier promoción a release.
Nueve gates antes de una versión pública.
Licencia
Revisar el derecho de uso y redistribución antes de incorporar una fuente.
Procedencia
Registrar origen, fecha y tipo de fuente antes de transformar el contenido.
Ingestión
Extraer y normalizar manteniendo trazabilidad hacia el material de origen.
Idioma
Identificar español, guaraní, jopara y otros casos con señal explícita.
Deduplicación
Reducir duplicados exactos y semánticos que distorsionen el entrenamiento o la evaluación.
Privacidad
Detectar y excluir información personal cuando el tratamiento no sea apropiado.
Calidad
Asignar criterios de calidad por fuente, dominio y transformación.
Contaminación
Comparar contra conjuntos de evaluación para detectar datos de las pruebas que ya estén presentes en el material.
Versionado
Publicar cambios, composición y limitaciones de cada versión liberada.
La procedencia viaja con el dato.
sourcesource_typelicenselanguagedomaincountryretrieved_atquality_scorepii_statusdedup_cluster
