Un corpus útil empieza por saber de dónde salió cada dato.

Construimos un pipeline de datos orientado a Paraguay con procedencia, derechos de uso, idioma, privacidad, calidad, deduplicación y contaminación como gates de publicación.

PIPELINE IMPLEMENTADO / REVISIÓN HUMANA PENDIENTE

Dos recursos SPL están registrados y sus bytes exactos fueron verificados mediante un intake reproducible. El pipeline técnico de procedencia, derechos, screening mecánico de privacidad y control de contaminación está implementado. Siguen pendientes la revisión humana de idioma y privacidad antes de cualquier promoción a release.

No hay un dataset público de Paraguay Corpus. Este estado no demuestra representatividad, calidad lingüística, cobertura de guaraní/jopara ni aptitud para entrenamiento.

CONTROLES DEL PIPELINE

Nueve gates antes de una versión pública.

01

Licencia

Revisar el derecho de uso y redistribución antes de incorporar una fuente.

02

Procedencia

Registrar origen, fecha y tipo de fuente antes de transformar el contenido.

03

Ingestión

Extraer y normalizar manteniendo trazabilidad hacia el material de origen.

04

Idioma

Identificar español, guaraní, jopara y otros casos con señal explícita.

05

Deduplicación

Reducir duplicados exactos y semánticos que distorsionen el entrenamiento o la evaluación.

06

Privacidad

Detectar y excluir información personal cuando el tratamiento no sea apropiado.

07

Calidad

Asignar criterios de calidad por fuente, dominio y transformación.

08

Contaminación

Comparar contra conjuntos de evaluación para detectar datos de las pruebas que ya estén presentes en el material.

09

Versionado

Publicar cambios, composición y limitaciones de cada versión liberada.

METADATOS MÍNIMOS

La procedencia viaja con el dato.

  • source
  • source_type
  • license
  • language
  • domain
  • country
  • retrieved_at
  • quality_score
  • pii_status
  • dedup_cluster

Los campos y su semántica pueden evolucionar antes de una primera versión. Cada versión deberá documentar los cambios.