PY-AIEval.
Un sistema reproducible para evaluar IA en tareas relevantes para Paraguay. La versión 0.1 sirve para desarrollar las pruebas. Los conjuntos actuales no permiten clasificar modelos por su rendimiento.
Cinco preguntas factuales, con fuentes oficiales.
En estas cinco tareas factuales de desarrollo, un sistema determinista de recuperación con fuentes oficiales fue suficiente; no encontramos evidencia que justificara entrenar o ajustar un modelo para este problema específico.
Límite: Este resultado está limitado a cinco tareas factuales de desarrollo. No establece el conocimiento general de Paraguay de un modelo, superioridad entre modelos ni capacidad en guaraní o jopara, y no implica que futuros problemas no justifiquen entrenamiento.
Qué evaluamos en esta versión.
Razonamiento
Problemas con respuestas conocidas para comprobar la puntuación y el funcionamiento del sistema de evaluación.
Conocimiento de Paraguay
Tareas factuales con procedencia pública; la etapa 1 usa una muestra de cinco tareas.
Español paraguayo
Tareas documentadas sobre usos locales y voseo; todavía son de desarrollo.
Uso estructurado de herramientas
Selección de herramienta, argumentos y estado de finalización bajo contratos explícitos.
Cómo verificar una ejecución.
Dos adaptadores probados
OpenAI Responses y Hugging Face Chat implementan el mismo contrato de ejecución, registrando diferencias de proveedor.
Artefactos verificables
artifactSha256 protege cada corrida y protocolSha256 identifica el protocolo congelado usado para decidir comparabilidad.
Conjuntos de desarrollo
Razonamiento, conocimiento de Paraguay, español paraguayo y uso estructurado de herramientas · rankable: false. Sirven para desarrollar el sistema de evaluación. No permiten afirmar superioridad entre modelos.
Paquete técnico preparado, publicación externa pendiente.
La metodología, el sistema de evaluación, las tareas de desarrollo y el ejemplo de la etapa 1 están preparados. La publicación externa está pendiente. Todavía no hay un repositorio público ni una clasificación de modelos.
Dominios previstos para próximas versiones.
Español paraguayo
Comprensión de expresiones, voseo y usos del español en contexto paraguayo.
Guaraní
Comprensión y generación evaluadas con criterios lingüísticos adecuados al conjunto de pruebas.
Jopara
Cambio de código y comprensión de consultas que combinan español y guaraní.
Conocimiento de Paraguay
Preguntas factuales con fuentes y criterios de actualización definidos.
Educación
Tareas académicas y de explicación alineadas con contextos educativos relevantes.
Documentos públicos
Lectura, extracción y respuesta sobre documentación pública seleccionada.
Razonamiento
Problemas matemáticos y lógicos con criterios de puntuación reproducibles.
Uso de herramientas
Capacidad de seleccionar y utilizar herramientas bajo contratos explícitos.
RAG
Recuperación, uso de evidencia y atribución al responder con contexto suministrado.
Factualidad
Respuestas verificables, abstención y control de afirmaciones no sustentadas.
Seguridad
Comportamiento ante categorías de riesgo y solicitudes adversariales.
Eficiencia
Costo, latencia, memoria y rendimiento cuando la comparación lo permita.
El resultado necesita contexto.
Cada resultado deberá identificar modelo y versión, fecha, versión de las tareas, número de muestras, método de puntuación o evaluación y parámetros relevantes de generación.
Dos corridas solo pueden presentarse como comparables cuando sus reportes son válidos y comparten el mismo protocolSha256. Eso habilita comparación metodológica; no convierte automáticamente una diferencia de puntuación en evidencia de superioridad.
