PY-AIEval.

Un sistema reproducible para evaluar IA en tareas relevantes para Paraguay. La versión 0.1 sirve para desarrollar las pruebas. Los conjuntos actuales no permiten clasificar modelos por su rendimiento.

EXPERIMENTO 001 / ETAPA 1

Cinco preguntas factuales, con fuentes oficiales.

5/5tareas correctas
0errores de proveedor
0llamadas LLM/API externas
0cómputo para entrenar modelos

En estas cinco tareas factuales de desarrollo, un sistema determinista de recuperación con fuentes oficiales fue suficiente; no encontramos evidencia que justificara entrenar o ajustar un modelo para este problema específico.

Límite: Este resultado está limitado a cinco tareas factuales de desarrollo. No establece el conocimiento general de Paraguay de un modelo, superioridad entre modelos ni capacidad en guaraní o jopara, y no implica que futuros problemas no justifiquen entrenamiento.

ÁREAS DE DESARROLLO / V0.1

Qué evaluamos en esta versión.

01

Razonamiento

Problemas con respuestas conocidas para comprobar la puntuación y el funcionamiento del sistema de evaluación.

02

Conocimiento de Paraguay

Tareas factuales con procedencia pública; la etapa 1 usa una muestra de cinco tareas.

03

Español paraguayo

Tareas documentadas sobre usos locales y voseo; todavía son de desarrollo.

04

Uso estructurado de herramientas

Selección de herramienta, argumentos y estado de finalización bajo contratos explícitos.

CAPA TÉCNICA / REPRODUCIBILIDAD

Cómo verificar una ejecución.

01

Dos adaptadores probados

OpenAI Responses y Hugging Face Chat implementan el mismo contrato de ejecución, registrando diferencias de proveedor.

02

Artefactos verificables

artifactSha256 protege cada corrida y protocolSha256 identifica el protocolo congelado usado para decidir comparabilidad.

03

Conjuntos de desarrollo

Razonamiento, conocimiento de Paraguay, español paraguayo y uso estructurado de herramientas · rankable: false. Sirven para desarrollar el sistema de evaluación. No permiten afirmar superioridad entre modelos.

PAQUETE PÚBLICO V0.1 / PREPARADO

Paquete técnico preparado, publicación externa pendiente.

La metodología, el sistema de evaluación, las tareas de desarrollo y el ejemplo de la etapa 1 están preparados. La publicación externa está pendiente. Todavía no hay un repositorio público ni una clasificación de modelos.

PLAN PROPUESTO / 12 ÁREAS

Dominios previstos para próximas versiones.

01

Español paraguayo

Comprensión de expresiones, voseo y usos del español en contexto paraguayo.

02

Guaraní

Comprensión y generación evaluadas con criterios lingüísticos adecuados al conjunto de pruebas.

03

Jopara

Cambio de código y comprensión de consultas que combinan español y guaraní.

04

Conocimiento de Paraguay

Preguntas factuales con fuentes y criterios de actualización definidos.

05

Educación

Tareas académicas y de explicación alineadas con contextos educativos relevantes.

06

Documentos públicos

Lectura, extracción y respuesta sobre documentación pública seleccionada.

07

Razonamiento

Problemas matemáticos y lógicos con criterios de puntuación reproducibles.

08

Uso de herramientas

Capacidad de seleccionar y utilizar herramientas bajo contratos explícitos.

09

RAG

Recuperación, uso de evidencia y atribución al responder con contexto suministrado.

10

Factualidad

Respuestas verificables, abstención y control de afirmaciones no sustentadas.

11

Seguridad

Comportamiento ante categorías de riesgo y solicitudes adversariales.

12

Eficiencia

Costo, latencia, memoria y rendimiento cuando la comparación lo permita.

PROTOCOLO DE PUBLICACIÓN

El resultado necesita contexto.

Cada resultado deberá identificar modelo y versión, fecha, versión de las tareas, número de muestras, método de puntuación o evaluación y parámetros relevantes de generación.

Dos corridas solo pueden presentarse como comparables cuando sus reportes son válidos y comparten el mismo protocolSha256. Eso habilita comparación metodológica; no convierte automáticamente una diferencia de puntuación en evidencia de superioridad.

Ver estándar de evidencia