PISA España, de la pregunta a la evidencia.
Un expediente reproducible que reúne ciclos, documentación y archivos preparados para agentes de análisis.
Antes de analizar nada, pregunta a la persona cuál es su pregunta de investigación y, si hace falta para acotarla, qué ciclos o materias le interesan.
Cuando la tengas, empieza leyendo manifest.json y metadata/AGENTS.md, y sigue desde ahí la guía, los diccionarios y la cobertura por ciclo.
Todos los archivos son de acceso público: no necesitas cuenta ni claves.
Si tu entorno no puede descargar archivos (p. ej. el intérprete de código de ChatGPT no tiene acceso a internet), no uses fuentes alternativas ni tabulaciones oficiales: pide a la persona que descargue los Parquet desde los enlaces de aquí abajo y te los adjunte en la conversación. El cocinado pesa solo ~11 MB y es el recomendado para empezar.
Algunos agentes no pueden descargar archivos de internet (por ejemplo, ChatGPT). Si es tu caso, baja los archivos desde aquí y adjúntaselos en la conversación:
Dos niveles de detalle, una misma procedencia.
Empieza por el archivo cocinado para explorar. Cambia al completo cuando el análisis requiera pesos, réplicas o columnas originales.
Todos los países, todos los alumnos.
El dataset internacional completo: 3.884.676 alumnos de todos los países participantes, un archivo por ciclo con el mismo esquema armonizado (núcleo, valores plausibles, pesos replicados y variables de centro). Ciclo 2009 pendiente: la OCDE retiró el fichero de alumnado y no hay copia pública archivada; está en búsqueda activa.
Los ciclos 2018, 2022 y 2025 van en dos partes de filas (límite de subida): descarga las dos y únelas con pyarrow.concat_tables([pq.read_table(a), pq.read_table(b)]); mismo orden de columnas. Para 2025, los pesos replicados van en un archivo compañero (pesos 2025 · 96 MB) para caber en el límite de publicación; se une por (pais, CNTSCHID, CNTSTUID). Diccionario y cobertura: diccionario · cobertura.
La documentación viaja con los datos.
Antes de comparar. No todos los ciclos contienen las mismas columnas. Los años ausentes se documentan en la cobertura y la información IA solo está disponible para 2025.
Para inferencia poblacional, usa el archivo completo y consulta la guía antes de calcular estimaciones.