Microdatos anonimizados

Esta página muestra el listado de operaciones estadísticas que disponen de ficheros de microdatos anonimizados disponibles para su descarga a través de la web. 

Los ficheros de microdatos contienen los registros individuales de una estadística, convenientemente anonimizados, con el fin de preservar la confidencialidad de la información. 

Los ficheros de microdatos en bruto son ficheros de texto plano delimitados por posiciones, que recogen para cada registro individual de la encuesta los valores que toma cada variable. Para interpretar correctamente estos ficheros es necesario establecer la correspondencia entre las variables y valores de acuerdo a las indicaciones que se proporcionan en los ficheros Excel que contienen el diseño de registro. Dado que los datos están sin agregar, su estudio requiere de herramientas adecuadas para el tratamiento y análisis de datos.

Para facilitar el tratamiento de los microdatos en bruto, se proporcionan ficheros procesados en los siguientes formatos: CSV, R, SAS, STATA y SPSS. Además, se está incorporando el formato parquet y el diseño de registro en JSON.

El diseño de registro en JSON permite a los usuarios leer con facilidad los ficheros de microdatos en bruto sin tener que establecer una correspondencia manual de las posiciones en las que está delimitado el fichero.

El fichero en formato parquet cuenta con el diseño de registro en JSON incorporado, lo que permite que sea un fichero autocontenido y no dependa de ficheros adicionales para su uso.

  • Descripción formato parquet
    • Los ficheros Parquet son un formato de almacenamiento de datos diseñado específicamente para sistemas de análisis masivo. A diferencia de los formatos tradicionales basados en filas, como CSV o JSON, Parquet es un formato columnar, lo que significa que almacena los datos organizados por columnas en lugar de por registros completos. Esta característica permite optimizar enormemente el acceso a la información, ya que los sistemas de análisis suelen requerir únicamente un subconjunto de variables (columnas), evitando así la lectura innecesaria de datos completos. Además, Parquet fue desarrollado dentro del ecosistema Hadoop y está ampliamente integrado con herramientas modernas como Apache Spark, Hive o sistemas de procesamiento en la nube.

      Una de las principales ventajas técnicas de Parquet es su capacidad de compresión y codificación eficiente. Al almacenar datos por columnas, es más fácil aplicar técnicas de compresión avanzadas que aprovechan la similitud de valores dentro de cada columna. Por ejemplo, columnas con valores repetitivos o con baja cardinalidad pueden comprimirse mucho más que en formatos tradicionales. Esto se traduce en una reducción significativa del tamaño de los ficheros, lo que implica menores costes de almacenamiento y transmisión, así como un mejor rendimiento en la lectura y procesamiento de datos.

      En el contexto de la publicación de microdatos anonimizados, el formato Parquet ofrece ventajas muy relevantes. En primer lugar, permite una accesibilidad más eficiente para investigadores y analistas, ya que estos pueden consultar únicamente las variables necesarias sin tener que cargar todo el conjunto de datos. Esto es especialmente útil cuando se trabaja con bases de datos grandes y complejas, como las provenientes de encuestas, registros administrativos o censos.

      Además, el soporte de metadatos en Parquet facilita la documentación estructurada de las variables, lo que mejora la interpretabilidad y reutilización de los datos. En el caso de los ficheros que publica el INE, los metadatos se incorporan en el fichero parquet en formato JSON, cumpliendo con el diseño de registro definido en el JSON Schema correspondiente.

      Otra ventaja clave es la interoperabilidad con entornos analíticos modernos. Publicar microdatos en formato Parquet permite su uso directo en plataformas de análisis distribuido y lenguajes como Python o R, mediante bibliotecas como Pandas, PyArrow o dplyr. Esto elimina la necesidad de conversiones previas y agiliza el flujo de trabajo de los usuarios.

      En resumen, el uso del formato Parquet para la publicación de microdatos anonimizados combina eficiencia técnica, ahorro de recursos, facilidad de uso y compatibilidad con tecnologías modernas. Mediante la publicación de estos ficheros se busca fomentar la apertura de datos de manera segura y eficaz.

El Instituto Nacional de Estadística (INE) no se responsabiliza de los resultados que los usuarios obtengan a partir de estos ficheros basados en sus propios cálculos. Además, toda persona que utilice ficheros de microdatos se compromete a citar, en cualquier publicación obtenida a partir de ellos, al INE como fuente del dato primario (fuente: INE, www.ine.es), así como a que el grado de exactitud o fiabilidad de la información derivada por elaboración propia de los autores es de la exclusiva responsabilidad de estos.

Operaciones estadísticas que tienen disponibles ficheros de microdatos con anonimización estándar