Noticias del Instituto Nacional de Estadística
17-06-26
Los miembros del INE que asistieron a la Conferencia
La decimosegunda Conferencia Europea sobre Calidad en las Estadísticas Oficiales (Q2026) tuvo lugar entre los días 3 y 5 de junio en la ciudad de Sibenik (Croacia). Y, como ha sucedido en otras ediciones de esta conferencia, contó con un nutrido grupo de expertos del Instituto Nacional de Estadística (INE).
Se trata de un evento clave para promover la calidad en las estadísticas oficiales y reúne a estadísticos, investigadores, académicos y profesionales de diversos campos para explorar las últimas tendencias y abordar los principales desafíos del sector.
Los temas de la Q2026 abarcaron diversidad de cuestiones y aspectos relacionados con la calidad. Además, se exploraron los marcos institucionales que respaldan su gestión en las estadísticas oficiales y se destacaron los retos y oportunidades para mantenerla ante el creciente uso de la Inteligencia Artificial (IA).
Los asistentes destacaron la calidad como elemento esencial para generar y mantener la confianza de los usuarios.
Integración de fuentes en los indicadores ODS
Entre la nutrida participación del INE, el vocal asesor Pedro Revilla presentó el Partnerships with data holders for producing Spanish SDG indicators: ensuring quality through the European Statistics Code of Practice.
El documento, elaborado con Ana Carmen Saura, subdirectora general de Relaciones Internacionales y Agenda 2030, recoge el marco desarrollado por el INE para la integración de diversas fuentes en la elaboración de los indicadores ODS.
Entre ellos, Revilla destacó el uso de instrumentos institucionales como el Plan Estadístico Nacional y los órganos colegiados, junto con la Plataforma Nacional de los ODS como herramienta de coordinación y validación. Añadió que la obtención de estos indicadores requiere alianzas eficaces con múltiples instituciones.
Redefiniendo la gobernanza
Yolanda Gómez, asesora en asuntos europeos del INE, presentó el paper Strengthening Trust and Governance in the Age of AI en el que se analiza cómo la irrupción de la IA y las nuevas políticas europeas de datos están redefiniendo la gobernanza de las estadísticas oficiales, situando a los institutos nacionales de estadística en un ecosistema más complejo y multidimensional.
Señaló que en el diálogo entre la ética de los datos y el Código de Buenas Prácticas de las Estadísticas Europeas (CBP) existe amplia convergencia entre los principios estadísticos y los principios éticos de la IA, aunque con algunos vacíos específicos relacionados con el uso de estas tecnologías que requieren ajustes.
Y destacó que no es necesario crear nuevos códigos éticos, sino actualizar el Código para incorporar explícitamente el uso de la IA, reforzar su dimensión ética y adaptarlo al nuevo entorno digital. Concluyó con recomendaciones para mejorar la confianza en las estadísticas oficiales, la cual depende no solo de marcos normativos sólidos, sino también de su aplicación visible y adaptada a la era de la IA.
Nuevo marco de acceso a datos privados
La subdirectora adjunta de la Subdirección General de Relaciones Internacionales y Agenda 2030, Ana Cánovas, presentó un análisis sobre el impacto del nuevo marco legal de acceso a datos privados para el desarrollo, elaboración y difusión de estadísticas europeas sobre el marco de calidad de las estadísticas europeas.
Este análisis incluye recomendaciones para la revisión del CBP, principio a principio, en lo que respecta al uso de datos en manos de tenedores privados y su integración en el proceso de producción estadística.
Proyecto AIML4OS y herramientas
María Novás, subdirectora general de Metodología y Diseño de Muestras, Sandra Barragán y Luis Sanguiao, jefes de área en la misma unidad, representaron al equipo del INE en la reunión presencial del proyecto AIML4OS para evaluar el progreso, objetivos conseguidos y los retos estratégicos a corto y largo plazo.
Sanguiao presentó MLUtils, una herramienta en R y Python que estandariza y facilita el uso del ML en la estadística oficial. El sistema unifica la sintaxis de los programas actuales y adapta los modelos de ML a las complejas necesidades de la estadística oficial.
Comentó que su diseño modular reduce el esfuerzo de implementación entre departamentos, garantizando procesos mucho más armonizados y reproducibles.
Modelos y medición del turismo
Sanguiao también expuso un modelo de deep learning que combina capas LSTM y autoencoders para la imputación de series temporales con valores ausentes. El modelo fue diseñado para completar los huecos que dejan los sensores de tráfico cuando fallan, siendo de utilidad para la estadística de movimientos turísticos en fronteras.
El sistema, añadió, es modular y adaptable a cualquier imputación de series temporales de similar naturaleza.
Por su parte, Barragán moderó la sesión High-Quality Imputations With Machine Learning Techniques y presentó, en otra sesión, el trabajo sobre estimación de marcos poblacionales de la estadística sobre movimientos turísticos en fronteras a través de fuentes administrativas y ML, en la que destacó los indicadores de rendimiento para la monitorización del proceso de producción.
Uso de datos de telefonía móvil
Marta Sixto, consejera técnica de la Subdirección General de Sectores Económicos, realizó una presentación sobre la utilización de los datos de telefonía móvil en la producción de estadísticas de turismo. Desde los inicios del proyecto, hasta los principales desafíos identificados y el análisis de la calidad de la información para poder incorporar estos datos.
Su exposición se centró en el turismo receptor, donde explicó la utilización de estos datos en la estadística oficial y las ventajas que ofrece su uso, como la reducción del tamaño muestral y, por tanto, de los costes, así como la mejora de la granularidad y la calidad de la información.
Automatización de la EPF
Olga González, directora de programa en la Subdirección General de Recogida de Datos, explicó la automatización del procesamiento de los tiques de la Encuesta de Presupuestos Familiares (EPF) mediante un sistema de Machine Learning (ML) en Python (OCR + Clasificación) que sustituiría la transcripción manual, aumentando la eficiencia y reduciendo errores en la transcripción de más de 60.000 tiques anuales.
Aunque el prototipo actual requeriría parte de depuración manual, señaló que su actualización a una IA avanzada y validada externamente optimizará la calidad y garantizará la confianza pública en la información proporcionada.
Indicadores de satisfacción
Raúl Hidalgo, jefe de sección en la Subdirección General de Metodología y Diseño de Muestras, expuso el sistema de indicadores diseñado a partir de los datos de la última Encuesta de Satisfacción a Usuarios 2025, para evaluar la calidad percibida por parte de los usuarios.
Mediante el uso de técnicas estadísticas como el Análisis de Componentes Principales y la rotación Varimax, los indicadores permiten resumir la información clave y detectar, de forma clara, qué factores pesan más en la valoración de los usuarios.
Por su parte, Andrés Jurado, jefe de sección en esta misma subdirección, abordó metodologías para evaluar la calidad de los datos de entrenamiento en modelos de clasificación de lenguaje natural, basadas en estándares estadísticos oficiales como la Clasificación Nacional de Actividades Económicas (CNAE) o la Clasificación Nacional de Ocupaciones (CNO).
Estimación adelantada del ICLA
Raul Fernández, jefe área en la Subdirección General de Estadística del Mercado Laboral, expuso el uso de técnicas de ML para mejorar la calidad de la estimación adelantada del Índice de Costes Laborales (ICLA).
El método permite imputar la totalidad de los cuestionarios incompletos disponibles a 45 días del cierre del trimestre, reduciendo el error entre la estimación provisional y el índice definitivo por debajo del 0,4%. Este enfoque combina modelos de random forest, naive Bayes y XGBoost con datos administrativos auxiliares, y supone un avance significativo en la calidad y oportunidad de las estadísticas laborales oficiales.
Adaptación a la complejidad de las multinacionales
Jorge Novalbos, director de programa en la División Grandes Empresas (DGE), abordó la necesidad de adaptar la medición estadística a la creciente complejidad de las empresas multinacionales. Expuso un flujo de trabajo integral que combina el tratamiento de microdatos de diversas fuentes con procesos de automatización y el uso de la IA para mejorar los análisis de consistencia.
Asimismo, presentó el proyecto MNEData, orientado a transformar el sistema de recogida de datos para los grupos multinacionales mediante un modelo centralizado, digital y basado en APIs REST, que reduce la carga de respuesta y mejora la calidad de los datos.
Ambos enfoques tuvieron como objetivo reforzar la calidad, coherencia y fiabilidad de la información estadística mediante una interacción más eficiente con estas empresas.
Modelos multirregionales
David Calvete director de programa en la DGE, presentó el trabajo Multiregional Models and Trade in Value Added: Developing Essential Tools for a Complex Global Economy, en el que se expuso el sistema español de indicadores de Comercio en Valor Añadido.
Su ponencia mostró cómo los modelos input-output multirregionales permiten medir la participación de España en las cadenas globales de valor desde la perspectiva del valor añadido, el empleo, las emisiones y la exposición internacional. Asimismo, presentó el panel interactivo desarrollado por el INE para facilitar la difusión y el análisis de estos resultados.
Estandarización de la obtención de regresores
Elena Rosa, jefa de área en la Subdirección General de Estadísticas Coyunturales, presentó el trabajo realizado por el INE y la Universidad Complutense de Madrid en relación con la estandarización de la implementación del feature engineering usando ficheros XML en el proceso de imputación de estimaciones tempranas de operaciones económicas.
En este trabajo se explica cómo el uso de ficheros XML y de scripts de R, teniendo en cuenta la parametrización, permiten la estandarización de la obtención de regresores para cualquier tipo de operación estadística en la imputación de estimaciones tempranas. Puso como ejemplo el Índice de Producción de la Construcción del INE.
NIPO: 222-24-014-6
ISSN: 2255-5625
© INE 2025