11  Evaluación y Combinación de Predicciones

El Capítulo 10 terminó con una advertencia que este capítulo convierte en método. Al comparar Holt, Holt-Winters, ETS y el SARIMA del Capítulo 6 sobre el IPC, el modelo ganador dependía del horizonte de evaluación elegido: Holt ganaba a 12 meses, pero Holt-Winters lo superaba con claridad a 24. Ese resultado no era un error, sino un síntoma: una sola ventana de evaluación no basta para afirmar con confianza que un modelo predice mejor que otro. Este capítulo introduce las herramientas que faltan para hacerlo con rigor: una métrica de error adicional que permite comparar series de escalas distintas, la validación cruzada temporal para evaluar sobre muchas ventanas en lugar de una sola, el contraste de Diebold-Mariano para decidir si una diferencia de error observada es estadísticamente significativa o puede deberse al azar, y la combinación de predicciones, que a menudo bate a cualquiera de los modelos individuales que la componen. Seguimos trabajando sobre el IPC, con los mismos tres modelos que cerraban el Capítulo 10: el SARIMA\((0,1,1)(0,1,1)_{12}\) del Capítulo 6, y el Holt y el ETS del Capítulo 10.

11.1 Una métrica adicional: el error absoluto medio escalado (MASE)

Las métricas del Capítulo 5 —RECM, EAM y EAMP— tienen una limitación cuando se quiere comparar la capacidad predictiva de un modelo entre series distintas: el RECM y el EAM se expresan en las unidades originales de la variable (puntos de índice del IPC, millones de euros del PIB, puntos del IBEX…), así que un RECM de 0.45 no dice, por sí solo, si el modelo predice bien o mal —depende de la escala de la serie—. El EAMP, al ser un porcentaje, evita ese problema, pero falla cuando la serie toma valores próximos a cero, donde dividir por \(y_t\) dispara el error relativo de forma artificial.

Hyndman y Koehler (2006) proponen una solución: en lugar de expresar el error en unidades absolutas o relativas al propio valor, expresarlo relativo al error de un modelo de referencia elemental sobre la misma serie —el naive estacional, \(\hat y_t = y_{t-m}\), que se limita a repetir el valor de hace un periodo estacional completo (\(m=12\) en una serie mensual)—. El error absoluto medio escalado (MASE, Mean Absolute Scaled Error) se define como

\[\text{MASE} = \frac{\dfrac{1}{H}\displaystyle\sum_{h=1}^{H}|e_{T+h}|}{\dfrac{1}{n-m}\displaystyle\sum_{t=m+1}^{n}|y_t-y_{t-m}|},\]

donde el numerador es el EAM del modelo que se evalúa, y el denominador es el EAM que comete el naive estacional dentro de la muestra de estimación (con \(n\) observaciones). Como ambos términos están en las mismas unidades, el cociente es adimensional: un \(\text{MASE}<1\) significa que el modelo predice mejor, en promedio, que limitarse a copiar el dato del mismo mes del año anterior; un \(\text{MASE}>1\), que ni siquiera supera ese punto de referencia tan elemental. Al ser adimensional, el MASE sí permite comparar la calidad predictiva de un modelo sobre el IPC con la de otro modelo sobre el PIB o el IBEX, algo que el RECM nunca podría hacer directamente.

Para el IPC, el EAM del naive estacional dentro de muestra es 1.9039 puntos de índice: cualquier modelo con EAM por debajo de esa cifra tendrá MASE menor que 1.

11.2 Validación cruzada temporal (rolling-origin)

La validación cruzada habitual —dividir los datos en \(k\) bloques al azar, entrenar con \(k-1\) y evaluar con el restante, rotando— no es válida en series temporales: usaría datos del futuro para predecir el pasado, algo que ningún modelo podrá hacer nunca en producción. La alternativa correcta es la validación cruzada temporal, también llamada evaluación de origen móvil (rolling-origin evaluation): se elige un primer origen de predicción, se entrena el modelo solo con los datos anteriores a ese origen, se predice \(h\) pasos hacia delante, se registra el error, y se desplaza el origen un periodo hacia el futuro, repitiendo el proceso hasta agotar la muestra. El resultado no es un único error, sino una distribución de errores —uno por cada origen—, mucho más informativa que el error de una sola ventana como la del Capítulo 10.

Hay dos variantes según cómo se trate el pasado al desplazar el origen: la ventana creciente (expanding window), que en cada origen usa todos los datos disponibles desde el principio de la muestra, y la ventana deslizante (sliding window), que usa siempre un número fijo de observaciones más recientes, descartando las más antiguas. Usamos aquí la ventana deslizante, con una longitud fija de 180 observaciones (15 años): además de ser bastante más rápida de calcular —reestimar un SARIMA sobre una ventana de tamaño constante es más barato que hacerlo sobre una muestra que crece sin límite—, tiene la ventaja de que cada origen se evalúa con la misma cantidad de información, lo que hace que los errores de distintos orígenes sean más comparables entre sí.

Cuadro 11.1: Validacion cruzada temporal (ventana deslizante de 180 meses, horizonte h=1) sobre el IPC: SARIMA del Capitulo 6, ETS y Holt del Capitulo 10.
Modelo RECM EAM MASE
SARIMA (Cap. 6) 0.457 0.302 0.158
ETS (Cap. 10) 0.445 0.316 0.166
Holt (Cap. 10) 0.537 0.387 0.203

Con 113 orígenes de predicción en lugar de uno, el panorama cambia respecto al Capítulo 10: ahora es ETS quien obtiene el menor error, con Holt en último lugar —justo lo contrario de lo que el backtest de 12 meses del capítulo anterior sugería—. Los tres modelos tienen MASE muy por debajo de 1 (entre 0.16 y 0.2), así que los tres son claramente mejores que el naive estacional; la diferencia entre ellos es más sutil, y es precisamente esa sutileza la que el contraste de la siguiente sección permite cuantificar con rigor estadístico, en lugar de limitarse a comparar dos cifras y quedarse con la más pequeña.

11.3 El contraste de Diebold-Mariano

Que el RECM de ETS (0.4455) sea menor que el de Holt (0.5365) en estos 113 orígenes no garantiza que ETS sea realmente mejor: podría deberse a la variabilidad propia de la muestra de orígenes concreta que se ha usado. Diebold y Mariano (1995) proponen un contraste formal para esta pregunta. Sea \(e_{1,t}\) el error de predicción del primer modelo en el origen \(t\) y \(e_{2,t}\) el del segundo, y defínase la diferencial de pérdida

\[d_t = L(e_{1,t}) - L(e_{2,t}),\]

con \(L(\cdot)\) una función de pérdida —aquí, el error al cuadrado, \(L(e)=e^2\), coherente con el RECM—. Bajo la hipótesis nula de igual capacidad predictiva, \(H_0:E[d_t]=0\): en promedio, ningún modelo predice sistemáticamente mejor que el otro, y las diferencias observadas se deben al azar. El estadístico de contraste es

\[\text{DM} = \frac{\bar d}{\sqrt{\widehat{\text{Var}}(\bar d)}}, \qquad \bar d = \frac{1}{T}\sum_{t=1}^T d_t,\]

donde \(\widehat{\text{Var}}(\bar d)\) no es la varianza muestral ingenua de \(d_t\) dividida por \(T\), sino una estimación robusta a la autocorrelación de \(d_t\) —relevante cuando se predice a más de un paso, porque errores de predicción en orígenes consecutivos comparten información—. Bajo \(H_0\), el estadístico DM se distribuye, asintóticamente, como una normal estándar (forecast::dm.test() aplica además la corrección de muestra finita de Harvey, Leybourne y Newbold). Un DM muy negativo indica que el primer modelo comete, en promedio, errores menores que el segundo; muy positivo, lo contrario.

Cuadro 11.2: Contraste de Diebold-Mariano por pares sobre los errores de la validacion cruzada del IPC.
Comparación Estadístico p-valor
SARIMA vs. ETS 0.524 0.6010
SARIMA vs. Holt -1.894 0.0608
Holt vs. ETS 2.152 0.0335

La lectura, comparación a comparación: entre SARIMA y ETS la diferencia no es significativa (p = 0.601), pese a que sus RECM no son idénticos —con esta cantidad de orígenes, la diferencia observada es perfectamente compatible con el azar—. Entre Holt y ETS sí hay significatividad al 5% (p = 0.034): la ventaja de ETS sobre Holt que mostraba la Cuadro 11.1 no es ruido, es una diferencia real de capacidad predictiva. Entre SARIMA y Holt el p-valor (0.061) queda en una zona intermedia, significativo al 10% pero no al 5%: la evidencia apunta a que SARIMA predice mejor, pero sin la contundencia del caso anterior. El propio contraste dice más que la única fila en negrita de una tabla de RECM: hay diferencias reales entre algunos modelos, pero no entre todos, y solo el contraste formal permite distinguir un caso del otro.

11.4 Combinación de predicciones

Hasta ahora hemos tratado la elección de modelo como una decisión de “uno u otro”: el que gane la comparación se queda, los demás se descartan. Bates y Granger (1969) mostraron que esa disyuntiva es, con frecuencia, subóptima: combinar las predicciones de varios modelos —por ejemplo, promediándolas— puede producir un error menor que el del mejor modelo individual, incluso si algunos de los modelos combinados son claramente peores que otros. La razón es la misma que justifica la diversificación de una cartera de inversión: si los errores de los distintos modelos no están perfectamente correlacionados, promediarlos cancela parte del ruido idiosincrático de cada uno.

Puede formalizarse para dos predicciones. Sean \(e_1,e_2\) los errores de dos modelos, con varianzas \(\sigma_1^2,\sigma_2^2\) y correlación \(\rho\), y considérese la combinación \(\hat y_c = w\,\hat y_1 + (1-w)\,\hat y_2\), cuyo error es \(e_c=w\,e_1+(1-w)\,e_2\). Su varianza es

\[\text{Var}(e_c) = w^2\sigma_1^2 + (1-w)^2\sigma_2^2 + 2w(1-w)\rho\,\sigma_1\sigma_2.\]

Derivando respecto a \(w\) e igualando a cero para encontrar el mínimo,

\[2w\sigma_1^2 - 2(1-w)\sigma_2^2 + 2(1-2w)\rho\,\sigma_1\sigma_2 = 0,\]

y despejando \(w\) —agrupando los términos que la multiplican a un lado de la igualdad—,

\[w^\ast = \frac{\sigma_2^2-\rho\,\sigma_1\sigma_2}{\sigma_1^2+\sigma_2^2-2\rho\,\sigma_1\sigma_2}.\]

Dos casos particulares aclaran la fórmula: si los errores no están correlacionados (\(\rho=0\)), \(w^\ast=\sigma_2^2/(\sigma_1^2+\sigma_2^2)\) —cada modelo pesa en proporción inversa a su propia varianza de error, el más preciso pesa más—; si además ambos modelos son igual de precisos (\(\sigma_1=\sigma_2\)), \(w^\ast=1/2\): la media simple es, en ese caso particular, ya óptima.

Aplicamos esta idea combinando SARIMA y ETS: con la primera mitad de los orígenes de la validación cruzada (56 orígenes) estimamos \(\hat\sigma_1=\) 0.296, \(\hat\sigma_2=\) 0.284 y \(\hat\rho=\) 0.891 —una correlación alta, esperable, porque ambos modelos aciertan y fallan ante los mismos meses atípicos del IPC—, lo que da un peso óptimo \(w^\ast=\) 0.318 para SARIMA (y 0.682 para ETS). Evaluando de verdad fuera de muestra, en la segunda mitad de los orígenes que no se usó para estimar los pesos, el RECM de la combinación con peso óptimo es 0.5553, frente a 0.5733 de SARIMA solo y 0.5616 de ETS solo: la combinación bate a ambos modelos individuales, confirmando la intuición de Bates y Granger. Pero la combinación con pesos iguales (0.5 y 0.5, sin estimar nada) obtiene un RECM de 0.5559, prácticamente idéntico al de la combinación “óptima”. Esto no es un error de cálculo: es el fenómeno que la literatura posterior a Bates y Granger llama el rompecabezas de la combinación de predicciones (Timmermann 2006) —los pesos óptimos teóricos exigen estimar \(\sigma_1,\sigma_2,\rho\) con datos limitados, y ese error de estimación erosiona buena parte de la ventaja teórica sobre el promedio simple, que no necesita estimar nada—. En la práctica, la recomendación habitual es empezar siempre por la media simple como referencia difícil de batir, y solo justificar un esquema de pesos más sofisticado si mejora de forma clara y estable, no solo en una muestra concreta.

11.5 Ejercicios propuestos

  1. Calcule el MASE del modelo SES (Capítulo 10, sin tendencia ni estacionalidad) sobre el IPC, reutilizando mae_naive ya calculado en este capítulo. ¿Es mayor o menor que 1? ¿Es coherente con lo que el Capítulo 10 ya había diagnosticado sobre el SES?
  2. Repita la validación cruzada de la Sección 11.2 con una ventana deslizante de 120 meses en lugar de 180. ¿Cambia el modelo con menor RECM?
  3. Realice el contraste de Diebold-Mariano entre el SARIMA del Capítulo 6 y la combinación óptima SARIMA-ETS de la Sección 11.4 (evaluada en la segunda mitad de orígenes). ¿Es la mejora de la combinación sobre SARIMA solo estadísticamente significativa?
  4. Añada Holt a la combinación de la Sección 11.4 (media simple de los tres modelos) y compare su RECM, en la segunda mitad de los orígenes, con la combinación de solo dos modelos (SARIMA-ETS). ¿Mejora añadir un tercer modelo claramente peor que los otros dos?

11.6 Soluciones de los ejercicios

1. MASE del SES. El MASE del SES es 0.198, muy por encima de 1: el SES es, en promedio, peor que el naive estacional más elemental. Es exactamente coherente con lo que el Capítulo 10 ya había diagnosticado: el SES no tiene forma de representar ni la tendencia ni la estacionalidad del IPC, así que ni siquiera supera a un método que se limita a copiar el valor de hace doce meses.

2. Validación cruzada con ventana de 120 meses. Con una ventana más corta, el RECM de cada modelo es 0.401 (SARIMA), 0.41 (ETS) y 0.5367 (Holt); el modelo con menor error sigue siendo SARIMA, el mismo que con la ventana de 180 meses. El resultado es razonablemente estable ante este cambio del tamaño de ventana, lo que da más confianza en la conclusión que si solo se hubiera probado una configuración.

3. Diebold-Mariano: combinación óptima frente a SARIMA solo. El estadístico DM es -0.842 con p = 0.4036: la mejora de la combinacion sobre SARIMA solo NO alcanza significatividad al 5%. Conviene no perder de vista que este contraste se calcula sobre muy pocos orígenes (la segunda mitad de una muestra ya limitada), así que su potencia para detectar diferencias moderadas es baja.

4. Combinación de tres modelos frente a dos. El RECM de la combinación de los tres modelos (SARIMA, ETS y Holt a partes iguales) es 0.5359, frente a 0.5559 de la combinación de solo SARIMA y ETS: añadir Holt, el modelo claramente peor de los tres en la Cuadro 11.1, SI reduce ligeramente el error de la combinacion. La combinación de predicciones diversifica, pero no obra milagros: incluir un modelo mucho más débil que el resto puede diluir la ventaja de los buenos en lugar de sumarla, un matiz que la fórmula de Bates y Granger para dos modelos ya anticipaba a través del papel que juega \(\sigma^2\) de cada modelo en el peso que recibe.

El código de este capítulo está en scripts/T11_mST_Script_EvaluacionPredicciones.R (guion teórico) y scripts/T11_mST_CP_Macro.R (caso práctico con el IPC).