16 Memoria Larga: ARFIMA y FIGARCH
El Capítulo 4 ya introdujo, de pasada, la idea de que el orden de diferenciación \(d\) de un proceso integrado no tiene por qué ser un número entero, y anunció explícitamente que “se retoma, con las herramientas necesarias, en el Capítulo 16”. El Capítulo 13, por su parte, dejó planteada una pregunta al mostrar que la FAC del valor absoluto del rendimiento del IBEX 35 decaía de forma sospechosamente lenta, mucho más allá de lo que un GARCH(1,1) ordinario podría explicar. Este capítulo cierra ambos hilos: formaliza qué es la memoria larga, cómo se mide con el exponente de Hurst y con los contrastes GPH y de Whittle, cómo se modeliza en la media con los procesos ARFIMA y en la varianza condicional con el modelo FIGARCH, y comprueba —con cuatro métodos distintos, todos ellos sobre los mismos datos reales del IBEX— si esa memoria larga es genuina.
16.1 El concepto de memoria larga
Recordemos la definición del Capítulo 4: un proceso \(Y_t\sim I(d)\) necesita exactamente \(d\) diferenciaciones para volverse estacionario. Cuando \(d\) es un entero, solo hay dos posibilidades prácticas: \(d=0\) (la serie ya es estacionaria, con una FAC que decae geométricamente, como cualquier ARMA del Capítulo 3) o \(d=1\) (la serie tiene una raíz unitaria, su FAC prácticamente no decae dentro de cualquier horizonte razonable, y los choques tienen efecto permanente). La memoria larga ocupa el territorio intermedio, \(0<d<0{,}5\): procesos que sí son estacionarios —su varianza no crece sin límite, a diferencia de un \(I(1)\)— pero cuya FAC decae de forma hiperbólica, \(\rho_k\sim k^{2d-1}\), mucho más despacio que la caída geométrica \(\rho_k\sim\phi^k\) de un ARMA de memoria corta. La diferencia práctica es notable: una FAC que decae geométricamente con \(\phi=0{,}9\) pierde el 99% de su valor inicial en unos 90 retardos; una que decae hiperbólicamente con \(d=0{,}4\) (de modo que \(2d-1=-0{,}2\)) sigue conservando más del 30% de su valor inicial al retardo 100, y más del 15% al retardo 1.000 —es “memoria”, en el sentido literal de que el pasado lejano sigue pesando, de forma mucho más persistente que en cualquier ARMA, sin llegar a la persistencia total y no-estacionaria de una raíz unitaria—.
16.2 El exponente de Hurst
Antes de que existiera la teoría formal de los procesos ARFIMA, Hurst (1951) —estudiando, de forma nada financiera, cuánta capacidad de embalse necesitaba el Nilo para regular sus crecidas— ya había propuesto una forma de cuantificar la persistencia de una serie mediante el análisis de rango reescalado (rescaled range, R/S). La idea: para cada tamaño de submuestra \(n\), se calcula el rango de las desviaciones acumuladas respecto a la media, \(R(n)\), y se divide por la desviación típica de la submuestra, \(S(n)\); si \(R(n)/S(n)\) crece con \(n\) según una ley de potencias, \(E[R(n)/S(n)]\propto n^H\), el exponente \(H\) —el exponente de Hurst— resume el grado de persistencia de la serie, y se relaciona con el parámetro de memoria larga mediante \(d=H-0{,}5\). La interpretación de \(H\) es directa: \(H=0{,}5\) corresponde a un paseo aleatorio sin memoria; \(H>0{,}5\), a una serie persistente, en la que un movimiento en una dirección tiende a ir seguido de otro en la misma dirección; \(H<0{,}5\), a una serie antipersistente, con reversión a la media más marcada de lo que un simple ruido blanco produciría.
Aplicado al valor absoluto del rendimiento diario del IBEX 35 —nuestra medida elemental, ya usada en el Capítulo 13, de la magnitud del movimiento del mercado sin importar el signo—, el exponente de Hurst simple es \(\hat H=\) 0.721, y su versión corregida por sesgo de muestra finita, \(\hat H=\) 0.884: ambos claramente por encima de 0.5, confirmando que la volatilidad del IBEX es una serie persistente. El valor de \(d\) implícito, \(d=H-0{,}5\), está entre 0.221 y 0.384 según la versión del estimador —un rango amplio, porque el método R/S, pese a su valor histórico, es conocido por ser poco preciso; las secciones siguientes ofrecen alternativas más rigurosas—.
16.3 Diferenciación fraccionaria y procesos ARFIMA
El Capítulo 4 ya adelantó que \((1-L)^d\), para \(d\) no entero, se define mediante la expansión binomial infinita del operador de retardos,
\[(1-L)^d = \sum_{j=0}^\infty \binom{d}{j}(-L)^j = 1 - dL + \frac{d(d-1)}{2}L^2 - \cdots,\]
la misma generalización de la expansión en serie de operadores que usamos para deducir la dualidad AR-MA en el Capítulo 3, ahora con un exponente \(d\) que no tiene por qué ser un entero positivo. Un proceso ARFIMA(p,d,q) (AutoRegressive Fractionally Integrated Moving Average) se define, formalmente, igual que un ARIMA del Capítulo 5, sustituyendo la diferenciación entera por esta versión fraccionaria:
\[\Phi(L)\,(1-L)^d\, Y_t = \Theta(L)\,\varepsilon_t,\]
con \(\Phi(L)\) y \(\Theta(L)\) los polinomios AR y MA habituales, y \(d\in(-0{,}5,\,0{,}5)\) para que el proceso sea estacionario e invertible. Hosking (1981), en el trabajo que formaliza esta clase de procesos, demuestra que su FAC decae exactamente con la tasa hiperbólica \(\rho_k\sim k^{2d-1}\) anunciada en la Sección 16.1.
Ajustando un ARFIMA(1,d,1) directamente sobre \(|r_t|\) —tratando la serie de valores absolutos del rendimiento, siguiendo el enfoque de Ding, Granger y Engle (1993), como una serie más a la que se le puede aplicar toda la maquinaria de este manual—, el parámetro de memoria larga estimado es \(\hat d=\) 0.4417 (error típico 0.0115), con componentes AR y MA de \(\hat\phi=\) 0.1017 y \(\hat\theta=\) 0.4954. El valor de \(\hat d\) está claramente dentro del intervalo \((0,\,0{,}5)\) que define la memoria larga estacionaria, muy alejado del extremo \(d=0\) (sin memoria larga) y del \(d=0{,}5\) (frontera con la no estacionariedad). La Figura 16.1 confirma visualmente el ajuste: la curva de decaimiento hiperbólico teórico, construida con este mismo \(\hat d\), reproduce con fidelidad notable la forma de la FAC empírica hasta 250 retardos.
16.4 Contrastes de memoria larga: GPH y Whittle
La estimación por máxima verosimilitud del ARFIMA de la sección anterior es potente, pero exige especificar de antemano los órdenes \(p\) y \(q\) de las partes AR y MA, con el riesgo de que una mala especificación de esa parte de memoria corta contamine la estimación de \(d\). Existen alternativas semiparamétricas, que estiman \(d\) directamente a partir del comportamiento de baja frecuencia del periodograma, sin necesidad de especificar \(\Phi(L)\) ni \(\Theta(L)\).
El estimador de Geweke y Porter-Hudak (1983) (GPH) parte de un resultado teórico: para un proceso de memoria larga, el logaritmo del periodograma \(I(\lambda_j)\) —una estimación de la densidad espectral en la frecuencia \(\lambda_j\)— se relaciona linealmente con \(\log\!\big(4\sin^2(\lambda_j/2)\big)\) para las frecuencias más bajas, con pendiente \(-d\):
\[\log I(\lambda_j) = c - d\log\!\big(4\sin^2(\lambda_j/2)\big) + \eta_j,\]
de modo que \(\hat d\) se obtiene, sencillamente, como menos la pendiente de una regresión MCO de \(\log I(\lambda_j)\) sobre \(\log(4\sin^2(\lambda_j/2))\), usando solo un número reducido \(m\) de las frecuencias más bajas del periodograma —las que mejor reflejan el comportamiento a largo plazo de la serie, que es, al fin y al cabo, lo que define la memoria larga—.
El estimador local de Whittle de Robinson (1995) persigue el mismo objetivo por una vía distinta, más eficiente estadísticamente: en lugar de una regresión, maximiza (sobre esas mismas frecuencias bajas) una aproximación a la verosimilitud gaussiana en el dominio de la frecuencia,
\[\hat d = \arg\min_d \left\{ \log\left(\frac{1}{m}\sum_{j=1}^m \lambda_j^{2d}\, I(\lambda_j)\right) - \frac{2d}{m}\sum_{j=1}^m \log\lambda_j \right\}.\]
GPH da \(\hat d=\) 0.4466 (error típico 0.0746) y Whittle local \(\hat d=\) 0.4402: ambos coinciden casi exactamente entre sí y con el \(\hat d=\) 0.4417 del ARFIMA de la sección anterior —tres métodos de naturaleza completamente distinta, una regresión semiparamétrica, una optimización semiparamétrica y una máxima verosimilitud paramétrica, llegando de forma independiente a prácticamente el mismo número—. La Cuadro 16.1, al final de la sección siguiente, reúne estas estimaciones junto con la quinta y última, la del modelo FIGARCH.
16.5 Memoria larga en volatilidad: el modelo FIGARCH
Todo lo anterior ha tratado \(|r_t|\) como una serie cualquiera, sin conexión explícita con los modelos GARCH del Capítulo 9. Pero recordemos un dato de ese capítulo: el GARCH(1,1) estimado sobre el IBEX daba \(\hat\alpha+\hat\beta\approx0{,}98\), una persistencia altísima, muy próxima a la frontera \(\alpha+\beta=1\) que define un IGARCH (Integrated GARCH, el análogo, en la varianza condicional, de una raíz unitaria en la media). Esa cercanía a la frontera es, en sí misma, ambigua: ¿es la volatilidad del IBEX un proceso de memoria corta pero extremadamente persistente (\(\alpha+\beta\) alto pero \(<1\)), o es, en realidad, un proceso de memoria larga, mal aproximado por un GARCH ordinario, que solo permite elegir entre \(d=0\) (GARCH) y \(d=1\) (IGARCH) sin nada intermedio?
Baillie, Bollerslev y Mikkelsen (1996) resuelven la ambigüedad generalizando el GARCH exactamente como el ARFIMA generaliza al ARMA: sustituyendo la diferenciación entera de la ecuación de varianza por una diferenciación fraccionaria. El modelo FIGARCH(1,d,1) puede escribirse, en su representación \(\text{ARCH}(\infty)\), como
\[\sigma_t^2 = \omega + \Big[1 - (1-\beta L)^{-1}(1-\phi L)(1-L)^d\Big]\varepsilon_t^2 + \beta\,\sigma_{t-1}^2,\]
con \(0\le d\le 1\): el caso \(d=0\) recupera el GARCH(1,1) ordinario del Capítulo 9 (memoria corta), y \(d=1\) recupera el IGARCH (persistencia total, sin reversión a la media); los valores intermedios, \(0<d<1\), son la memoria larga en la varianza condicional, con la misma tasa de decaimiento hiperbólico que ya vimos para la media en la Sección 16.3.
| Método | Estimación de d |
|---|---|
| Hurst R/S (simple) | 0.2211 |
| Hurst R/S (corregido) | 0.3844 |
| GPH | 0.4466 |
| Whittle local | 0.4402 |
| ARFIMA(1,d,1) | 0.4417 |
| FIGARCH(1,d,1) | 0.4436 |
El FIGARCH(1,1) estimado sobre el rendimiento del IBEX da \(\hat d=\) 0.4436 —la última fila de la Cuadro 16.1—, prácticamente idéntico a los 0.442-0.44 obtenidos por los cuatro métodos anteriores sobre \(|r_t|\) directamente, pese a que el FIGARCH estima \(d\) de una forma completamente distinta: como parte de la verosimilitud completa de un modelo de varianza condicional, no a partir de \(|r_t|\) tratado como una serie de niveles. Que cinco caminos metodológicos tan distintos —Hurst, GPH, Whittle, ARFIMA y FIGARCH— coincidan en un valor de \(d\) tan similar es la evidencia más convincente posible de que la memoria larga en la volatilidad del IBEX no es un artefacto de ningún método concreto. En términos de ajuste, el FIGARCH mejora ligeramente al GARCH(1,1) ordinario (AIC de -6.074 frente a -6.068): una ganancia modesta, coherente con que el GARCH(1,1), con \(\hat\alpha+\hat\beta=\) 0.988, ya aproximaba razonablemente bien la persistencia observada aun sin memoria larga explícita, pero el FIGARCH resuelve la ambigüedad de fondo —GARCH altamente persistente frente a memoria larga genuina— a favor de la segunda interpretación, con un fundamento estadístico mucho más sólido que limitarse a mirar lo cerca que \(\hat\alpha+\hat\beta\) queda de 1.
16.6 Ejercicios propuestos
- Calcule el exponente de Hurst y el estimador GPH sobre el valor absoluto del rendimiento del EUR/USD (
data/EURUSD_X.xlsx). ¿Hay evidencia de memoria larga en la volatilidad de un tipo de cambio, igual que en un índice bursátil? - Ajuste un ARFIMA(0,d,0) —sin componentes AR ni MA— sobre \(|r_t|\) del IBEX y compare el \(\hat d\) obtenido con el del ARFIMA(1,d,1) de la Sección 16.3. ¿Es sensible la estimación de \(d\) a la especificación de la parte de memoria corta del modelo?
- Repita el estimador local de Whittle de la Sección 16.4 con un ancho de banda \(m\) distinto (por ejemplo, \(m=\lfloor n^{0{,}5}\rfloor\) en lugar de \(n^{0{,}65}\)). ¿Cambia sustancialmente \(\hat d\)?
- Compare, mediante el AIC, el FIGARCH(1,1) de la Sección 16.5 con el EGARCH(1,1) del Capítulo 9 sobre el IBEX. ¿Cuál de los dos —capturar la asimetría (EGARCH) o capturar la memoria larga (FIGARCH)— mejora más el ajuste sobre el GARCH(1,1) simétrico de referencia?
16.7 Soluciones de los ejercicios
1. Memoria larga en el EUR/USD. El exponente de Hurst corregido es 0.854 y el \(\hat d\) de GPH es 0.7689: tambien hay evidencia de memoria larga en la volatilidad del tipo de cambio. Es coherente con el Capítulo 13, donde ya vimos que el EUR/USD comparte con el IBEX el hecho estilizado de la agrupación de volatilidad, aunque con intensidad distinta.
2. Sensibilidad a la especificación de memoria corta. El ARFIMA(0,d,0), sin componentes AR ni MA, estima \(\hat d=\) 0.1936, frente a 0.4417 del ARFIMA(1,d,1). La diferencia es notable: el parametro de memoria larga SI depende de forma apreciable de la especificacion de la parte de memoria corta, una razon de peso para preferir los estimadores semiparametricos (GPH, Whittle) en caso de duda.
3. Ancho de banda del estimador de Whittle. Con \(m=\lfloor n^{0{,}5}\rfloor\) (91 frecuencias, frente a las 354 originales), \(\hat d=\) 0.3997, frente a 0.4402 con el ancho de banda mayor. La elección de \(m\) es, en la práctica, uno de los aspectos más delicados de estos estimadores semiparamétricos: un \(m\) demasiado pequeño da una estimación imprecisa (pocas frecuencias); uno demasiado grande incorpora frecuencias más altas, contaminadas por la dinámica de memoria corta que estos métodos precisamente intentan evitar.
4. FIGARCH frente a EGARCH: dos extensiones distintas del GARCH(1,1). El AIC mejora en 0.0063 puntos con el FIGARCH y en 0.0185 con el EGARCH del Capítulo 9, ambos frente al GARCH(1,1) de referencia. Capturar la asimetria (EGARCH) mejora mas el ajuste que capturar la memoria larga (FIGARCH) en esta serie. Ambas extensiones son, en todo caso, complementarias y no excluyentes —existen especificaciones que combinan asimetría y memoria larga en un único modelo (FIEGARCH)—, pero quedan fuera del alcance de este manual.
El código de este capítulo está en
scripts/T16_mST_Script_MemoriaLarga.R(guion teórico) yscripts/T16_mST_CP_Financiero.R(caso práctico con el IBEX 35).