La geometría de la información (Information Geometry) es una teoría de clase mundial originada en Japón que introduce la estructura de la geometría diferencial en el espacio de las distribuciones de probabilidad, desentrañando la esencia de la inferencia estadística, el aprendizaje automático (machine learning) y la teoría de la información bajo una intuición geométrica. Esta teoría, sistematizada por el Dr. Shun-ichi Amari y otros, se aplica en la actualidad a una amplia gama de campos, desde el método del gradiente natural (Natural Gradient Descent), que sustenta la base de la IA y el aprendizaje profundo (deep learning), hasta la teoría de la información cuántica y la física estadística, consolidando su posición como un “lenguaje común” en la ciencia moderna.
En este artículo, explicaremos de la manera más detallada y sistemática posible el profundo mundo de la geometría de la información, combinando el rigor matemático, la intuición geométrica y ejemplos de cálculo específicos. No nos limitaremos a una mera enumeración de fórmulas, sino que, partiendo de la pregunta fundamental “¿por qué el espacio de las distribuciones de probabilidad es curvo?” y “¿por qué la matriz de información de Fisher se convierte en el tensor métrico?”, trazaremos el panorama completo de la geometría de la información, incluyendo las conexiones duales, la geometría de la entropía y sus aplicaciones de vanguardia en el aprendizaje automático y la neurociencia.
Capítulo 1: El Amanecer de la Geometría de la Información y la Intuición de Shun-ichi Amari
De la estadística del espacio euclidiano al espacio curvo de las distribuciones de probabilidad
En la estadística clásica y el análisis de datos, hemos tratado inconscientemente los datos como puntos en un espacio euclidiano. Por ejemplo, al considerar un modelo estadístico con parámetros $\theta = (\theta_1, \theta_2, \dots, \theta_n)$, es frecuente asumir que el espacio de parámetros es plano y medir la distancia entre ellos utilizando la distancia euclidiana habitual. El método de mínimos cuadrados, que minimiza el error cuadrático, también se basa en esta intuición de la geometría euclidiana.
Sin embargo, ¿es realmente “plano” el espacio que parametriza las distribuciones de probabilidad?
Tomemos como ejemplo la distribución normal $N(\mu, \sigma^2)$. El espacio de parámetros es el semiplano superior $\{(\mu, \sigma^2) \in \mathbb{R} \times \mathbb{R}_{>0}\}$ compuesto por la media $\mu$ y la varianza $\sigma^2 > 0$. Consideremos aquí dos pares de distribuciones normales:
- $N(0, 1)$ y $N(0.1, 1)$
- $N(0, 100)$ y $N(0.1, 100)$
Si observamos la distancia euclidiana de los parámetros, en ambos pares la distancia es igual a $0.1$. Pero, ¿qué pasa desde el punto de vista de la “distinguibilidad” o “diferencia de información” como distribuciones de probabilidad? Cuando la varianza es tan pequeña como $1$, un desplazamiento de la media de apenas $0.1$ cambia significativamente la forma de la distribución, y es relativamente fácil distinguir ambas a partir de los datos. Por otro lado, cuando la varianza es tan extremadamente grande como $100$, la distribución se extiende de manera plana; aunque la media se desplace $0.1$, la superposición de las distribuciones es enorme y resulta casi imposible distinguirlas a partir de los datos.
Es decir, la “diferencia intrínseca como distribuciones” no coincide con la distancia euclidiana de los parámetros. En regiones de gran varianza, un pequeño cambio en la media apenas afecta a la forma de la distribución, mientras que en regiones de pequeña varianza, provoca un cambio drástico. Esto sugiere fuertemente que el espacio de parámetros de las distribuciones de probabilidad no es uniforme, sino un “espacio curvo (variedad de Riemann) donde la escala de distancia difiere según la ubicación”.
¿Por qué las familias de distribuciones de probabilidad son variedades?
La geometría de la información formula un modelo estadístico (familia de distribuciones de probabilidad) como una variedad diferenciable (Differentiable Manifold).
Sea $S$ una familia de distribuciones de probabilidad sobre un espacio de probabilidad $\mathcal{X}$. Si esta familia está especificada unívocamente por $n$ parámetros reales continuos $\theta = (\theta^1, \dots, \theta^n)$ y la función de densidad de probabilidad $p(x; \theta)$ es suave con respecto a $\theta$, decimos que $S$ es una variedad estadística de $n$ dimensiones (Statistical Manifold).
$$ S = \{ p(x; \theta) \mid \theta \in \Theta \subset \mathbb{R}^n \} $$Aquí, $\theta$ no es más que el “sistema de coordenadas locales (Local Coordinate System)” sobre la variedad $S$. En la teoría de variedades, un sistema de coordenadas no es intrínseco, sino simplemente una de sus representaciones. Por ejemplo, en el caso de la distribución normal, podemos elegir $(\mu, \sigma^2)$ como parámetros, pero también podríamos elegir $(\mu, \sigma)$ o $(\frac{\mu}{\sigma^2}, -\frac{1}{2\sigma^2})$.
La esencia de la geometría de la información reside en revelar la “estructura geométrica intrínseca de la familia de distribuciones de probabilidad en sí misma, independientemente del sistema de coordenadas elegido”. Shun-ichi Amari profundizó en el concepto propuesto por C.R. Rao de una “variedad de Riemann cuya métrica es la matriz de información de Fisher”, y al introducir el concepto de conexión afín (Affine Connection), descubrió en el espacio de las distribuciones de probabilidad no solo la “curvatura”, sino también una rica estructura que incluye el “concepto de línea recta (geodésica)” y la “dualidad”.
Capítulo 2: Modelos Estadísticos como Variedades de Riemann
Para definir “distancia” y “ángulo” en una variedad, se requiere una métrica de Riemann (Riemannian Metric). ¿Cuál es la métrica de Riemann natural en una variedad estadística?
Función de puntuación y matriz de información de Fisher
En estadística, la derivada parcial de la función de log-verosimilitud $\log p(x; \theta)$ con respecto a los parámetros se denomina “función de puntuación (Score Function)” y desempeña un papel importante.
$$ \partial_i \ell(x; \theta) = \frac{\partial}{\partial \theta^i} \log p(x; \theta) $$$$ E_\theta[\partial_i \ell(x; \theta)] = \int \frac{\partial p(x; \theta)}{\partial \theta^i} dx = \frac{\partial}{\partial \theta^i} \int p(x; \theta) dx = 0 $$$$ g_{ij}(\theta) = E_\theta \left[ \partial_i \ell(x; \theta) \partial_j \ell(x; \theta) \right] $$C.R. Rao (1945) observó que esta matriz de información de Fisher es una matriz simétrica definida positiva que satisface la ley de transformación de tensores, y propuso adoptarla como la métrica de Riemann (métrica de Fisher) de la variedad estadística.
$$ ds^2 = \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$Con esto, el modelo estadístico se convierte en una variedad de Riemann $(S, G)$. La mínima “distancia al cuadrado” entre dos distribuciones de probabilidad cercanas $p(x; \theta)$ y $p(x; \theta + d\theta)$ se mide mediante esta métrica de Fisher.
El teorema de Chentsov sobre la métrica invariante
¿Por qué debería elegirse la matriz de información de Fisher como métrica? No es una simple ocurrencia, sino que existe una profunda necesidad matemática.
N.N. Chentsov (1972) formalizó la “invarianza (Invariance)” exigida en el marco de la inferencia estadística. La inferencia estadística no debería cambiar sus resultados debido a la forma de representar los datos o por una transformación a estadísticos suficientes (mapeo de Markov). El teorema de Chentsov demostró el sorprendente hecho de que “en la variedad de distribuciones de probabilidad sobre un conjunto finito, la única métrica de Riemann, salvo por un factor constante, que satisface la monotonicidad (contractividad) bajo el mapeo de Markov es la métrica de información de Fisher”.
En otras palabras, la única forma de medir la distancia en el espacio de las distribuciones de probabilidad que satisface el requisito estadístico natural de que “la información no disminuye” es la métrica de Fisher. Esto prueba que la métrica de Fisher es una estructura geométrica intrínseca y necesaria, propia de la estadística.
Ejemplo de cálculo de la métrica de Fisher en la familia de distribuciones normales
$$ p(x; \mu, \sigma) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right) $$$$ \log p = -\log(\sqrt{2\pi}) - \log\sigma - \frac{(x-\mu)^2}{2\sigma^2} $$$$ \partial_\mu \log p = \frac{x-\mu}{\sigma^2}, \quad \partial_\sigma \log p = -\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3} $$$$ g_{\mu\mu} = E\left[ \left(\frac{x-\mu}{\sigma^2}\right)^2 \right] = \frac{1}{\sigma^2} $$$$ g_{\sigma\sigma} = E\left[ \left(-\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3}\right)^2 \right] = \frac{2}{\sigma^2} $$$$ g_{\mu\sigma} = g_{\sigma\mu} = 0 $$$$ ds^2 = \frac{1}{\sigma^2} d\mu^2 + \frac{2}{\sigma^2} d\sigma^2 $$Esto coincide perfectamente (salvo por una constante) con la métrica del semiplano superior de Poincaré, que es un modelo de la geometría hiperbólica (un tipo de geometría no euclidiana) propuesta por Henri Poincaré. Es decir, se observa que el espacio de la distribución normal es un espacio hiperbólico con curvatura constante negativa. Como intuimos anteriormente, en regiones donde $\sigma$ es grande (varianza grande), el tensor métrico $1/\sigma^2$ se hace pequeño, y la variación de los parámetros se evalúa como una “distancia” menor, lo cual ahora está respaldado por las fórmulas matemáticas.
Capítulo 3: La Profundidad de la Conexión Dual y la Conexión $\alpha$
Con solo la métrica de Riemann, no se puede describir completamente la “curvatura” de un espacio. Se necesita una conexión afín (Affine Connection) que determine “qué dirección es recta”. El mayor logro de Shun-ichi Amari radica en el descubrimiento de que en una variedad estadística existen infinitas conexiones naturales, y que estas forman una hermosa estructura de “dualidad (Duality)”.
Definición de la conexión $\alpha$
Amari introdujo una familia de conexiones afines llamadas conexiones $\alpha$, utilizando un parámetro real $\alpha$. Sus coeficientes de conexión $\Gamma_{ij,k}^{(\alpha)}$ se definen de la siguiente manera:
$$ \Gamma_{ij,k}^{(\alpha)} = E \left[ \left( \partial_i \partial_j \ell + \frac{1 - \alpha}{2} \partial_i \ell \partial_j \ell \right) \partial_k \ell \right] $$La 0-conexión, cuando $\alpha = 0$, coincide con la conexión de Levi-Civita (Levi-Civita Connection), que está unívocamente determinada por la métrica de Fisher. Esta es la conexión utilizada en la geometría de Riemann habitual. Sin embargo, las conexiones que juegan el papel más importante en la geometría de la información son las correspondientes a $\alpha = 1$ y $\alpha = -1$.
Conexión e, conexión m y el espacio dual plano
- Conexión e (conexión exponencial con $\alpha = 1$): Conexión que aparece de manera natural al tratar familias exponenciales (Exponential Family).
- Conexión m (conexión de mezcla con $\alpha = -1$): Conexión que aparece de manera natural al tratar familias de mezcla (Mixture Family).
Estas dos conexiones están en una relación “dual (Dual)” respecto a la métrica de Fisher $g_{ij}$. En una variedad de Riemann, cuando la derivada del producto interno (métrica) de dos campos vectoriales se expresa como la suma de sus derivadas covariantes según las respectivas conexiones, se dice que son conexiones duales.
$$ X \langle Y, Z \rangle = \langle \nabla_X^{(e)} Y, Z \rangle + \langle Y, \nabla_X^{(m)} Z \rangle $$Lo más destacable es que el espacio de las familias exponenciales (por ejemplo, distribución normal, distribución de Poisson, distribución gamma, etc.) es “plano” (el tensor de curvatura es cero) con respecto a la conexión e, y simultáneamente es “plano” con respecto a la conexión m. Un espacio con estas características se denomina espacio dual plano (Dually Flat Space).
En un espacio dual plano, existen líneas rectas respecto a la conexión e (geodésicas e) y líneas rectas respecto a la conexión m (geodésicas m). Además, en estos espacios existen como sistemas de parámetros sistemas de coordenadas duales (parámetros naturales $\theta$ y parámetros de expectativa $\eta$) conectados entre sí por la transformación de Legendre (Legendre Transformation).
El Teorema de Pitágoras Generalizado
La belleza del espacio dual plano se resume en el “Teorema de Pitágoras Generalizado (Generalized Pythagorean Theorem)”.
En el espacio euclidiano, cuando tres puntos $P, Q, R$ forman un triángulo rectángulo con $\angle PQR = 90^\circ$, se cumple que $d(P, R)^2 = d(P, Q)^2 + d(Q, R)^2$. En el espacio dual plano de la geometría de la información, cuando la curva que une los puntos $P, Q, R$ (distribuciones de probabilidad) está formada por una geodésica e y una geodésica m que son “ortogonales” en el punto $Q$ en el sentido de la métrica de Fisher, se cumple estrictamente la siguiente ecuación con respecto a la divergencia (concepto de distancia asimétrica) entre las distribuciones:
$$ D(P \parallel R) = D(P \parallel Q) + D(Q \parallel R) $$Este teorema explica de manera geométrica perfecta los criterios de información en estadística, la convergencia del algoritmo EM en el aprendizaje automático y el teorema de proyección (Information Projection), y es un resultado que puede considerarse la cúspide de la geometría de la información.
Capítulo 4: La Geometría de la Divergencia y la Entropía
Mientras que la distancia en la geometría de Riemann es simétrica ($d(x, y) = d(y, x)$), la medida de la “diferencia” entre distribuciones de probabilidad en la teoría de la información es generalmente asimétrica. La geometría de la información conecta brillantemente esta distancia asimétrica, o “divergencia (Divergence)”, con la estructura geométrica del espacio dual plano.
Cantidad de Información de Kullback-Leibler (Divergencia KL)
$$ D_{KL}(P \parallel Q) = \int p(x) \log \frac{p(x)}{q(x)} dx $$La divergencia KL no satisface los axiomas de la distancia (es asimétrica y no cumple la desigualdad triangular). Sin embargo, en el límite cuando el punto $Q$ se acerca infinitamente al punto $P$, el término de segundo orden de la expansión de Taylor de la divergencia KL coincide exactamente con la matriz de información de Fisher.
$$ D_{KL}(\theta \parallel \theta + d\theta) \approx \frac{1}{2} \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$Es decir, la divergencia KL es una distancia asimétrica macroscópica, y su límite microscópico (distancia infinitesimal) induce la métrica de Fisher (geometría de Riemann).
Divergencia de Bregman y Transformación de Legendre
En el espacio dual plano, la divergencia se formula de manera más general como la “divergencia de Bregman (Bregman Divergence)”. Consideremos una función convexa $\psi(\theta)$ (que corresponde a la función generadora de cumulantes o a la energía libre). La divergencia de Bregman $D_\psi(\theta_P \parallel \theta_Q)$ se define como el “error” entre el plano tangente de la función convexa en el punto $\theta_Q$ y el valor de la función convexa en el punto $\theta_P$.
$$ D_\psi(\theta_P \parallel \theta_Q) = \psi(\theta_P) - \psi(\theta_Q) - \sum_i (\theta_P^i - \theta_Q^i) \frac{\partial \psi(\theta_Q)}{\partial \theta^i} $$$$ \eta_i = \frac{\partial \psi(\theta)}{\partial \theta^i}, \quad \phi(\eta) = \sum_i \theta^i \eta_i - \psi(\theta) $$En la geometría de la información, la divergencia KL no es más que la divergencia de Bregman sobre la familia exponencial, y utilizando los parámetros duales $\theta$ (parámetro natural) y $\eta$ (parámetro de expectativa), la divergencia puede escribirse de una forma canónica (Canonical form) extremadamente simétrica y hermosa utilizando las funciones duales $\psi, \phi$.
$$ D(P \parallel Q) = \psi(\theta_P) + \phi(\eta_Q) - \sum_i \theta_P^i \eta_Q^i $$Esta fórmula ilustra vívidamente que la geometría de la información no es una mera aplicación de la geometría diferencial, sino una “geometría intrínseca a la teoría de la información” profundamente vinculada a la transformación de Legendre y al análisis convexo.
Capítulo 5: Aprendizaje Profundo y el Método del Gradiente Natural Descendente
La geometría de la información no se limita a su belleza teórica, sino que demuestra un poder sumamente práctico en la IA moderna, especialmente en el aprendizaje profundo (Deep Learning). El mejor ejemplo de ello es el “método del gradiente natural descendente (Natural Gradient Descent; NGD)”.
Las limitaciones del método del gradiente descendente normal
$$ w_{t+1} = w_t - \eta \nabla L(w_t) $$Sin embargo, el gradiente normal $\nabla L$ asume que el espacio de parámetros es un “espacio euclidiano plano”. Como vimos en el Capítulo 1, el espacio de parámetros de un modelo probabilístico representado por una red neuronal es una variedad de Riemann curvada por la métrica de Fisher. El gradiente del espacio euclidiano (la dirección de máximo descenso) no coincide con la verdadera dirección de máximo descenso en una variedad de Riemann. Por lo tanto, el trayecto del aprendizaje cambia considerablemente según la escala de los parámetros o la transformación de coordenadas, y ocurren con frecuencia fenómenos de “meseta (estancamiento del aprendizaje)” (plateau) en los que la eficiencia de la optimización disminuye significativamente.
Actualización de parámetros con la métrica de Fisher: El Método del Gradiente Natural
En 1998, Shun-ichi Amari propuso el “gradiente natural (Natural Gradient)”, que es la verdadera dirección de máximo descenso en una variedad de Riemann. El gradiente en la variedad $\tilde{\nabla} L$ se obtiene multiplicando el gradiente normal $\nabla L$ por la matriz inversa de la matriz de información de Fisher $F^{-1}$.
$$ \tilde{\nabla} L(w) = F(w)^{-1} \nabla L(w) $$$$ w_{t+1} = w_t - \eta F(w_t)^{-1} \nabla L(w_t) $$El método del gradiente natural, al considerar la curvatura del espacio de parámetros (matriz de información de Fisher), logra un aprendizaje invariante que no depende de cómo se toman los parámetros (sistema de coordenadas). Esto permite dirigirse en línea recta hacia la solución óptima, incluso cuando las líneas de contorno de la función de pérdida forman un terreno distorsionado similar al fondo de un valle, mejorando drásticamente la velocidad de aprendizaje. Se asemeja a los métodos de optimización de segundo orden como el método de Newton, pero al usar la matriz de información de Fisher (que garantiza semidefinición positiva) en lugar de la matriz hessiana, se puede decir que es un método optimizado para modelos probabilísticos.
Avance y la implementación del cálculo aproximado con K-FAC
Aunque teóricamente poderoso, la aplicación del método del gradiente natural al aprendizaje profundo enfrentaba un obstáculo importante. En las redes neuronales modernas con decenas a decenas de miles de millones de parámetros, calcular la inmensa matriz de información de Fisher $F$ (de tamaño $N \times N$) y encontrar su inversa era desesperanzador desde el punto de vista del costo computacional ($O(N^3)$).
Este problema fue resuelto por K-FAC (Kronecker-factored Approximate Curvature), un método propuesto por James Martens, Roger Grosse y otros en 2015. Demostraron que la matriz de información de Fisher para los parámetros entre las capas de una red neuronal se puede aproximar con precisión mediante el “producto de Kronecker (Kronecker Product)” de la matriz de covarianza de las entradas y la matriz de covarianza de los gradientes de las salidas.
$$ F_{layer} \approx A \otimes S $$(donde $A$ es la covarianza de los valores de activación y $S$ es la covarianza de los gradientes pre-activación)
Al usar la propiedad del producto de Kronecker $(A \otimes S)^{-1} = A^{-1} \otimes S^{-1}$, se puede descomponer el cálculo de la inversa de una matriz enorme en el cálculo de las inversas de matrices mucho más pequeñas, logrando reducir drásticamente el costo computacional (de $O(N^3)$ a $O(n^3)$, siendo $n$ el ancho de la capa). Con la implementación de K-FAC, el método del gradiente natural se volvió aplicable en tiempos computacionales realistas a modelos de aprendizaje profundo a gran escala (como ResNet y Transformer), y se ha demostrado que muestra una convergencia extremadamente rápida en entornos de aprendizaje distribuido. Este fue un momento histórico en el que la geometría de la información superó los límites de la IA.
Capítulo 6: Expansión a la Física Estadística, Información Cuántica y Neurociencia
La versatilidad de la geometría de la información no se limita a la estadística y el aprendizaje automático. La “geometría de la probabilidad y la información” que subyace a ella se ha extendido a muchos campos científicos.
Geometría de la Información Cuántica
La geometría de la información que trata distribuciones de probabilidad clásicas se extiende de forma natural a la geometría de la información cuántica (Quantum Information Geometry), que aborda la “matriz de densidad (Density Matrix)” en la mecánica cuántica. En los sistemas cuánticos, debido a la no conmutatividad de los observables (el orden de los operadores cambia el resultado), lo que equivale a la métrica de Fisher no se determina unívocamente. En su lugar, existen múltiples métricas de Riemann, como la métrica de Bures (información de Fisher SLD) y la métrica de Kubo-Mori-Bogoliubov, cada una con un significado físico e informático diferente. La geometría de la información cuántica se está desarrollando rápidamente como la base teórica para las computadoras y comunicaciones cuánticas, abarcando desde los límites de precisión en la estimación de estados cuánticos (desigualdad de Cramér-Rao cuántica) hasta la elucidación geométrica del entrelazamiento cuántico (entanglement) y la optimización de algoritmos cuánticos.
El Principio de Energía Libre y la Neurociencia (Codificación Predictiva)
En el campo de la neurociencia, el principio de energía libre (Free Energy Principle; FEP) propuesto por Karl Friston postula que el cerebro es un sistema que infiere la percepción y la acción para minimizar la “sorpresa (Surprise)”. Este proceso de inferencia se formula como una inferencia bayesiana variacional (Variational Bayesian Inference), lo que se reduce a un problema de optimización para minimizar la divergencia KL (energía libre variacional) entre la distribución de probabilidad del modelo interno del cerebro y la distribución verdadera del entorno externo.
Desde la perspectiva de la geometría de la información, el cerebro puede interpretarse como un sistema dinámico que se mueve sobre la variedad de distribuciones de probabilidad siguiendo el gradiente de la divergencia (es decir, el gradiente natural). La percepción (actualización del estado interno) y la acción (interacción con el entorno externo) se describen bellamente como un algoritmo iterativo de proyecciones e y proyecciones m en el espacio dual plano. La geometría de la información proporciona el lenguaje matemático para desentrañar los mecanismos fundamentales de la inteligencia.
Como frontera de las matemáticas modernas
Desde la perspectiva de las matemáticas puras, la geometría de la información ha presentado un nuevo paradigma. Se están esclareciendo sus profundas conexiones con la geometría diferencial afín, la geometría de Hesse y la geometría simpléctica. En particular, la integración de la geometría de Wasserstein (teoría del transporte óptimo) y la geometría de la información es uno de los temas de investigación más candentes en la actualidad tanto en matemáticas como en aprendizaje automático. Mientras que la divergencia KL (geometría de la información) mide el movimiento de la “información”, la distancia de Wasserstein mide el movimiento de la “masa”. Los intentos de fusionar estas dos geometrías están directamente relacionados con la clarificación teórica de los modelos generativos profundos (modelos de difusión y GANs).
Conclusión: La Forma del Universo Tejido por la Información
La geometría de la información, nacida de la intuición de Shun-ichi Amari de que “quizás los modelos estadísticos estén curvados”, ha crecido ahora más allá de los límites de la estadística para convertirse en un grandioso sistema teórico que conecta el aprendizaje automático, la física cuántica y la neurociencia. Al concebir las distribuciones de probabilidad no como meras funciones, sino como un “espacio” geométrico, podemos comprender visualmente el movimiento de la información, el curso del aprendizaje y la esencia de la inteligencia.
La “curvatura de la información” que enseña la métrica de información de Fisher. El “Teorema de Pitágoras generalizado” deducido por la conexión dual. Y la “rápida evolución de la IA” pionera gracias al método del gradiente natural.
La geometría de la información seguirá siendo la “brújula” más refinada para que podamos encontrar constelaciones de verdad entre las estrellas llamadas datos. Esta hermosa y profunda exploración de la variedad de Riemann apenas acaba de comenzar.
