Featured image of post Тайны информационной геометрии: Римановы пространства, сотканные вероятностными распределениями, и будущее статистики и ИИ

Тайны информационной геометрии: Римановы пространства, сотканные вероятностными распределениями, и будущее статистики и ИИ

Всемирно известная теория, основанная Сюнъити Амари. Информационная метрика Фишера, геометризирующая пространства распределений вероятностей, метод естественного градиента и мост к машинному обучению.

Информационная геометрия (Information Geometry) — это всемирно известная теория, зародившаяся в Японии, которая вводит структуру дифференциальной геометрии в пространство распределений вероятностей и раскрывает суть статистического вывода, машинного обучения и теории информации на основе геометрической интуиции. Систематизированная доктором Сюнъити Амари и другими, эта теория в настоящее время применяется в широком спектре областей, таких как метод естественного градиентного спуска (Natural Gradient Descent), поддерживающий основу ИИ и глубокого обучения, а также квантовая теория информации и статистическая физика, утверждая свой статус в качестве “общего языка” в современной науке.

В этой статье мы подробно и систематично рассмотрим глубинный мир информационной геометрии, сочетая математическую строгость, геометрическую интуицию и конкретные примеры вычислений. Не ограничиваясь простым перечислением формул, мы начнем с фундаментальных вопросов: «Почему пространство вероятностных распределений искривлено?» и «Почему информационная матрица Фишера становится метрическим тензором?», и обрисуем всю картину информационной геометрии вплоть до дуальных связностей, геометрии энтропии и применения в передовых методах машинного обучения и нейробиологии.


Глава 1: Рассвет информационной геометрии и интуиция Сюнъити Амари

От статистики евклидова пространства к искривленному пространству распределений вероятностей

В классической статистике и анализе данных мы бессознательно рассматривали данные как точки в евклидовом пространстве. Например, при рассмотрении статистической модели с параметрами $\theta = (\theta_1, \theta_2, \dots, \theta_n)$ пространство параметров часто считается плоским, и расстояние между параметрами измеряется обычным евклидовым расстоянием. Метод наименьших квадратов, минимизирующий квадратичную ошибку, также основан на этой евклидовой геометрической интуиции.

Однако действительно ли пространство, параметризующее вероятностные распределения, является «плоским»?

Возьмем для примера нормальное распределение $N(\mu, \sigma^2)$. Пространство параметров представляет собой верхнюю полуплоскость $\{(\mu, \sigma^2) \in \mathbb{R} \times \mathbb{R}_{>0}\}$, состоящую из среднего $\mu$ и дисперсии $\sigma^2 > 0$. Теперь рассмотрим две пары нормальных распределений:

  1. $N(0, 1)$ и $N(0.1, 1)$
  2. $N(0, 100)$ и $N(0.1, 100)$

С точки зрения евклидова расстояния параметров, в обеих парах расстояние одинаково и равно $0.1$. Но как насчет этого с точки зрения «различимости» или «информационной разницы» как вероятностных распределений? Когда дисперсия мала и равна $1$, сдвиг среднего всего на $0.1$ значительно изменяет форму распределения, и отличить их друг от друга по данным относительно легко. С другой стороны, когда дисперсия чрезвычайно велика и равна $100$, распределение плоское и растянутое, и при сдвиге среднего на $0.1$ распределения сильно перекрываются, что делает их различие по данным чрезвычайно сложной задачей.

Иными словами, «истинная разница как распределений» не совпадает с евклидовым расстоянием параметров. В областях с большой дисперсией небольшое изменение среднего значения почти не влияет на форму распределения, тогда как в областях с малой дисперсией оно вызывает кардинальные изменения. Это убедительно свидетельствует о том, что пространство параметров распределения вероятностей неоднородно, а представляет собой «искривленное пространство (риманово многообразие), масштаб расстояний в котором варьируется в зависимости от местоположения».

Почему семейства вероятностных распределений являются многообразиями?

Информационная геометрия формулирует статистические модели (семейства вероятностных распределений) как дифференцируемые многообразия (Differentiable Manifolds).

Пусть $S$ — семейство распределений вероятностей на некотором вероятностном пространстве $\mathcal{X}$. Если это семейство однозначно задается $n$ непрерывными вещественными параметрами $\theta = (\theta^1, \dots, \theta^n)$, а функция плотности вероятности $p(x; \theta)$ гладкая по $\theta$, то $S$ называется $n$-мерным статистическим многообразием (Statistical Manifold).

$$ S = \{ p(x; \theta) \mid \theta \in \Theta \subset \mathbb{R}^n \} $$

Здесь $\theta$ — это не что иное, как «локальная система координат» (Local Coordinate System) на многообразии $S$. В теории многообразий система координат не является чем-то фундаментальным, это лишь один из способов представления. Например, в случае нормального распределения мы можем выбрать $(\mu, \sigma^2)$ в качестве параметров, а также можем выбрать $(\mu, \sigma)$ или $(\frac{\mu}{\sigma^2}, -\frac{1}{2\sigma^2})$.

Суть информационной геометрии заключается в раскрытии «внутренней геометрической структуры самого семейства вероятностных распределений, которая не зависит от выбора системы координат». Сюнъити Амари углубил концепцию «риманова многообразия с информационной матрицей Фишера в качестве метрики», предложенную Ч. Р. Рао, и, введя понятие аффинной связности (Affine Connection), обнаружил в пространстве распределений вероятностей богатую структуру: не только «степень кривизны», но и «понятие прямой (геодезической)» и «дуальность».


Глава 2: Статистические модели как римановы многообразия

Для того чтобы определить «расстояние» и «угол» на многообразии, необходима риманова метрика (Riemannian Metric). Что же является естественной римановой метрикой для статистического многообразия?

Функция вклада (Score Function) и информационная матрица Фишера

В статистике частная производная логарифмической функции правдоподобия $\log p(x; \theta)$ по параметру называется «функцией вклада» (Score Function) и играет важную роль.

$$ \partial_i \ell(x; \theta) = \frac{\partial}{\partial \theta^i} \log p(x; \theta) $$$$ E_\theta[\partial_i \ell(x; \theta)] = \int \frac{\partial p(x; \theta)}{\partial \theta^i} dx = \frac{\partial}{\partial \theta^i} \int p(x; \theta) dx = 0 $$$$ g_{ij}(\theta) = E_\theta \left[ \partial_i \ell(x; \theta) \partial_j \ell(x; \theta) \right] $$

Ч. Р. Рао (1945) обратил внимание на то, что эта информационная матрица Фишера является положительно определенной симметричной матрицей, удовлетворяющей правилу преобразования тензоров, и предложил использовать ее в качестве римановой метрики (метрики Фишера) статистического многообразия.

$$ ds^2 = \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

Таким образом, статистическая модель становится римановым многообразием $(S, G)$. Бесконечно малый «квадрат расстояния» между двумя близкими вероятностными распределениями $p(x; \theta)$ и $p(x; \theta + d\theta)$ измеряется с помощью этой метрики Фишера.

Теорема Ченцова о инвариантной метрике

Почему мы должны выбирать информационную матрицу Фишера в качестве метрики? Это не просто случайная идея, за этим кроется глубокая математическая необходимость.

Н. Н. Ченцов (1972) формализовал «инвариантность» (Invariance), требуемую в рамках статистического вывода. Статистический вывод не должен меняться при изменении способа представления данных или при преобразовании в достаточную статистику (марковское отображение). Теорема Ченцова доказала удивительный факт: «На многообразии распределений вероятностей на конечном множестве риманова метрика, удовлетворяющая свойству монотонности (сжатия) при марковских отображениях, с точностью до константы ограничивается метрикой Фишера».

Иными словами, в пространстве распределений вероятностей единственный способ измерения расстояния, удовлетворяющий естественному статистическому требованию «информация не должна уменьшаться», — это метрика Фишера. Это доказывает, что метрика Фишера является внутренней и необходимой геометрической структурой, специфичной для статистики.

Конкретный пример расчета метрики Фишера в семействе нормальных распределений

$$ p(x; \mu, \sigma) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right) $$$$ \log p = -\log(\sqrt{2\pi}) - \log\sigma - \frac{(x-\mu)^2}{2\sigma^2} $$$$ \partial_\mu \log p = \frac{x-\mu}{\sigma^2}, \quad \partial_\sigma \log p = -\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3} $$$$ g_{\mu\mu} = E\left[ \left(\frac{x-\mu}{\sigma^2}\right)^2 \right] = \frac{1}{\sigma^2} $$$$ g_{\sigma\sigma} = E\left[ \left(-\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3}\right)^2 \right] = \frac{2}{\sigma^2} $$$$ g_{\mu\sigma} = g_{\sigma\mu} = 0 $$$$ ds^2 = \frac{1}{\sigma^2} d\mu^2 + \frac{2}{\sigma^2} d\sigma^2 $$

Это (с точностью до постоянного множителя) полностью совпадает с метрикой верхней полуплоскости Пуанкаре — модели гиперболической геометрии (разновидности неевклидовой геометрии), предложенной Анри Пуанкаре. Иными словами, пространство нормальных распределений является гиперболическим пространством с отрицательной постоянной кривизной. Как и предполагалось ранее, в областях, где $\sigma$ велико (дисперсия велика), метрический тензор $1/\sigma^2$ становится малым, и формулы подтверждают, что вариации параметров оцениваются как малые «расстояния».


Глава 3: Глубины дуальной связности и $\alpha$-связности

Одной лишь римановой метрики недостаточно, чтобы полностью описать «кривизну» пространства. Необходима аффинная связность (Affine Connection), определяющая, «в каком направлении идет прямая линия». Величайшее достижение Сюнъити Амари состоит в том, что он открыл наличие бесконечного множества естественных связностей на статистическом многообразии и то, что они образуют прекрасную структуру «дуальности» (Duality).

Определение $\alpha$-связности

Амари ввел семейство аффинных связностей, называемых $\alpha$-связностями, используя действительный параметр $\alpha$. Коэффициенты связности $\Gamma_{ij,k}^{(\alpha)}$ определяются следующим образом:

$$ \Gamma_{ij,k}^{(\alpha)} = E \left[ \left( \partial_i \partial_j \ell + \frac{1 - \alpha}{2} \partial_i \ell \partial_j \ell \right) \partial_k \ell \right] $$

$0$-связность при $\alpha = 0$ совпадает со связностью Леви-Чивиты (Levi-Civita Connection), которая однозначно определяется метрикой Фишера. Это связность, используемая в обычной римановой геометрии. Однако в информационной геометрии наиболее важную роль играют связности при $\alpha = 1$ и $\alpha = -1$.

e-связность и m-связность, и дуально плоские пространства

  • e-связность (экспоненциальная связность $\alpha = 1$): Связность, которая естественным образом возникает при работе с экспоненциальными семействами распределений (Exponential Family).
  • m-связность (смешанная связность $\alpha = -1$): Связность, которая естественным образом возникает при работе с семействами смесей (Mixture Family).

Эти две связности находятся в отношении «двойственности» (Dual) относительно метрики Фишера $g_{ij}$. На римановом многообразии, когда производная внутреннего произведения (метрики) двух векторных полей выражается как сумма ковариантных производных для каждой из связностей, они называются дуальными связностями.

$$ X \langle Y, Z \rangle = \langle \nabla_X^{(e)} Y, Z \rangle + \langle Y, \nabla_X^{(m)} Z \rangle $$

Особенно примечателен тот факт, что пространство экспоненциального семейства распределений (например, нормального распределения, распределения Пуассона, гамма-распределения и т. д.) является «плоским (тензор кривизны равен нулю)» относительно e-связности и одновременно «плоским» относительно m-связности. Такие пространства называются дуально плоскими пространствами (Dually Flat Space).

В дуально плоских пространствах существуют прямые линии относительно e-связности (e-геодезические) и прямые линии относительно m-связности (m-геодезические). Более того, в этих пространствах существуют дуальные системы координат (естественные параметры $\theta$ и параметры математического ожидания $\eta$), связанные друг с другом преобразованием Лежандра (Legendre Transformation).

Обобщенная теорема Пифагора

Красота дуально плоских пространств сводится к «Обобщенной теореме Пифагора» (Generalized Pythagorean Theorem).

В евклидовом пространстве, когда три точки $P, Q, R$ образуют прямоугольный треугольник с $\angle PQR = 90^\circ$, выполняется равенство $d(P, R)^2 = d(P, Q)^2 + d(Q, R)^2$. В дуально плоском пространстве информационной геометрии, когда кривая, соединяющая точки $P, Q, R$ (вероятностные распределения), состоит из e-геодезической и m-геодезической, и они «ортогональны» в точке $Q$ в смысле метрики Фишера, строго выполняется следующее уравнение относительно дивергенции (понятия асимметричного расстояния) между распределениями:

$$ D(P \parallel R) = D(P \parallel Q) + D(Q \parallel R) $$

Эта теорема геометрически полностью объясняет информационные критерии в статистике, сходимость EM-алгоритма в машинном обучении и теорему о проекции (Information Projection), и ее можно назвать монументальным результатом информационной геометрии.


Глава 4: Дивергенция и геометрия энтропии

Расстояние в римановой геометрии симметрично ($d(x, y) = d(y, x)$), но мера «различия» между вероятностными распределениями в теории информации обычно асимметрична. Информационная геометрия блестяще связывает это асимметричное расстояние — «дивергенцию» (Divergence) — с геометрической структурой дуально плоских пространств.

Информация Кульбака — Лейблера (KL-дивергенция)

$$ D_{KL}(P \parallel Q) = \int p(x) \log \frac{p(x)}{q(x)} dx $$

KL-дивергенция не удовлетворяет аксиомам расстояния (она асимметрична и не удовлетворяет неравенству треугольника). Однако в пределе, когда точка $Q$ бесконечно приближается к точке $P$, квадратичный член разложения Тейлора KL-дивергенции в точности совпадает с информационной матрицей Фишера.

$$ D_{KL}(\theta \parallel \theta + d\theta) \approx \frac{1}{2} \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

Иными словами, KL-дивергенция — это макроскопическое асимметричное расстояние, микроскопический предел (бесконечно малое расстояние) которого индуцирует метрику Фишера (риманову геометрию).

Дивергенция Брегмана и преобразование Лежандра

В дуально плоском пространстве дивергенция формулируется как более общая «дивергенция Брегмана» (Bregman Divergence). Рассмотрим выпуклую функцию $\psi(\theta)$ (соответствующую производящей функции кумулянтов или свободной энергии). Дивергенция Брегмана $D_\psi(\theta_P \parallel \theta_Q)$ определяется как «ошибка» между касательной плоскостью к выпуклой функции в точке $\theta_Q$ и значением выпуклой функции в точке $\theta_P$.

$$ D_\psi(\theta_P \parallel \theta_Q) = \psi(\theta_P) - \psi(\theta_Q) - \sum_i (\theta_P^i - \theta_Q^i) \frac{\partial \psi(\theta_Q)}{\partial \theta^i} $$$$ \eta_i = \frac{\partial \psi(\theta)}{\partial \theta^i}, \quad \phi(\eta) = \sum_i \theta^i \eta_i - \psi(\theta) $$

В информационной геометрии KL-дивергенция — это сама дивергенция Брегмана на экспоненциальном семействе распределений, и, используя дуальные параметры $\theta$ (естественный параметр) и $\eta$ (параметр математического ожидания), дивергенцию можно выразить в чрезвычайно симметричной и красивой канонической форме (Canonical form) с помощью дуальных функций $\psi, \phi$.

$$ D(P \parallel Q) = \psi(\theta_P) + \phi(\eta_Q) - \sum_i \theta_P^i \eta_Q^i $$

Эта формула красноречиво свидетельствует о том, что информационная геометрия — это не просто приложение дифференциальной геометрии, а «специфическая геометрия теории информации», глубоко связанная с преобразованием Лежандра и выпуклым анализом.


Глава 5: Глубокое обучение и метод естественного градиентного спуска

Информационная геометрия не ограничивается теоретической красотой, она демонстрирует чрезвычайно практическую мощь в современном ИИ, особенно в глубоком обучении. Наиболее ярким примером этого является метод «естественного градиентного спуска» (Natural Gradient Descent; NGD).

Ограничения обычного градиентного спуска

$$ w_{t+1} = w_t - \eta \nabla L(w_t) $$

Однако обычный градиент $\nabla L$ предполагает, что пространство параметров — это «плоское евклидово пространство». Как мы видели в главе 1, пространство параметров вероятностной модели, представляемой нейронной сетью, является римановым многообразием, искривленным метрикой Фишера. Градиент (направление наискорейшего спуска) в евклидовом пространстве не совпадает с истинным направлением наискорейшего спуска на римановом многообразии. По этой причине траектория обучения сильно меняется в зависимости от масштаба параметров или преобразования координат, что часто приводит к явлению «плато» (застою в обучении), когда эффективность оптимизации значительно падает.

Обновление параметров с помощью метрики Фишера: метод естественного градиента

В 1998 году Сюнъити Амари предложил «естественный градиент» (Natural Gradient), который является истинным направлением наискорейшего спуска на римановом многообразии. Градиент на многообразии $\tilde{\nabla} L$ представляет собой обычный градиент $\nabla L$, умноженный на матрицу, обратную информационной матрице Фишера $F^{-1}$.

$$ \tilde{\nabla} L(w) = F(w)^{-1} \nabla L(w) $$$$ w_{t+1} = w_t - \eta F(w_t)^{-1} \nabla L(w_t) $$

Метод естественного градиента реализует инвариантное обучение, не зависящее от выбора параметров (системы координат), за счет учета кривизны пространства параметров (информационной матрицы Фишера). Благодаря этому, даже если контуры функции потерь представляют собой искаженный рельеф, похожий на дно долины, становится возможным двигаться по прямой к оптимальному решению, что приводит к резкому скачку скорости обучения. Он похож на методы оптимизации второго порядка, такие как метод Ньютона, но в нем вместо матрицы Гессе используется информационная матрица Фишера, для которой гарантируется положительная полуопределенность, что делает этот метод оптимизированным для вероятностных моделей.

Реализация приближенных вычислений с помощью K-FAC и прорыв

Метод естественного градиента теоретически мощен, но на пути к его применению в глубоком обучении стоял большой барьер. В современных нейронных сетях с десятками миллионов или десятками миллиардов параметров вычисление гигантской информационной матрицы Фишера $F$ (размера $N \times N$) и нахождение ее обратной матрицы были безнадежными с точки зрения вычислительной сложности ($O(N^3)$).

Эту проблему решил метод K-FAC (Kronecker-factored Approximate Curvature), предложенный Джеймсом Мартенсом (James Martens), Роджером Гроссом (Roger Grosse) и их коллегами в 2015 году. Они показали, что информационная матрица Фишера для параметров между слоями нейронной сети может быть с высокой точностью аппроксимирована «кронекеровским произведением» (Kronecker Product) ковариационной матрицы входных данных и ковариационной матрицы градиентов выходных данных (pre-activations).

$$ F_{layer} \approx A \otimes S $$

(где $A$ — ковариация активаций, а $S$ — ковариация градиентов до активации)

Используя свойство кронекеровского произведения $(A \otimes S)^{-1} = A^{-1} \otimes S^{-1}$, вычисление обратной матрицы для гигантской матрицы можно разбить на вычисления обратных матриц для гораздо меньших матриц, что привело к успеху в радикальном снижении вычислительных затрат (с $O(N^3)$ до $O(n^3)$, где $n$ — ширина слоя). Благодаря реализации K-FAC метод естественного градиента стал применимым к крупномасштабным моделям глубокого обучения (таким как ResNet и Transformer) в реальное время и продемонстрировал чрезвычайно быструю сходимость в распределенных вычислительных средах. Это был исторический момент, когда информационная геометрия преодолела ограничения ИИ.


Глава 6: Расширение на статистическую физику, квантовую информацию и нейробиологию

Универсальность информационной геометрии не ограничивается статистикой и машинным обучением. Лежащая в ее основе «геометрия вероятности и информации» распространилась на многие области науки.

Квантовая информационная геометрия

Информационная геометрия, работающая с классическими распределениями вероятностей, естественным образом расширяется до квантовой информационной геометрии (Quantum Information Geometry), работающей с «матрицами плотности» (Density Matrix) в квантовой механике. В квантовых системах из-за некоммутативности наблюдаемых величин (результат применения операторов зависит от их порядка) не существует однозначно определенного эквивалента метрики Фишера. Вместо этого существует множество римановых метрик, таких как метрика Буреса (квантовая информационная метрика Фишера SLD) и метрика Кубо — Мори — Боголюбова, каждая из которых имеет свой собственный физический и теоретико-информационный смысл. Квантовая информационная геометрия стремительно развивается как теоретическая база для квантовых компьютеров и квантовой связи, включая ограничения точности оценки квантовых состояний (квантовое неравенство Крамера — Рао), геометрическое выяснение природы квантовой запутанности (энтанглмента) и оптимизацию квантовых алгоритмов.

Принцип свободной энергии и нейробиология (прогностическое кодирование)

В области нейробиологии принцип свободной энергии (Free Energy Principle; FEP), предложенный Карлом Фристоном (Karl Friston), постулирует, что мозг представляет собой систему, которая выводит восприятие и действие таким образом, чтобы минимизировать «неожиданность» (Surprise). Этот процесс вывода формулируется как вариационный байесовский вывод (Variational Bayesian Inference), который сводится к задаче оптимизации — минимизации KL-дивергенции (вариационной свободной энергии) между вероятностным распределением внутренней модели мозга и истинным распределением внешней среды.

С точки зрения информационной геометрии, мозг можно интерпретировать как динамическую систему, движущуюся по многообразию вероятностных распределений вдоль градиента дивергенции (то есть естественного градиента). Восприятие (обновление внутренних состояний) и действие (воздействие на внешнюю среду) красиво описываются как итеративный алгоритм e-проекции и m-проекции в дуально плоском пространстве. Информационная геометрия предоставляет математический язык для раскрытия фундаментальных механизмов интеллекта.

Как рубеж современной математики

С точки зрения чистой математики, информационная геометрия также представила новую парадигму. Выясняется ее глубокая связь с аффинной дифференциальной геометрией, геометрией Гессе и симплектической геометрией. В частности, интеграция геометрии Вассерштейна (теории оптимального транспорта) и информационной геометрии является одной из самых горячих тем исследований в современной математике и машинном обучении. В то время как KL-дивергенция (информационная геометрия) измеряет перемещение «информации», расстояние Вассерштейна измеряет перемещение «массы». Попытки слияния этих двух геометрий напрямую связаны с теоретическим объяснением глубоких генеративных моделей (таких как диффузионные модели и GAN).


Заключение: Форма вселенной, сотканной из информации

Информационная геометрия, порожденная интуицией Сюнъити Амари о том, что «статистические модели могут быть искривлены», теперь вышла за рамки статистики и переросла в грандиозную теоретическую систему, объединяющую машинное обучение, квантовую физику и нейробиологию. Рассматривая распределение вероятностей не просто как функцию, а как геометрическое «пространство», мы можем визуально понять движение информации, траектории обучения и суть интеллекта.

«Степень кривизны информации», о которой говорит информационная метрика Фишера. «Обобщенная теорема Пифагора», выводимая дуальной связностью. И «быстрая эволюция ИИ», прокладываемая методом естественного градиента.

Информационная геометрия останется самым совершенным «компасом» для того, чтобы находить созвездия истины среди звезд данных. Исследование этого прекрасного и глубокого риманова многообразия только началось.

comments powered by Disqus