Featured image of post 정보 기하학의 신비: 확률 분포가 엮어내는 리만 공간과 통계・AI의 미래

정보 기하학의 신비: 확률 분포가 엮어내는 리만 공간과 통계・AI의 미래

아마리 슌이치가 창시한 세계적 이론. 확률 분포 공간을 기하학화하는 피셔 정보 계량, 자연 기울기법, 기계 학습으로의 가교.

정보 기하학(Information Geometry)은 확률 분포가 이루는 공간에 미분 기하학의 구조를 도입하여, 통계적 추론이나 기계 학습, 정보 이론의 본질을 기하학적인 직관을 바탕으로 해명하는 일본발 세계적 이론입니다. 아마리 슌이치 박사 등에 의해 체계화된 이 이론은 현재 AI・딥러닝의 근간을 지탱하는 자연 기울기법(Natural Gradient Descent)이나 양자 정보 이론, 통계 물리학과 같은 폭넓은 분야에까지 응용되며 현대 과학에 있어 ‘공통 언어’로서의 지위를 확립해 나가고 있습니다.

본 기사에서는 이 정보 기하학의 심연한 세계를 수학적 엄밀성과 기하학적 직관, 그리고 구체적인 계산 예를 곁들여 가능한 한 상세하고 체계적으로 해설합니다. 단순한 수식의 나열에 그치지 않고, “왜 확률 분포의 공간은 휘어져 있는가”, “왜 피셔 정보 행렬이 계량 텐서가 되는가"라는 근원적인 질문에서 시작하여 쌍대 접속, 엔트로피의 기하학, 그리고 최첨단 기계 학습과 신경 과학으로의 응용까지 정보 기하학의 전모를 그려냅니다.


제1장: 정보 기하학의 여명과 아마리 슌이치의 직관

유클리드 공간의 통계에서 확률 분포의 휘어진 공간으로

고전적인 통계학이나 데이터 분석에서 우리는 무의식중에 데이터를 유클리드 공간 위의 점으로 다루어 왔습니다. 예를 들어, 매개변수 $\theta = (\theta_1, \theta_2, \dots, \theta_n)$ 를 가지는 통계 모델을 생각할 때, 매개변수 공간을 평탄한 공간으로 간주하고 매개변수 간의 거리를 일반적인 유클리드 거리로 측정하는 일이 빈번하게 이루어집니다. 제곱 오차를 최소화하는 최소 제곱법 등도 이 유클리드 기하학적인 직관에 기초하고 있습니다.

그러나 확률 분포를 매개변수화하는 공간은 정말로 “평탄"할까요?

정규 분포 $N(\mu, \sigma^2)$ 를 예로 들어 봅시다. 매개변수 공간은 평균 $\mu$ 와 분산 $\sigma^2 > 0$ 으로 이루어진 상반 평면 $\{(\mu, \sigma^2) \in \mathbb{R} \times \mathbb{R}_{>0}\}$ 입니다. 여기서 두 개의 정규 분포 쌍을 생각해 봅니다.

  1. $N(0, 1)$ 과 $N(0.1, 1)$
  2. $N(0, 100)$ 과 $N(0.1, 100)$

매개변수의 유클리드 거리로 보면 두 쌍 모두 거리는 $0.1$ 로 같습니다. 하지만 확률 분포로서의 “식별 가능성"이나 “정보의 차이"라는 관점에서는 어떨까요. 분산이 $1$ 로 작은 경우 평균이 $0.1$ 어긋나는 것만으로 분포의 형태는 유의미하게 변화하며, 데이터로부터 양자를 구별하는 것은 비교적 용이합니다. 반면, 분산이 $100$ 으로 매우 큰 경우 분포는 납작하게 퍼져 있어서 평균이 $0.1$ 어긋나도 분포의 겹침이 매우 커 데이터로부터 양자를 구별하는 것은 지극히 어려운 일입니다.

즉, “분포로서의 본래의 차이"는 매개변수의 유클리드 거리와 일치하지 않습니다. 분산이 큰 영역에서는 평균의 미세한 변화가 분포의 형태에 거의 영향을 주지 않고, 반대로 분산이 작은 영역에서는 극적인 변화를 가져옵니다. 이는 확률 분포의 매개변수 공간이 균일하지 않고, 장소에 따라 “거리의 척도가 다른 휘어진 공간(리만 다양체)“임을 강하게 시사하고 있습니다.

확률 분포족은 왜 다양체인가

정보 기하학은 통계 모델(확률 분포의 족)을 미분 가능 다양체(Differentiable Manifold)로 정식화합니다.

어떤 확률 공간 $\mathcal{X}$ 상의 확률 분포의 족을 $S$ 라고 합시다. 이 족이 $n$ 개의 연속적인 실수 매개변수 $\theta = (\theta^1, \dots, \theta^n)$ 에 의해 유일하게 지정되고, 확률 밀도 함수 $p(x; \theta)$ 가 $\theta$ 에 관하여 매끄러울 때, $S$ 를 $n$ 차원의 통계 다양체(Statistical Manifold)라고 부릅니다.

$$ S = \{ p(x; \theta) \mid \theta \in \Theta \subset \mathbb{R}^n \} $$

여기서 $\theta$ 는 다양체 $S$ 상의 ‘국소 좌표계(Local Coordinate System)‘에 다름 아닙니다. 다양체의 이론에서 좌표계는 본질적인 것이 아니며 단지 표현 중 하나에 불과합니다. 예를 들어 정규 분포의 경우, 매개변수로 $(\mu, \sigma^2)$ 를 선택할 수도 있고, $(\mu, \sigma)$ 나 $(\frac{\mu}{\sigma^2}, -\frac{1}{2\sigma^2})$ 를 선택하는 것도 가능합니다.

정보 기하학의 진수는 “좌표계의 취하는 방식에 의존하지 않는, 확률 분포족 자체가 가지는 내재적인 기하학 구조"를 밝히는 데 있습니다. 아마리 슌이치는 C.R. Rao가 제창한 “피셔 정보 행렬을 계량으로 하는 리만 다양체"라는 개념을 더욱 심화시키고, 아핀 접속(Affine Connection)의 개념을 도입함으로써 확률 분포의 공간에 “휘어진 정도(곡률)“뿐만 아니라 “직선의 개념(측지선)“이나 “쌍대성"이라는 풍부한 구조를 발견했습니다.


제2장: 리만 다양체로서의 통계 모델

다양체에서 ‘거리’와 ‘각도’를 정의하기 위해서는 리만 계량(Riemannian Metric)이 필요합니다. 통계 다양체에서의 자연스러운 리만 계량은 무엇일까요?

스코어 함수와 피셔 정보 행렬

통계학에서 로그 우도 함수 $\log p(x; \theta)$ 의 매개변수에 관한 편미분은 ‘스코어 함수(Score Function)‘라고 불리며 중요한 역할을 합니다.

$$ \partial_i \ell(x; \theta) = \frac{\partial}{\partial \theta^i} \log p(x; \theta) $$$$ E_\theta[\partial_i \ell(x; \theta)] = \int \frac{\partial p(x; \theta)}{\partial \theta^i} dx = \frac{\partial}{\partial \theta^i} \int p(x; \theta) dx = 0 $$$$ g_{ij}(\theta) = E_\theta \left[ \partial_i \ell(x; \theta) \partial_j \ell(x; \theta) \right] $$

C.R. Rao (1945) 는 이 피셔 정보 행렬이 텐서의 변환 법칙을 만족하는 양의 정부호 대칭 행렬이라는 것에 착안하여, 이를 통계 다양체의 리만 계량(피셔 계량)으로 채택할 것을 제안했습니다.

$$ ds^2 = \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

이로써 통계 모델은 리만 다양체 $(S, G)$ 가 됩니다. 근접한 두 확률 분포 $p(x; \theta)$ 와 $p(x; \theta + d\theta)$ 사이의 미소한 “거리의 제곱"은 이 피셔 계량에 의해 측정됩니다.

불변 계량으로서의 첸초프의 정리

왜 피셔 정보 행렬을 계량으로 선택해야 할까요? 단순한 생각이 아니라 거기에는 깊은 수학적 필연성이 있습니다.

N.N. Chentsov (1972) 는 통계적인 추론의 틀에서 요구되는 ‘불변성(Invariance)‘을 정식화했습니다. 통계적 추론은 데이터의 표현 방법이나 충분 통계량으로의 변환(마르코프 사상)에 의해 결과가 변해서는 안 됩니다. 첸초프의 정리는 “유한 집합 상의 확률 분포로 이루어진 다양체에서 마르코프 사상 하에 단조성(축소성)을 만족하는 리만 계량은 상수배를 제외하고 피셔 정보 계량에 국한된다"는 놀라운 사실을 보여주었습니다.

즉, 확률 분포의 공간에서 “정보가 감소하지 않는다"라는 자연스러운 통계적 요청을 만족하는 거리를 재는 방법은 피셔 계량밖에 존재하지 않는 것입니다. 이는 피셔 계량이 통계학에 특유한 내재적이고 필연적인 기하학적 구조임을 증명하고 있습니다.

정규 분포족에서의 피셔 계량의 구체적 계산 예

$$ p(x; \mu, \sigma) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right) $$$$ \log p = -\log(\sqrt{2\pi}) - \log\sigma - \frac{(x-\mu)^2}{2\sigma^2} $$$$ \partial_\mu \log p = \frac{x-\mu}{\sigma^2}, \quad \partial_\sigma \log p = -\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3} $$$$ g_{\mu\mu} = E\left[ \left(\frac{x-\mu}{\sigma^2}\right)^2 \right] = \frac{1}{\sigma^2} $$$$ g_{\sigma\sigma} = E\left[ \left(-\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3}\right)^2 \right] = \frac{2}{\sigma^2} $$$$ g_{\mu\sigma} = g_{\sigma\mu} = 0 $$$$ ds^2 = \frac{1}{\sigma^2} d\mu^2 + \frac{2}{\sigma^2} d\sigma^2 $$

이것은 앙리 푸앵카레가 제창한 쌍곡 기하학(비유클리드 기하학의 일종)의 모델인 푸앵카레 상반 평면의 계량(상수배의 차이를 제외함)과 완전히 일치합니다. 즉, 정규 분포의 공간은 음의 정곡률을 가지는 쌍곡 공간임을 알 수 있습니다. 앞서 직관한 대로 $\sigma$ 가 큰(분산이 큰) 영역에서는 계량 텐서 $1/\sigma^2$ 가 작아지고, 매개변수의 변동이 ‘거리’로서 작게 평가된다는 것이 수식으로부터도 뒷받침되었습니다.


제3장: 쌍대 접속과 $\alpha$-접속의 심연

리만 계량만으로는 공간의 ‘휘어진 정도’를 완벽하게 기술할 수 없습니다. ‘어느 방향이 올곧은가’를 정하는 아핀 접속(Affine Connection)이 필요합니다. 아마리 슌이치의 최대의 공적은 통계 다양체에는 무한히 많은 자연스러운 접속이 존재하며, 그것들이 ‘쌍대성(Duality)‘이라는 아름다운 구조를 이루고 있다는 것을 발견한 점에 있습니다.

$\alpha$-접속의 정의

아마리는 실수 매개변수 $\alpha$ 를 이용하여 $\alpha$-접속이라고 불리는 아핀 접속의 족을 도입했습니다. 그 접속 계수 $\Gamma_{ij,k}^{(\alpha)}$ 는 다음과 같이 정의됩니다.

$$ \Gamma_{ij,k}^{(\alpha)} = E \left[ \left( \partial_i \partial_j \ell + \frac{1 - \alpha}{2} \partial_i \ell \partial_j \ell \right) \partial_k \ell \right] $$

$\alpha = 0$ 일 때의 $0$-접속은 피셔 계량으로부터 유일하게 정해지는 레비-치비타 접속(Levi-Civita Connection)과 일치합니다. 이는 일반적인 리만 기하학에서 이용되는 접속입니다. 그러나 정보 기하학에서 가장 중요한 역할을 하는 것은 $\alpha = 1$ 과 $\alpha = -1$ 의 접속입니다.

e-접속과 m-접속, 그리고 쌍대 평탄 공간

  • e-접속($\alpha = 1$ 지수 접속): 지수형 분포족(Exponential Family)을 다룰 때 자연스럽게 나타나는 접속입니다.
  • m-접속($\alpha = -1$ 혼합 접속): 혼합형 분포족(Mixture Family)을 다룰 때 자연스럽게 나타나는 접속입니다.

이 두 가지 접속은 피셔 계량 $g_{ij}$ 에 관하여 ‘쌍대(Dual)‘의 관계에 있습니다. 리만 다양체에서 두 벡터장의 내적(계량)의 미분이 각각의 접속에 의한 공변 미분의 합으로 표현될 때, 그들은 쌍대 접속이라고 불립니다.

$$ X \langle Y, Z \rangle = \langle \nabla_X^{(e)} Y, Z \rangle + \langle Y, \nabla_X^{(m)} Z \rangle $$

특기할 만한 점은, 지수형 분포족(예를 들어 정규 분포, 푸아송 분포, 감마 분포 등)의 공간은 e-접속에 관하여 ‘평탄(곡률 텐서가 영)‘하며, 동시에 m-접속에 관해서도 ‘평탄’하다는 사실입니다. 이러한 공간을 쌍대 평탄 공간(Dually Flat Space)이라고 부릅니다.

쌍대 평탄 공간에서는 e-접속에 관하여 곧은 선(e-측지선)과 m-접속에 관하여 곧은 선(m-측지선)이 존재합니다. 나아가 이들 공간에서는 매개변수계로서, 서로 르장드르 변환(Legendre Transformation)으로 연결되는 쌍대 좌표계(자연 매개변수 $\theta$ 와 기댓값 매개변수 $\eta$)가 존재합니다.

일반화된 피타고라스 정리

쌍대 평탄 공간의 아름다움은 ‘일반화된 피타고라스 정리(Generalized Pythagorean Theorem)‘로 집약됩니다.

유클리드 공간에서는 세 점 $P, Q, R$ 이 $\angle PQR = 90^\circ$ 의 직각 삼각형을 이룰 때 $d(P, R)^2 = d(P, Q)^2 + d(Q, R)^2$ 가 성립합니다. 정보 기하학의 쌍대 평탄 공간에서는 점 $P, Q, R$(확률 분포)을 잇는 곡선이 e-측지선과 m-측지선으로 이루어지고, 그것들이 점 $Q$ 에서 피셔 계량의 의미로 ‘직교’하고 있을 때, 분포 간의 다이버전스(비대칭적인 거리의 개념)에 관하여 다음 식이 엄밀하게 성립합니다.

$$ D(P \parallel R) = D(P \parallel Q) + D(Q \parallel R) $$

이 정리는 통계학에서의 정보량 기준이나 기계 학습에서의 EM 알고리즘의 수렴성, 사영 정리(Information Projection)를 기하학적으로 완벽하게 설명하는 것이며, 정보 기하학의 금자탑이라고도 할 수 있는 결과입니다.


제4장: 다이버전스와 엔트로피의 기하학

리만 기하학에서의 거리는 대칭($d(x, y) = d(y, x)$)이지만, 정보 이론에서의 확률 분포 간의 ‘차이’의 척도는 일반적으로 비대칭입니다. 정보 기하학은 이 비대칭적인 거리 ‘다이버전스(Divergence)‘와 쌍대 평탄 공간의 기하학적 구조를 멋지게 연결합니다.

쿨백-라이블러 정보량(KL 다이버전스)

$$ D_{KL}(P \parallel Q) = \int p(x) \log \frac{p(x)}{q(x)} dx $$

KL 다이버전스는 거리의 공리를 만족하지 않습니다(비대칭이며 삼각 부등식도 만족하지 않음). 그러나 점 $Q$ 가 점 $P$ 에 한없이 가까워지는 극한에서 KL 다이버전스의 테일러 전개 2차 항은 정확하게 피셔 정보 행렬과 일치합니다.

$$ D_{KL}(\theta \parallel \theta + d\theta) \approx \frac{1}{2} \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

즉, KL 다이버전스는 거시적인 비대칭 거리이며, 그 미시적인 극한(무한소 거리)이 피셔 계량(리만 기하학)을 유도하고 있는 것입니다.

브레그만 다이버전스와 르장드르 변환

쌍대 평탄 공간에서 다이버전스는 보다 일반적인 ‘브레그만 다이버전스(Bregman Divergence)‘로 정식화됩니다. 볼록 함수 $\psi(\theta)$(큐물런트 생성 함수나 자유 에너지에 대응)를 생각해 봅시다. 브레그만 다이버전스 $D_\psi(\theta_P \parallel \theta_Q)$ 는 점 $\theta_Q$ 에서의 볼록 함수의 접평면과 점 $\theta_P$ 에서의 볼록 함수의 값과의 ‘오차’로 정의됩니다.

$$ D_\psi(\theta_P \parallel \theta_Q) = \psi(\theta_P) - \psi(\theta_Q) - \sum_i (\theta_P^i - \theta_Q^i) \frac{\partial \psi(\theta_Q)}{\partial \theta^i} $$$$ \eta_i = \frac{\partial \psi(\theta)}{\partial \theta^i}, \quad \phi(\eta) = \sum_i \theta^i \eta_i - \psi(\theta) $$

정보 기하학에서 KL 다이버전스는 지수형 분포족 상의 브레그만 다이버전스 그 자체이며, 쌍대 매개변수 $\theta$(자연 매개변수)와 $\eta$(기댓값 매개변수)를 이용함으로써, 다이버전스는 쌍대 함수 $\psi, \phi$ 를 이용한 지극히 대칭적이고 아름다운 정준형(Canonical form)으로 표기할 수 있습니다.

$$ D(P \parallel Q) = \psi(\theta_P) + \phi(\eta_Q) - \sum_i \theta_P^i \eta_Q^i $$

이 수식은 정보 기하학이 단순한 미분 기하학의 응용이 아니라, 르장드르 변환이나 볼록 해석과 깊게 결부된 “정보 이론 고유의 기하학"임을 여실히 말해주고 있습니다.


제5장: 딥러닝과 자연 기울기 하강법

정보 기하학은 이론적인 아름다움에 그치지 않고, 현대의 AI, 특히 딥러닝(심층 학습)에서 극히 실천적인 위력을 발휘하고 있습니다. 그 대표적인 예가 ‘자연 기울기 하강법(Natural Gradient Descent; NGD)‘입니다.

일반적인 기울기 하강법의 한계

$$ w_{t+1} = w_t - \eta \nabla L(w_t) $$

그러나 통상적인 기울기 $\nabla L$ 은 매개변수 공간이 ‘평탄한 유클리드 공간’임을 전제로 하고 있습니다. 제1장에서 살펴보았듯이, 신경망이 표현하는 확률 모델의 매개변수 공간은 피셔 계량에 의해 휘어진 리만 다양체입니다. 유클리드 공간의 기울기(최급강하 방향)는 리만 다양체 위에서는 진정한 최급강하 방향과 일치하지 않습니다. 그 때문에 매개변수의 스케일이나 좌표 변환에 의해 학습의 궤적이 크게 변화하고, 최적화의 효율이 현저히 저하되는 ‘고원(학습의 정체)’ 현상이 빈발합니다.

피셔 계량에 의한 매개변수 갱신: 자연 기울기법

1998년, 아마리 슌이치는 리만 다양체 위에서의 진정한 최급강하 방향인 ‘자연 기울기(Natural Gradient)‘를 제창했습니다. 다양체 위에서의 기울기 $\tilde{\nabla} L$ 은 통상적인 기울기 $\nabla L$ 에 피셔 정보 행렬의 역행렬 $F^{-1}$ 을 곱한 것이 됩니다.

$$ \tilde{\nabla} L(w) = F(w)^{-1} \nabla L(w) $$$$ w_{t+1} = w_t - \eta F(w_t)^{-1} \nabla L(w_t) $$

자연 기울기법은 매개변수 공간의 곡률(피셔 정보 행렬)을 고려함으로써, 매개변수를 취하는 방식(좌표계)에 의존하지 않는 불변의 학습을 실현합니다. 이를 통해 손실 함수의 등고선이 왜곡된 계곡 바닥과 같은 지형이더라도 직선적으로 최적해를 향해 나아갈 수 있게 되어 학습 속도가 비약적으로 향상됩니다. 이는 뉴턴법과 같은 2차 최적화 기법과 비슷하지만, 헤세 행렬 대신 반정부호성이 보장된 피셔 정보 행렬을 이용한다는 점에서 확률 모델에 최적화된 기법이라고 할 수 있습니다.

K-FAC에 의한 근사 계산의 구현과 돌파구

이론적으로는 강력한 자연 기울기법이지만, 딥러닝으로의 적용에는 큰 장벽이 있었습니다. 수천만에서 수백억 개의 매개변수를 가지는 현대의 신경망에서 거대한 피셔 정보 행렬 $F$(크기 $N \times N$)를 계산하고 그 역행렬을 구하는 것은 계산량의 관점에서 절망적($O(N^3)$)이었습니다.

이 문제를 해결한 것이 James Martens 와 Roger Grosse 등이 2015년에 제안한 K-FAC (Kronecker-factored Approximate Curvature) 라는 기법입니다. 그들은 신경망의 층간 매개변수에서의 피셔 정보 행렬이, 입력의 공분산 행렬과 출력 기울기의 공분산 행렬의 ‘크로네커 곱(Kronecker Product)‘으로 정밀하게 근사될 수 있음을 보여주었습니다.

$$ F_{layer} \approx A \otimes S $$

(여기서 $A$ 는 활성화 값의 공분산, $S$ 는 사전 활성화 기울기의 공분산)

크로네커 곱의 성질 $(A \otimes S)^{-1} = A^{-1} \otimes S^{-1}$ 을 이용함으로써, 거대한 행렬의 역행렬 계산을 훨씬 작은 행렬의 역행렬 계산으로 분해할 수 있어 계산 비용을 극적으로 삭감($O(N^3)$ 에서 $O(n^3)$ 으로, $n$ 은 층의 너비)하는 데 성공했습니다. K-FAC의 구현에 의해 자연 기울기법은 현실적인 계산 시간에 대규모 심층 학습 모델(ResNet이나 Transformer 등)에 적용 가능해졌으며, 분산 학습 환경에서 극히 고속의 수렴을 나타냄이 실증되고 있습니다. 이는 정보 기하학이 AI의 한계를 돌파한 역사적 순간이었습니다.


제6장: 통계 물리학, 양자 정보, 신경 과학으로의 확장

정보 기하학의 범용성은 통계학이나 기계 학습에 머무르지 않습니다. 그 근저에 있는 ‘확률과 정보의 기하학’은 많은 과학 분야로 파급되고 있습니다.

양자 정보 기하학

고전적인 확률 분포를 다루는 정보 기하학은 양자 역학에서의 ‘밀도 행렬(Density Matrix)‘을 다루는 양자 정보 기하학(Quantum Information Geometry) 으로 자연스럽게 확장됩니다. 양자계에서는 관측량의 비가환성(연산자가 순서에 따라 결과가 바뀌는 것)에 기인하여 피셔 계량에 해당하는 것이 유일하게 정해지지 않습니다. 그 대신 Bures 계량(SLD 피셔 정보량)이나 Kubo-Mori-Bogoliubov 계량 등 여러 리만 계량이 존재하며, 각각이 다른 물리적・정보론적 의미를 갖습니다. 양자 정보 기하학은 양자 상태의 추정 정밀도의 한계(양자 크래머-라오 부등식)나 양자 얽힘(엔탱글먼트)의 기하학적 해명, 양자 알고리즘의 최적화 등 양자 컴퓨터와 양자 통신의 이론적 기반으로서 급속히 발전하고 있습니다.

자유 에너지 원리와 신경 과학(예측 부호화)

뇌신경 과학 분야에서 Karl Friston 이 제창하는 자유 에너지 원리(Free Energy Principle; FEP) 는 뇌가 ‘놀람(Surprise)‘을 최소화하도록 지각과 행동을 추론하는 시스템이라고 가정합니다. 이 추론 과정은 변분 베이즈 추론(Variational Bayesian Inference)으로 정식화되며, 거기서는 뇌 안의 내부 모델 확률 분포와 외부 환경의 실제 분포 사이의 KL 다이버전스(변분 자유 에너지)를 최소화하는 최적화 문제로 귀결됩니다.

정보 기하학의 관점에서 보면, 뇌는 확률 분포의 다양체 위를 다이버전스의 기울기(즉, 자연 기울기)를 따라 움직이는 역학계로 해석할 수 있습니다. 지각(내부 상태의 갱신)과 행동(외부 환경에 대한 작용)은 쌍대 평탄 공간에서의 e-사영과 m-사영의 반복 알고리즘으로 아름답게 기술되는 것입니다. 정보 기하학은 지능의 근원적인 메커니즘을 해명하기 위한 수학적 언어를 제공하고 있습니다.

현대 수학의 프론티어로서

순수 수학의 관점에서도 정보 기하학은 새로운 패러다임을 제시했습니다. 아핀 미분 기하학, 헤세 기하학, 심플렉틱 기하학과의 깊은 연결 고리가 해명되고 있습니다. 특히, Wasserstein 기하학(최적 수송 이론)과 정보 기하학의 통합은 현재 수학 및 기계 학습에서 가장 핫한 연구 주제 중 하나입니다. KL 다이버전스(정보 기하)가 ‘정보’의 이동을 측정하는 데 반해, Wasserstein 거리는 ‘질량’의 이동을 측정합니다. 이 두 가지 기하학을 융합하려는 시도는 심층 생성 모델(확산 모델이나 GAN)의 이론적 해명에 직결되어 있습니다.


맺음말: 정보가 엮어내는 우주의 형태

아마리 슌이치가 “통계 모델은 휘어져 있는 것이 아닐까"라는 직관에서 탄생시킨 정보 기하학은 이제 통계학의 틀을 넘어 기계 학습, 양자 물리학, 신경 과학을 연결하는 장대한 이론 체계로 성장했습니다. 확률 분포를 단순한 함수로서가 아니라 기하학적인 ‘공간’으로 파악함으로써, 우리는 정보의 움직임, 학습의 궤적, 그리고 지능의 본질을 시각적으로 이해할 수 있습니다.

피셔 정보 계량이 가르쳐주는 ‘정보의 휘어진 정도’. 쌍대 접속이 이끄는 ‘일반화된 피타고라스 정리’. 그리고 자연 기울기법이 개척하는 ‘AI의 고속 진화’.

정보 기하학은 우리가 데이터라는 이름의 별들로부터 진리라는 이름의 별자리를 찾아내기 위한, 가장 세련된 ‘나침반’으로서 계속 존재할 것입니다. 이 아름답고도 심연한 리만 다양체의 탐구는 이제 막 시작되었을 뿐입니다.

comments powered by Disqus