Featured image of post Die Mysterien der Informationsgeometrie: Riemannsche Räume gewebt aus Wahrscheinlichkeitsverteilungen und die Zukunft von Statistik und KI

Die Mysterien der Informationsgeometrie: Riemannsche Räume gewebt aus Wahrscheinlichkeitsverteilungen und die Zukunft von Statistik und KI

Eine von Shun-ichi Amari begründete, weltweit anerkannte Theorie. Die Fisher-Informationsmetrik, die den Raum der Wahrscheinlichkeitsverteilungen geometrisiert, die natürliche Gradientenmethode und die Brücke zum maschinellen Lernen.

Informationsgeometrie (Information Geometry) ist eine weltweit anerkannte Theorie aus Japan, die die Struktur der Differentialgeometrie in den Raum der Wahrscheinlichkeitsverteilungen einführt und das Wesen der statistischen Inferenz, des maschinellen Lernens und der Informationstheorie durch geometrische Intuition entschlüsselt. Diese Theorie, die von Dr. Shun-ichi Amari und anderen systematisiert wurde, wird heute in einem breiten Spektrum von Bereichen angewendet, wie der natürlichen Gradientenmethode (Natural Gradient Descent), die die Grundlage von KI und Deep Learning bildet, sowie der Quanteninformationstheorie und der statistischen Physik. Sie etabliert sich zunehmend als “gemeinsame Sprache” in der modernen Wissenschaft.

In diesem Artikel werden wir die tiefe Welt dieser Informationsgeometrie so detailliert und systematisch wie möglich erklären, unter Einbeziehung von mathematischer Strenge, geometrischer Intuition und konkreten Berechnungsbeispielen. Wir gehen über die bloße Aneinanderreihung mathematischer Formeln hinaus und beginnen mit fundamentalen Fragen wie “Warum ist der Raum der Wahrscheinlichkeitsverteilungen gekrümmt?” und “Warum wird die Fisher-Informationsmatrix zum metrischen Tensor?”. Von dualen Zusammenhängen und der Geometrie der Entropie bis hin zu den neuesten Anwendungen in maschinellem Lernen und Neurowissenschaften zeichnen wir das Gesamtbild der Informationsgeometrie.


Kapitel 1: Die Morgendämmerung der Informationsgeometrie und die Intuition von Shun-ichi Amari

Von der Statistik im euklidischen Raum zum gekrümmten Raum der Wahrscheinlichkeitsverteilungen

In der klassischen Statistik und Datenanalyse haben wir Daten unbewusst als Punkte im euklidischen Raum behandelt. Wenn wir beispielsweise ein statistisches Modell mit dem Parameter $\theta = (\theta_1, \theta_2, \dots, \theta_n)$ betrachten, wird der Parameterraum häufig als flacher Raum betrachtet, und der Abstand zwischen Parametern wird mit dem üblichen euklidischen Abstand gemessen. Auch die Methode der kleinsten Quadrate, die den quadratischen Fehler minimiert, basiert auf dieser euklidisch-geometrischen Intuition.

Aber ist der Raum, der Wahrscheinlichkeitsverteilungen parametrisiert, wirklich “flach”?

Nehmen wir die Normalverteilung $N(\mu, \sigma^2)$ als Beispiel. Der Parameterraum ist die obere Halbebene $\{(\mu, \sigma^2) \in \mathbb{R} \times \mathbb{R}_{>0}\}$, bestehend aus dem Mittelwert $\mu$ und der Varianz $\sigma^2 > 0$. Betrachten wir hier zwei Paare von Normalverteilungen:

  1. $N(0, 1)$ und $N(0.1, 1)$
  2. $N(0, 100)$ und $N(0.1, 100)$

Betrachtet man den euklidischen Abstand der Parameter, so ist der Abstand für beide Paare gleich $0.1$. Doch wie sieht es aus der Perspektive der “Unterscheidbarkeit” als Wahrscheinlichkeitsverteilung oder des “Informationsunterschieds” aus? Wenn die Varianz mit $1$ klein ist, ändert sich die Form der Verteilung durch eine bloße Verschiebung des Mittelwerts um $0.1$ signifikant, und es ist relativ einfach, die beiden anhand von Daten zu unterscheiden. Wenn die Varianz hingegen mit $100$ extrem groß ist, ist die Verteilung flach ausgebreitet. Selbst bei einer Verschiebung des Mittelwerts um $0.1$ überlappen sich die Verteilungen stark, und es ist äußerst schwierig, die beiden aus Daten zu unterscheiden.

Das heißt, der “eigentliche Unterschied als Verteilung” stimmt nicht mit dem euklidischen Abstand der Parameter überein. In Regionen mit großer Varianz haben kleine Änderungen des Mittelwerts kaum Auswirkungen auf die Form der Verteilung, während sie in Regionen mit kleiner Varianz drastische Veränderungen bewirken. Dies deutet stark darauf hin, dass der Parameterraum von Wahrscheinlichkeitsverteilungen nicht uniform ist, sondern ein “gekrümmter Raum (Riemannsche Mannigfaltigkeit), in dem der Maßstab für Entfernungen je nach Ort variiert”.

Warum Wahrscheinlichkeitsverteilungsfamilien Mannigfaltigkeiten sind

Die Informationsgeometrie formuliert ein statistisches Modell (eine Familie von Wahrscheinlichkeitsverteilungen) als differenzierbare Mannigfaltigkeit (Differentiable Manifold).

Sei $S$ eine Familie von Wahrscheinlichkeitsverteilungen auf einem Wahrscheinlichkeitsraum $\mathcal{X}$. Wenn diese Familie eindeutig durch $n$ kontinuierliche reelle Parameter $\theta = (\theta^1, \dots, \theta^n)$ spezifiziert wird und die Wahrscheinlichkeitsdichtefunktion $p(x; \theta)$ in Bezug auf $\theta$ glatt ist, nennen wir $S$ eine $n$-dimensionale statistische Mannigfaltigkeit (Statistical Manifold).

$$ S = \{ p(x; \theta) \mid \theta \in \Theta \subset \mathbb{R}^n \} $$

Hierbei ist $\theta$ nichts anderes als das “lokale Koordinatensystem (Local Coordinate System)” auf der Mannigfaltigkeit $S$. In der Theorie der Mannigfaltigkeiten sind Koordinatensysteme nicht essenziell, sondern nur eine von vielen möglichen Darstellungen. Bei der Normalverteilung kann man beispielsweise als Parameter $(\mu, \sigma^2)$ wählen, aber auch $(\mu, \sigma)$ oder $(\frac{\mu}{\sigma^2}, -\frac{1}{2\sigma^2})$.

Das Wesentliche der Informationsgeometrie besteht darin, die “inhärente geometrische Struktur der Wahrscheinlichkeitsverteilungsfamilie selbst, die unabhängig von der Wahl des Koordinatensystems ist”, aufzudecken. Shun-ichi Amari hat das von C.R. Rao vorgeschlagene Konzept einer “Riemannschen Mannigfaltigkeit mit der Fisher-Informationsmatrix als Metrik” weiter vertieft. Durch die Einführung des Konzepts des affinen Zusammenhangs (Affine Connection) entdeckte er in den Räumen von Wahrscheinlichkeitsverteilungen eine reichhaltige Struktur, die nicht nur “Krümmung (Curvature)”, sondern auch das “Konzept von geraden Linien (Geodäten)” und “Dualität” umfasst.


Kapitel 2: Statistische Modelle als Riemannsche Mannigfaltigkeiten

Um “Entfernung” und “Winkel” in einer Mannigfaltigkeit zu definieren, benötigt man eine Riemannsche Metrik (Riemannian Metric). Was ist die natürliche Riemannsche Metrik in einer statistischen Mannigfaltigkeit?

Score-Funktion und Fisher-Informationsmatrix

In der Statistik wird die partielle Ableitung der Log-Likelihood-Funktion $\log p(x; \theta)$ nach den Parametern als “Score-Funktion (Score Function)” bezeichnet und spielt eine wichtige Rolle.

$$ \partial_i \ell(x; \theta) = \frac{\partial}{\partial \theta^i} \log p(x; \theta) $$$$ E_\theta[\partial_i \ell(x; \theta)] = \int \frac{\partial p(x; \theta)}{\partial \theta^i} dx = \frac{\partial}{\partial \theta^i} \int p(x; \theta) dx = 0 $$$$ g_{ij}(\theta) = E_\theta \left[ \partial_i \ell(x; \theta) \partial_j \ell(x; \theta) \right] $$

C.R. Rao (1945) bemerkte, dass diese Fisher-Informationsmatrix eine positiv definite symmetrische Matrix ist, die die Transformationsregeln eines Tensors erfüllt, und schlug vor, sie als Riemannsche Metrik (Fisher-Metrik) statistischer Mannigfaltigkeiten zu verwenden.

$$ ds^2 = \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

Dadurch wird das statistische Modell zu einer Riemannschen Mannigfaltigkeit $(S, G)$. Das winzige “Quadrat des Abstands” zwischen zwei eng beieinander liegenden Wahrscheinlichkeitsverteilungen $p(x; \theta)$ und $p(x; \theta + d\theta)$ wird durch diese Fisher-Metrik gemessen.

Der Satz von Chentsov als invariante Metrik

Warum sollte man die Fisher-Informationsmatrix als Metrik wählen? Das ist keine bloße Idee, sondern dahinter steckt eine tiefe mathematische Notwendigkeit.

N.N. Chentsov (1972) formulierte die “Invarianz (Invariance)”, die im Rahmen statistischer Inferenzen erforderlich ist. Statistische Inferenz sollte sich nicht durch die Darstellung von Daten oder die Transformation in erschöpfende Statistiken (Markov-Abbildung) ändern. Der Satz von Chentsov zeigte die erstaunliche Tatsache, dass “in der Mannigfaltigkeit von Wahrscheinlichkeitsverteilungen über einer endlichen Menge die Riemannsche Metrik, die die Monotonie (Kontraktionsfähigkeit) unter Markov-Abbildungen erfüllt, bis auf eine multiplikative Konstante auf die Fisher-Informationsmetrik beschränkt ist”.

Das heißt, im Raum der Wahrscheinlichkeitsverteilungen ist die Fisher-Metrik die einzige Methode zur Messung von Entfernungen, die der natürlichen statistischen Anforderung genügt, dass “Informationen nicht abnehmen”. Dies beweist, dass die Fisher-Metrik eine inhärente und notwendige geometrische Struktur ist, die für die Statistik spezifisch ist.

Konkretes Berechnungsbeispiel der Fisher-Metrik in der Familie der Normalverteilungen

$$ p(x; \mu, \sigma) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right) $$$$ \log p = -\log(\sqrt{2\pi}) - \log\sigma - \frac{(x-\mu)^2}{2\sigma^2} $$$$ \partial_\mu \log p = \frac{x-\mu}{\sigma^2}, \quad \partial_\sigma \log p = -\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3} $$$$ g_{\mu\mu} = E\left[ \left(\frac{x-\mu}{\sigma^2}\right)^2 \right] = \frac{1}{\sigma^2} $$$$ g_{\sigma\sigma} = E\left[ \left(-\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3}\right)^2 \right] = \frac{2}{\sigma^2} $$$$ g_{\mu\sigma} = g_{\sigma\mu} = 0 $$$$ ds^2 = \frac{1}{\sigma^2} d\mu^2 + \frac{2}{\sigma^2} d\sigma^2 $$

Dies stimmt (bis auf eine multiplikative Konstante) perfekt mit der Metrik der Poincaré-Halbebene überein, die ein Modell der hyperbolischen Geometrie (einer Art nicht-euklidischer Geometrie) ist, das von Henri Poincaré vorgeschlagen wurde. Das bedeutet, dass der Raum von Normalverteilungen ein hyperbolischer Raum mit negativer konstanter Krümmung ist. Wie unsere frühere Intuition nahelegte, zeigen auch die Formeln, dass in Regionen mit großem $\sigma$ (großer Varianz) der metrische Tensor $1/\sigma^2$ klein wird, was Parameteränderungen als geringen “Abstand” bewertet.


Kapitel 3: Duale Zusammenhänge und die Tiefe von $\alpha$-Zusammenhängen

Mit der Riemannschen Metrik allein lässt sich die “Krümmung” des Raumes nicht vollständig beschreiben. Ein affiner Zusammenhang (Affine Connection), der festlegt, “welche Richtung gerade ist”, wird benötigt. Der größte Verdienst von Shun-ichi Amari besteht darin, entdeckt zu haben, dass auf statistischen Mannigfaltigkeiten unendlich viele natürliche Zusammenhänge existieren und dass diese eine wunderschöne Struktur namens “Dualität (Duality)” bilden.

Definition von $\alpha$-Zusammenhängen

Amari führte eine Familie von affinen Zusammenhängen ein, die als $\alpha$-Zusammenhänge bezeichnet werden, wobei ein reeller Parameter $\alpha$ verwendet wird. Die Zusammenhangskoeffizienten $\Gamma_{ij,k}^{(\alpha)}$ sind wie folgt definiert:

$$ \Gamma_{ij,k}^{(\alpha)} = E \left[ \left( \partial_i \partial_j \ell + \frac{1 - \alpha}{2} \partial_i \ell \partial_j \ell \right) \partial_k \ell \right] $$

Der $0$-Zusammenhang für $\alpha = 0$ stimmt mit dem Levi-Civita-Zusammenhang (Levi-Civita Connection) überein, der durch die Fisher-Metrik eindeutig bestimmt ist. Dies ist der Zusammenhang, der normalerweise in der Riemannschen Geometrie verwendet wird. In der Informationsgeometrie spielen jedoch die Zusammenhänge mit $\alpha = 1$ und $\alpha = -1$ die wichtigste Rolle.

e-Zusammenhang und m-Zusammenhang, und dual-flache Räume

  • e-Zusammenhang ($\alpha = 1$ Exponentialer Zusammenhang): Dieser Zusammenhang tritt natürlicherweise bei der Behandlung exponentieller Verteilungsfamilien (Exponential Family) auf.
  • m-Zusammenhang ($\alpha = -1$ Mischungszusammenhang): Dieser Zusammenhang tritt natürlicherweise bei der Behandlung von Mischverteilungsfamilien (Mixture Family) auf.

Diese beiden Zusammenhänge stehen in Bezug auf die Fisher-Metrik $g_{ij}$ in einer “dualen (Dual)” Beziehung zueinander. Wenn auf einer Riemannschen Mannigfaltigkeit die Ableitung des inneren Produkts (der Metrik) zweier Vektorfelder als Summe der kovarianten Ableitungen beider Zusammenhänge ausgedrückt wird, bezeichnet man sie als duale Zusammenhänge.

$$ X \langle Y, Z \rangle = \langle \nabla_X^{(e)} Y, Z \rangle + \langle Y, \nabla_X^{(m)} Z \rangle $$

Besonders bemerkenswert ist die Tatsache, dass der Raum der exponentiellen Verteilungsfamilien (z. B. Normalverteilung, Poissonverteilung, Gammaverteilung) in Bezug auf den e-Zusammenhang “flach (Krümmungstensor ist null)” ist und gleichzeitig in Bezug auf den m-Zusammenhang “flach” ist. Ein solcher Raum wird als dual-flacher Raum (Dually Flat Space) bezeichnet.

In einem dual-flachen Raum gibt es gerade Linien im Sinne des e-Zusammenhangs (e-Geodäten) und gerade Linien im Sinne des m-Zusammenhangs (m-Geodäten). Darüber hinaus existieren in diesen Räumen duale Koordinatensysteme (natürlicher Parameter $\theta$ und Erwartungswert-Parameter $\eta$), die durch eine Legendre-Transformation miteinander verbunden sind.

Der generalisierte Satz des Pythagoras

Die Schönheit dual-flacher Räume gipfelt im “Generalisierten Satz des Pythagoras (Generalized Pythagorean Theorem)”.

Im euklidischen Raum gilt, wenn drei Punkte $P, Q, R$ ein rechtwinkliges Dreieck mit $\angle PQR = 90^\circ$ bilden, die Gleichung $d(P, R)^2 = d(P, Q)^2 + d(Q, R)^2$. In einem dual-flachen Raum der Informationsgeometrie gilt eine exakte Entsprechung in Bezug auf die Divergenz (asymmetrisches Abstandskonzept zwischen Verteilungen), wenn die Kurve, die die Punkte $P, Q, R$ (Wahrscheinlichkeitsverteilungen) verbindet, aus einer e-Geodäten und einer m-Geodäten besteht und diese sich im Punkt $Q$ im Sinne der Fisher-Metrik “orthogonal” schneiden:

$$ D(P \parallel R) = D(P \parallel Q) + D(Q \parallel R) $$

Dieses Theorem erklärt geometrisch vollständig Informationskriterien in der Statistik sowie die Konvergenz des EM-Algorithmus und den Projektionssatz (Information Projection) beim maschinellen Lernen. Es ist ein monumentales Ergebnis der Informationsgeometrie.


Kapitel 4: Divergenz und die Geometrie der Entropie

Die Entfernung in der Riemannschen Geometrie ist symmetrisch ($d(x, y) = d(y, x)$), aber das Maß für den “Unterschied” zwischen Wahrscheinlichkeitsverteilungen in der Informationstheorie ist im Allgemeinen asymmetrisch. Die Informationsgeometrie verbindet dieses asymmetrische Abstandsmaß “Divergenz (Divergence)” wunderbar mit der geometrischen Struktur dual-flacher Räume.

Kullback-Leibler-Divergenz

$$ D_{KL}(P \parallel Q) = \int p(x) \log \frac{p(x)}{q(x)} dx $$

Die KL-Divergenz erfüllt nicht die Axiome einer Metrik (sie ist asymmetrisch und erfüllt die Dreiecksungleichung nicht). Im Limes, in dem der Punkt $Q$ dem Punkt $P$ unendlich nahe kommt, stimmt jedoch der quadratische Term der Taylor-Entwicklung der KL-Divergenz exakt mit der Fisher-Informationsmatrix überein.

$$ D_{KL}(\theta \parallel \theta + d\theta) \approx \frac{1}{2} \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

Das heißt, die KL-Divergenz ist ein makroskopischer asymmetrischer Abstand, und ihr mikroskopischer Limes (infinitesimaler Abstand) induziert die Fisher-Metrik (Riemannsche Geometrie).

Bregman-Divergenz und Legendre-Transformation

In dual-flachen Räumen wird Divergenz allgemeiner als “Bregman-Divergenz (Bregman Divergence)” formuliert. Betrachten wir eine konvexe Funktion $\psi(\theta)$ (entsprechend der kumulanten erzeugenden Funktion oder freien Energie). Die Bregman-Divergenz $D_\psi(\theta_P \parallel \theta_Q)$ ist definiert als der “Fehler” zwischen der Tangentialebene der konvexen Funktion im Punkt $\theta_Q$ und dem Wert der konvexen Funktion im Punkt $\theta_P$.

$$ D_\psi(\theta_P \parallel \theta_Q) = \psi(\theta_P) - \psi(\theta_Q) - \sum_i (\theta_P^i - \theta_Q^i) \frac{\partial \psi(\theta_Q)}{\partial \theta^i} $$$$ \eta_i = \frac{\partial \psi(\theta)}{\partial \theta^i}, \quad \phi(\eta) = \sum_i \theta^i \eta_i - \psi(\theta) $$

In der Informationsgeometrie ist die KL-Divergenz auf exponentiellen Verteilungsfamilien genau die Bregman-Divergenz, und durch die Verwendung der dualen Parameter $\theta$ (natürlicher Parameter) und $\eta$ (Erwartungswert-Parameter) lässt sich die Divergenz mithilfe der dualen Funktionen $\psi, \phi$ in einer äußerst symmetrischen und schönen kanonischen Form (Canonical form) ausdrücken.

$$ D(P \parallel Q) = \psi(\theta_P) + \phi(\eta_Q) - \sum_i \theta_P^i \eta_Q^i $$

Diese Formel verdeutlicht, dass Informationsgeometrie nicht nur eine Anwendung der Differentialgeometrie ist, sondern eine tief mit der Legendre-Transformation und der konvexen Analysis verbundene “informationstheorieeigene Geometrie”.


Kapitel 5: Deep Learning und die natürliche Gradientenmethode

Informationsgeometrie ist nicht nur theoretisch elegant, sondern entfaltet in der modernen KI, insbesondere im Deep Learning, eine äußerst praktische Wirksamkeit. Das beste Beispiel dafür ist die “Natürliche Gradientenmethode (Natural Gradient Descent; NGD)”.

Grenzen des herkömmlichen Gradientenabstiegs

$$ w_{t+1} = w_t - \eta \nabla L(w_t) $$

Der übliche Gradient $\nabla L$ setzt jedoch voraus, dass der Parameterraum ein “flacher euklidischer Raum” ist. Wie in Kapitel 1 dargelegt, ist der Parameterraum von Wahrscheinlichkeitsmodellen, die durch neuronale Netze repräsentiert werden, jedoch eine durch die Fisher-Metrik gekrümmte Riemannsche Mannigfaltigkeit. Der Gradient (die Richtung des steilsten Abstiegs) im euklidischen Raum stimmt nicht mit der wahren Richtung des steilsten Abstiegs auf der Riemannschen Mannigfaltigkeit überein. Aus diesem Grund ändert sich die Trainingsbahn je nach Skalierung oder Koordinatentransformation der Parameter erheblich, und das Phänomen von “Plateaus” (Trainingsstagnation), die die Optimierungseffizienz drastisch verringern, tritt häufig auf.

Parameteraktualisierung durch Fisher-Metrik: Die natürliche Gradientenmethode

1998 schlug Shun-ichi Amari den “natürlichen Gradienten (Natural Gradient)” vor, der die wahre Richtung des steilsten Abstiegs auf einer Riemannschen Mannigfaltigkeit darstellt. Der Gradient $\tilde{\nabla} L$ auf der Mannigfaltigkeit entspricht dem üblichen Gradienten $\nabla L$ multipliziert mit der Inversen $F^{-1}$ der Fisher-Informationsmatrix.

$$ \tilde{\nabla} L(w) = F(w)^{-1} \nabla L(w) $$$$ w_{t+1} = w_t - \eta F(w_t)^{-1} \nabla L(w_t) $$

Die natürliche Gradientenmethode berücksichtigt die Krümmung (Fisher-Informationsmatrix) des Parameterraums und ermöglicht so ein invarianteres Lernen, das nicht von der Wahl der Parameter (Koordinatensystem) abhängt. Dadurch kann man, selbst wenn die Höhenlinien der Verlustfunktion wie ein verzogenes Tal geformt sind, geradlinig auf die optimale Lösung zusteuern, was die Lerngeschwindigkeit dramatisch verbessert. Obwohl es den Optimierungsmethoden zweiter Ordnung (wie der Newton-Methode) ähnelt, kann es als ein auf Wahrscheinlichkeitsmodelle optimiertes Verfahren betrachtet werden, da es anstelle der Hesse-Matrix die Fisher-Informationsmatrix verwendet, deren positive Semidefinitheit garantiert ist.

Implementierung von Näherungsberechnungen mit K-FAC und Durchbruch

Die natürliche Gradientenmethode ist theoretisch leistungsstark, stand jedoch vor großen Hürden bei der Anwendung im Deep Learning. Bei modernen neuronalen Netzen mit zig Millionen bis Milliarden von Parametern war es aus rechentechnischer Sicht hoffnungslos ($O(N^3)$), die gigantische Fisher-Informationsmatrix $F$ (Größe $N \times N$) zu berechnen und zu invertieren.

Dieses Problem wurde durch eine Methode namens K-FAC (Kronecker-factored Approximate Curvature) gelöst, die 2015 von James Martens, Roger Grosse und anderen vorgeschlagen wurde. Sie zeigten, dass die Fisher-Informationsmatrix von Parametern zwischen Schichten eines neuronalen Netzes sehr genau durch das “Kronecker-Produkt (Kronecker Product)” der Kovarianzmatrix der Eingänge und der Kovarianzmatrix der Gradienten der Ausgänge approximiert werden kann.

$$ F_{layer} \approx A \otimes S $$

(wobei $A$ die Kovarianz der Aktivierungen und $S$ die Kovarianz der Gradienten vor der Aktivierung ist)

Durch die Nutzung der Eigenschaft des Kronecker-Produkts $(A \otimes S)^{-1} = A^{-1} \otimes S^{-1}$ konnte die inverse Berechnung riesiger Matrizen in inverse Berechnungen viel kleinerer Matrizen zerlegt und der Rechenaufwand drastisch reduziert werden (von $O(N^3)$ auf $O(n^3)$, wobei $n$ die Breite der Schicht ist). Durch die Implementierung von K-FAC wurde die natürliche Gradientenmethode für groß angelegte Deep-Learning-Modelle (wie ResNet und Transformer) in realistischer Rechenzeit anwendbar, und es wurde nachgewiesen, dass sie in verteilten Lernumgebungen eine extrem schnelle Konvergenz aufweist. Dies war ein historischer Moment, in dem die Informationsgeometrie die Grenzen der KI durchbrach.


Kapitel 6: Ausweitung auf statistische Physik, Quanteninformation und Neurowissenschaften

Die Vielseitigkeit der Informationsgeometrie beschränkt sich nicht auf Statistik und maschinelles Lernen. Die zugrunde liegende “Geometrie von Wahrscheinlichkeit und Information” hat Auswirkungen auf viele wissenschaftliche Disziplinen.

Quanteninformationsgeometrie

Die Informationsgeometrie, die mit klassischen Wahrscheinlichkeitsverteilungen befasst ist, wird natürlicherweise zur Quanteninformationsgeometrie (Quantum Information Geometry) erweitert, die sich mit der “Dichtematrix (Density Matrix)” in der Quantenmechanik befasst. In Quantensystemen ist das Äquivalent der Fisher-Metrik aufgrund der Nichtkommutativität der Observablen (die Tatsache, dass Operatoren je nach Reihenfolge unterschiedliche Ergebnisse liefern) nicht eindeutig definiert. Stattdessen gibt es mehrere Riemannsche Metriken, wie die Bures-Metrik (SLD-Fisher-Information) und die Kubo-Mori-Bogoliubov-Metrik, von denen jede unterschiedliche physikalische und informationstheoretische Bedeutungen hat. Die Quanteninformationsgeometrie entwickelt sich schnell zu einer theoretischen Grundlage für Quantencomputer und Quantenkommunikation, einschließlich der Grenzen für die Präzision der Quantenzustandsschätzung (Quanten-Cramér-Rao-Ungleichung), der geometrischen Aufklärung der Quantenverschränkung (Entanglement) und der Optimierung von Quantenalgorithmen.

Prinzip der freien Energie und Neurowissenschaften (Predictive Coding)

Auf dem Gebiet der Neurowissenschaften postuliert das von Karl Friston vorgeschlagene Prinzip der freien Energie (Free Energy Principle; FEP), dass das Gehirn ein System ist, das auf Wahrnehmung und Handlung schließt, um “Überraschung (Surprise)” zu minimieren. Dieser Inferenzprozess ist als Variationelle Bayes-Inferenz (Variational Bayesian Inference) formuliert, bei der er auf ein Optimierungsproblem hinausläuft, das die KL-Divergenz (variationelle freie Energie) zwischen der Wahrscheinlichkeitsverteilung des internen Modells im Gehirn und der wahren Verteilung der äußeren Umgebung minimiert.

Aus der Perspektive der Informationsgeometrie kann das Gehirn als dynamisches System interpretiert werden, das sich auf einer Mannigfaltigkeit von Wahrscheinlichkeitsverteilungen entsprechend dem Gradienten der Divergenz (d.h. dem natürlichen Gradienten) bewegt. Wahrnehmung (Aktualisierung des inneren Zustands) und Handlung (Einwirkung auf die äußere Umgebung) werden auf elegante Weise als iterativer Algorithmus von e-Projektionen und m-Projektionen in einem dual-flachen Raum beschrieben. Die Informationsgeometrie liefert die mathematische Sprache, um die grundlegenden Mechanismen der Intelligenz zu entschlüsseln.

Als Grenze der modernen Mathematik

Auch aus der Perspektive der reinen Mathematik hat die Informationsgeometrie ein neues Paradigma eingeführt. Die tiefen Verbindungen zur affinen Differentialgeometrie, Hesse-Geometrie und symplektischen Geometrie werden zunehmend verstanden. Insbesondere die Integration der Wasserstein-Geometrie (Theorie des optimalen Transports) und der Informationsgeometrie ist derzeit eines der heißesten Forschungsthemen in der Mathematik und im maschinellen Lernen. Während die KL-Divergenz (Informationsgeometrie) die Bewegung von “Information” misst, misst die Wasserstein-Distanz die Bewegung von “Masse”. Versuche, diese beiden Geometrien zu verschmelzen, führen direkt zur theoretischen Klärung tiefer generativer Modelle (Diffusionsmodelle und GANs).


Fazit: Die Form des Universums, gewebt aus Informationen

Die Informationsgeometrie, die aus Shun-ichi Amaris Intuition geboren wurde, dass “statistische Modelle gekrümmt sein könnten”, ist über die Grenzen der Statistik hinausgewachsen und zu einem großartigen theoretischen System geworden, das maschinelles Lernen, Quantenphysik und Neurowissenschaften miteinander verbindet. Indem wir Wahrscheinlichkeitsverteilungen nicht nur als Funktionen, sondern als geometrische “Räume” begreifen, können wir die Bewegung von Informationen, die Trajektorie des Lernens und das Wesen der Intelligenz visuell verstehen.

Die von der Fisher-Informationsmetrik gelehrte “Krümmung von Informationen”. Der “Generalisierte Satz des Pythagoras”, geleitet von dualen Zusammenhängen. Und die “schnelle Evolution der KI”, die durch die natürliche Gradientenmethode eröffnet wurde.

Die Informationsgeometrie wird weiterhin unser ausgefeiltester “Kompass” sein, um Konstellationen, die “Wahrheit” genannt werden, unter Sternen, die “Daten” genannt werden, zu finden. Die Erforschung dieser wunderschönen und doch tiefgründigen Riemannschen Mannigfaltigkeit hat gerade erst begonnen.

comments powered by Disqus