Featured image of post O Mistério da Geometria da Informação: O Espaço Riemanniano Tecido por Distribuições de Probabilidade e o Futuro da Estatística e da IA

O Mistério da Geometria da Informação: O Espaço Riemanniano Tecido por Distribuições de Probabilidade e o Futuro da Estatística e da IA

A teoria global fundada por Shun'ichi Amari. A métrica de informação de Fisher que geometriza o espaço das distribuições de probabilidade, o método do gradiente natural e a ponte para o aprendizado de máquina.

A Geometria da Informação (Information Geometry) é uma teoria de alcance mundial originada no Japão que introduz a estrutura da geometria diferencial no espaço das distribuições de probabilidade, desvendando a essência da inferência estatística, aprendizado de máquina e teoria da informação sob uma intuição geométrica. Sistematizada pelo Dr. Shun’ichi Amari e outros, esta teoria fundamenta hoje algoritmos centrais da IA e do aprendizado profundo, como o método do gradiente natural (Natural Gradient Descent), sendo aplicada em campos tão diversos quanto a teoria da informação quântica e a física estatística, estabelecendo-se como uma “linguagem comum” na ciência moderna.

Neste artigo, explicaremos o mundo profundo da geometria da informação da forma mais detalhada e sistemática possível, combinando rigor matemático, intuição geométrica e exemplos concretos de cálculo. Indo além de uma mera sequência de fórmulas, começaremos com as questões fundamentais: “por que o espaço das distribuições de probabilidade é curvo?” e “por que a matriz de informação de Fisher se torna um tensor métrico?”, delineando o quadro completo da geometria da informação, passando pelas conexões duais, a geometria da entropia e culminando em suas aplicações de ponta no aprendizado de máquina e na neurociência.


Capítulo 1: O Alvorecer da Geometria da Informação e a Intuição de Shun’ichi Amari

Da Estatística no Espaço Euclidiano ao Espaço Curvo das Distribuições de Probabilidade

Na estatística clássica e na análise de dados, frequentemente tratamos, de forma inconsciente, os dados como pontos em um espaço euclidiano. Por exemplo, ao considerar um modelo estatístico com parâmetros $\theta = (\theta_1, \theta_2, \dots, \theta_n)$, é comum ver o espaço de parâmetros como um espaço plano e medir a distância entre os parâmetros usando a distância euclidiana comum. O método dos mínimos quadrados, que minimiza o erro quadrático, também se baseia nessa intuição da geometria euclidiana.

No entanto, o espaço que parametriza as distribuições de probabilidade é realmente “plano”?

Tomemos como exemplo a distribuição normal $N(\mu, \sigma^2)$. O espaço de parâmetros é o semiplano superior $\{(\mu, \sigma^2) \in \mathbb{R} \times \mathbb{R}_{>0}\}$ constituído pela média $\mu$ e pela variância $\sigma^2 > 0$. Aqui, consideremos dois pares de distribuições normais:

  1. $N(0, 1)$ e $N(0.1, 1)$
  2. $N(0, 100)$ e $N(0.1, 100)$

Se olharmos para a distância euclidiana dos parâmetros, ambos os pares têm a mesma distância de $0.1$. Mas, e do ponto de vista da “distinguibilidade” como distribuições de probabilidade e da “diferença de informação”? Quando a variância é pequena, igual a $1$, um desvio de apenas $0.1$ na média altera significativamente a forma da distribuição, tornando relativamente fácil distinguir ambas a partir dos dados. Por outro lado, quando a variância é extremamente grande, igual a $100$, a distribuição é muito achatada e espalhada; um desvio de $0.1$ na média resulta em uma enorme sobreposição das distribuições, tornando quase impossível distingui-las a partir dos dados.

Ou seja, a “diferença intrínseca como distribuições” não coincide com a distância euclidiana dos parâmetros. Em regiões onde a variância é grande, pequenas mudanças na média quase não afetam a forma da distribuição, enquanto em regiões onde a variância é pequena, elas trazem mudanças dramáticas. Isso sugere fortemente que o espaço de parâmetros das distribuições de probabilidade não é uniforme, mas um “espaço curvo (variedade riemanniana) onde a escala de distância varia dependendo do local”.

Por Que as Famílias de Distribuições de Probabilidade São Variedades?

A geometria da informação formula os modelos estatísticos (famílias de distribuições de probabilidade) como variedades diferenciáveis (Differentiable Manifolds).

Seja $S$ uma família de distribuições de probabilidade sobre um espaço de probabilidade $\mathcal{X}$. Quando esta família é especificada de forma única por $n$ parâmetros reais contínuos $\theta = (\theta^1, \dots, \theta^n)$ e a função de densidade de probabilidade $p(x; \theta)$ é suave em relação a $\theta$, chamamos $S$ de uma variedade estatística (Statistical Manifold) de $n$ dimensões.

$$ S = \{ p(x; \theta) \mid \theta \in \Theta \subset \mathbb{R}^n \} $$

Aqui, $\theta$ nada mais é do que um “sistema de coordenadas locais” (Local Coordinate System) na variedade $S$. Na teoria das variedades, o sistema de coordenadas não é essencial, sendo apenas uma de suas representações. Por exemplo, no caso da distribuição normal, podemos escolher $(\mu, \sigma^2)$ como parâmetros, assim como podemos escolher $(\mu, \sigma)$ ou $(\frac{\mu}{\sigma^2}, -\frac{1}{2\sigma^2})$.

A verdadeira essência da geometria da informação reside em revelar a “estrutura geométrica intrínseca da própria família de distribuições de probabilidade, independente da escolha do sistema de coordenadas”. Shun’ichi Amari aprofundou o conceito de “variedade riemanniana com a matriz de informação de Fisher como métrica” proposto por C.R. Rao e introduziu o conceito de conexão afim (Affine Connection), descobrindo no espaço das distribuições de probabilidade não apenas um “grau de curvatura” (curvatura), mas também uma rica estrutura que abrange “o conceito de retas (geodésicas)” e “dualidade”.


Capítulo 2: O Modelo Estatístico como uma Variedade Riemanniana

Para definir “distância” e “ângulo” em uma variedade, é necessária uma métrica riemanniana (Riemannian Metric). Qual seria a métrica riemanniana natural em uma variedade estatística?

Função Escore e a Matriz de Informação de Fisher

Na estatística, a derivada parcial em relação aos parâmetros da função de log-verossimilhança $\log p(x; \theta)$ é chamada de “função escore” (Score Function) e desempenha um papel importante.

$$ \partial_i \ell(x; \theta) = \frac{\partial}{\partial \theta^i} \log p(x; \theta) $$$$ E_\theta[\partial_i \ell(x; \theta)] = \int \frac{\partial p(x; \theta)}{\partial \theta^i} dx = \frac{\partial}{\partial \theta^i} \int p(x; \theta) dx = 0 $$$$ g_{ij}(\theta) = E_\theta \left[ \partial_i \ell(x; \theta) \partial_j \ell(x; \theta) \right] $$

C.R. Rao (1945) notou que esta matriz de informação de Fisher é uma matriz simétrica definida positiva que satisfaz a lei de transformação de tensores e propôs adotá-la como a métrica riemanniana (métrica de Fisher) da variedade estatística.

$$ ds^2 = \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

Com isso, o modelo estatístico se torna uma variedade riemanniana $(S, G)$. O diminuto “quadrado da distância” entre duas distribuições de probabilidade muito próximas $p(x; \theta)$ e $p(x; \theta + d\theta)$ é medido por essa métrica de Fisher.

Teorema de Chentsov como uma Métrica Invariante

Por que deveríamos escolher a matriz de informação de Fisher como métrica? Não se trata de uma mera intuição aleatória, mas de uma profunda necessidade matemática.

N.N. Chentsov (1972) formulou a “invariância” (Invariance) exigida no contexto da inferência estatística. A inferência estatística não deve alterar seus resultados devido à forma como os dados são representados ou a transformações para estatísticas suficientes (mapeamentos de Markov). O teorema de Chentsov mostrou o fato surpreendente de que “na variedade constituída por distribuições de probabilidade sobre um conjunto finito, a métrica riemanniana que satisfaz a monotonicidade (contratividade) sob mapeamentos de Markov restringe-se, a menos de uma constante multiplicativa, à métrica de informação de Fisher”.

Ou seja, no espaço das distribuições de probabilidade, a única forma de medir distâncias que atende à exigência estatística natural de que “a informação não diminui” é a métrica de Fisher. Isso prova que a métrica de Fisher é uma estrutura geométrica intrínseca e inevitável, peculiar à estatística.

Exemplo Concreto de Cálculo da Métrica de Fisher na Família de Distribuições Normais

$$ p(x; \mu, \sigma) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right) $$$$ \log p = -\log(\sqrt{2\pi}) - \log\sigma - \frac{(x-\mu)^2}{2\sigma^2} $$$$ \partial_\mu \log p = \frac{x-\mu}{\sigma^2}, \quad \partial_\sigma \log p = -\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3} $$$$ g_{\mu\mu} = E\left[ \left(\frac{x-\mu}{\sigma^2}\right)^2 \right] = \frac{1}{\sigma^2} $$$$ g_{\sigma\sigma} = E\left[ \left(-\frac{1}{\sigma} + \frac{(x-\mu)^2}{\sigma^3}\right)^2 \right] = \frac{2}{\sigma^2} $$$$ g_{\mu\sigma} = g_{\sigma\mu} = 0 $$$$ ds^2 = \frac{1}{\sigma^2} d\mu^2 + \frac{2}{\sigma^2} d\sigma^2 $$

Isso coincide perfeitamente (a menos de uma constante multiplicativa) com a métrica do semiplano superior de Poincaré, que é um modelo de geometria hiperbólica (um tipo de geometria não euclidiana) proposto por Henri Poincaré. Ou seja, entendemos que o espaço das distribuições normais é um espaço hiperbólico com curvatura constante negativa. Como intuído anteriormente, nas regiões onde $\sigma$ é grande (variância grande), o tensor métrico $1/\sigma^2$ torna-se pequeno, o que corrobora matematicamente o fato de que variações nos parâmetros são avaliadas como “distâncias” menores.


Capítulo 3: As Profundezas das Conexões Duais e da $\alpha$-conexão

A métrica riemanniana, por si só, não pode descrever completamente a “curvatura” do espaço. É necessária uma conexão afim (Affine Connection) que defina “qual direção é reta”. A maior contribuição de Shun’ichi Amari foi descobrir que nas variedades estatísticas existem infinitas conexões naturais, e que elas formam uma bela estrutura de “dualidade” (Duality).

Definição da $\alpha$-conexão

Amari introduziu uma família de conexões afins chamada $\alpha$-conexão, utilizando o parâmetro real $\alpha$. Seus coeficientes de conexão $\Gamma_{ij,k}^{(\alpha)}$ são definidos da seguinte forma:

$$ \Gamma_{ij,k}^{(\alpha)} = E \left[ \left( \partial_i \partial_j \ell + \frac{1 - \alpha}{2} \partial_i \ell \partial_j \ell \right) \partial_k \ell \right] $$

A $0$-conexão, quando $\alpha = 0$, coincide exatamente com a conexão de Levi-Civita (Levi-Civita Connection) unicamente determinada a partir da métrica de Fisher. Esta é a conexão usada na geometria riemanniana comum. No entanto, na geometria da informação, os papéis mais importantes são desempenhados pelas conexões onde $\alpha = 1$ e $\alpha = -1$.

e-conexão, m-conexão e Espaços Planos Duais

  • e-conexão ($\alpha = 1$, conexão exponencial): É a conexão que surge naturalmente ao lidar com famílias de distribuições exponenciais (Exponential Family).
  • m-conexão ($\alpha = -1$, conexão de mistura): É a conexão que surge naturalmente ao lidar com famílias de distribuições de mistura (Mixture Family).

Essas duas conexões estão em uma relação de “duais” (Dual) com respeito à métrica de Fisher $g_{ij}$. Em uma variedade riemanniana, quando a derivada do produto interno (métrica) de dois campos vetoriais pode ser expressa como a soma de suas derivadas covariantes sob as respectivas conexões, elas são chamadas de conexões duais.

$$ X \langle Y, Z \rangle = \langle \nabla_X^{(e)} Y, Z \rangle + \langle Y, \nabla_X^{(m)} Z \rangle $$

O que é digno de nota é o fato de que o espaço das famílias de distribuições exponenciais (como a distribuição normal, a distribuição de Poisson, a distribuição gama, etc.) é “plano (tensor de curvatura é zero)” em relação à e-conexão, e ao mesmo tempo é “plano” em relação à m-conexão. Esse espaço é chamado de espaço plano dual (Dually Flat Space).

Em um espaço plano dual, existem retas em relação à e-conexão (e-geodésicas) e retas em relação à m-conexão (m-geodésicas). Além disso, nestes espaços, existem sistemas de coordenadas duais (o parâmetro natural $\theta$ e o parâmetro de expectativa $\eta$) que estão conectados entre si por meio da transformada de Legendre (Legendre Transformation).

O Teorema de Pitágoras Generalizado

A beleza dos espaços planos duais está resumida no “Teorema de Pitágoras Generalizado” (Generalized Pythagorean Theorem).

No espaço euclidiano, quando 3 pontos $P, Q, R$ formam um triângulo retângulo com $\angle PQR = 90^\circ$, vale a relação $d(P, R)^2 = d(P, Q)^2 + d(Q, R)^2$. No espaço plano dual da geometria da informação, quando uma curva que conecta os pontos $P, Q, R$ (distribuições de probabilidade) é composta por uma e-geodésica e uma m-geodésica que se cruzam “ortogonalmente” no sentido da métrica de Fisher no ponto $Q$, a seguinte equação é rigorosamente verdadeira em relação à divergência (o conceito assimétrico de distância) entre as distribuições:

$$ D(P \parallel R) = D(P \parallel Q) + D(Q \parallel R) $$

Este teorema fornece uma explicação geométrica completa dos critérios de informação na estatística, da convergência do algoritmo EM no aprendizado de máquina e do teorema da projeção (Information Projection). É um resultado considerado o pináculo da geometria da informação.


Capítulo 4: Divergência e a Geometria da Entropia

A distância na geometria riemanniana é simétrica ($d(x, y) = d(y, x)$), mas na teoria da informação, as métricas para a “diferença” entre as distribuições de probabilidade são geralmente assimétricas. A geometria da informação liga brilhantemente esta distância assimétrica, chamada de “divergência” (Divergence), à estrutura geométrica dos espaços planos duais.

Informação de Kullback-Leibler (Divergência KL)

$$ D_{KL}(P \parallel Q) = \int p(x) \log \frac{p(x)}{q(x)} dx $$

A divergência KL não satisfaz os axiomas de distância (é assimétrica e não satisfaz a desigualdade triangular). Contudo, no limite onde o ponto $Q$ se aproxima infinitamente do ponto $P$, o termo de segunda ordem da expansão de Taylor da divergência KL coincide exatamente com a matriz de informação de Fisher.

$$ D_{KL}(\theta \parallel \theta + d\theta) \approx \frac{1}{2} \sum_{i,j} g_{ij}(\theta) d\theta^i d\theta^j $$

Ou seja, a divergência KL é uma distância macroscópica assimétrica, cujo limite microscópico (distância infinitesimal) induz a métrica de Fisher (geometria riemanniana).

Divergência de Bregman e a Transformada de Legendre

Nos espaços planos duais, a divergência é formulada como a mais geral “divergência de Bregman” (Bregman Divergence). Considere a função convexa $\psi(\theta)$ (que corresponde à função geradora de cumulantes ou à energia livre). A divergência de Bregman $D_\psi(\theta_P \parallel \theta_Q)$ é definida como o “erro” entre o valor da função convexa no ponto $\theta_P$ e o plano tangente da função convexa no ponto $\theta_Q$.

$$ D_\psi(\theta_P \parallel \theta_Q) = \psi(\theta_P) - \psi(\theta_Q) - \sum_i (\theta_P^i - \theta_Q^i) \frac{\partial \psi(\theta_Q)}{\partial \theta^i} $$$$ \eta_i = \frac{\partial \psi(\theta)}{\partial \theta^i}, \quad \phi(\eta) = \sum_i \theta^i \eta_i - \psi(\theta) $$

Na geometria da informação, a divergência KL é exatamente a divergência de Bregman nas famílias exponenciais, e ao usar os parâmetros duais $\theta$ (parâmetro natural) e $\eta$ (parâmetro de expectativa), a divergência pode ser expressa em uma forma canônica (Canonical form) muito simétrica e bonita, utilizando as funções duais $\psi$ e $\phi$.

$$ D(P \parallel Q) = \psi(\theta_P) + \phi(\eta_Q) - \sum_i \theta_P^i \eta_Q^i $$

Esta fórmula ilustra vivamente que a geometria da informação não é apenas uma aplicação da geometria diferencial, mas uma “geometria própria da teoria da informação”, profundamente conectada à transformada de Legendre e à análise convexa.


Capítulo 5: Aprendizado Profundo e o Método do Gradiente Natural

A geometria da informação vai além da sua beleza teórica e exibe um poder muito prático na IA moderna, especialmente no aprendizado profundo (Deep Learning). O maior exemplo disso é o “Método do Gradiente Natural” (Natural Gradient Descent; NGD).

Limitações do Método de Descida de Gradiente Comum

$$ w_{t+1} = w_t - \eta \nabla L(w_t) $$

Entretanto, o gradiente comum $\nabla L$ pressupõe que o espaço de parâmetros seja “um espaço plano euclidiano”. Como vimos no Capítulo 1, o espaço de parâmetros do modelo probabilístico representado por uma rede neural é uma variedade riemanniana curvada pela métrica de Fisher. O gradiente no espaço euclidiano (a direção de descida mais íngreme) não coincide com a verdadeira direção de descida mais íngreme em uma variedade riemanniana. Por isso, a escala dos parâmetros ou a mudança das coordenadas mudam grandemente a trajetória da aprendizagem, fazendo com que ocorra frequentemente o fenômeno de “platô” (estagnação da aprendizagem), reduzindo drasticamente a eficiência da otimização.

Atualização dos Parâmetros pela Métrica de Fisher: Método do Gradiente Natural

Em 1998, Shun’ichi Amari propôs o “Gradiente Natural” (Natural Gradient), a verdadeira direção de descida mais íngreme nas variedades riemannianas. O gradiente na variedade $\tilde{\nabla} L$ torna-se o gradiente comum $\nabla L$ multiplicado pela matriz inversa da matriz de informação de Fisher, $F^{-1}$.

$$ \tilde{\nabla} L(w) = F(w)^{-1} \nabla L(w) $$$$ w_{t+1} = w_t - \eta F(w_t)^{-1} \nabla L(w_t) $$

O método do gradiente natural, ao levar em conta a curvatura do espaço de parâmetros (a matriz de informação de Fisher), alcança uma aprendizagem invariante, independente da maneira como os parâmetros são escolhidos (sistema de coordenadas). Isso possibilita caminhar em linha reta em direção à solução ótima, mesmo que as linhas de contorno da função de perda tenham um relevo distorcido de vale, aumentando dramaticamente a velocidade da aprendizagem. É um método de otimização análogo a métodos de segunda ordem como o método de Newton, porém adaptado a modelos de probabilidade, visto que usa a matriz de informação de Fisher, a qual é garantidamente semidefinida positiva em vez de utilizar a matriz Hessiana.

Implementação da Aproximação por K-FAC e o Avanço

Embora teoricamente poderoso, havia uma grande barreira para a aplicação do gradiente natural no aprendizado profundo. Em redes neurais modernas, com dezenas de milhões a dezenas de bilhões de parâmetros, calcular a massiva matriz de informação de Fisher $F$ (tamanho $N \times N$) e obter a sua inversa era uma tarefa de complexidade computacional impossível ($O(N^3)$).

Esse problema foi solucionado pelo método chamado K-FAC (Kronecker-factored Approximate Curvature), proposto por James Martens e Roger Grosse em 2015. Eles demonstraram que a matriz de informação de Fisher para os parâmetros entre as camadas da rede neural pode ser bem aproximada pelo “produto de Kronecker” (Kronecker Product) entre a matriz de covariância das entradas e a matriz de covariância dos gradientes antes da ativação.

$$ F_{layer} \approx A \otimes S $$

(onde $A$ é a covariância das ativações, $S$ a covariância dos gradientes antes da ativação)

Utilizando a propriedade do produto de Kronecker de que $(A \otimes S)^{-1} = A^{-1} \otimes S^{-1}$, o cálculo da inversa de uma matriz gigantesca pode ser decomposto no cálculo das inversas de matrizes muito menores, conseguindo reduzir o custo de cálculo dramaticamente (de $O(N^3)$ para $O(n^3)$, onde $n$ é a largura da camada). A implementação do K-FAC possibilitou a aplicação prática do gradiente natural a modelos de aprendizado profundo de larga escala (como ResNet e Transformer) em tempo razoável, demonstrando experimentalmente uma convergência extremamente rápida em ambientes de aprendizado distribuído. Esse foi um momento histórico em que a geometria da informação rompeu as barreiras da IA.


Capítulo 6: Extensões para a Física Estatística, Informação Quântica e Neurociência

A versatilidade da geometria da informação não se limita à estatística e ao aprendizado de máquina. Sua raiz fundamental, a “geometria da probabilidade e da informação”, teve impacto em várias áreas da ciência.

Geometria da Informação Quântica

A geometria da informação que trata de distribuições de probabilidade clássicas estende-se naturalmente para a Geometria da Informação Quântica (Quantum Information Geometry) que manipula a “matriz de densidade (Density Matrix)” da mecânica quântica. Nos sistemas quânticos, devido à não-comutatividade das variáveis ​​observáveis ​​(o resultado do operador muda com a ordem), não é definida unicamente uma entidade equivalente à métrica de Fisher. Em vez disso, existem várias métricas riemannianas como a métrica de Bures (SLD Fisher information) ou a métrica Kubo-Mori-Bogoliubov, cada uma com diferentes significados físicos e informacionais. A geometria da informação quântica, por fornecer fundamentos teóricos para coisas como o limite da precisão da estimativa de estado quântico (Desigualdade de Cramér-Rao Quântica), o entendimento geométrico do entrelaçamento quântico (entanglement) e a otimização dos algoritmos quânticos, está se desenvolvendo de forma acelerada na área da computação e comunicação quântica.

Princípio da Energia Livre e Neurociência (Codificação Preditiva)

Na área da neurociência do cérebro, o Princípio da Energia Livre (Free Energy Principle; FEP), proposto por Karl Friston, postula que o cérebro é um sistema de inferência probabilística da percepção e das ações com o objetivo de minimizar a “surpresa (Surprise)”. Este processo de inferência é formulado como uma inferência Bayesiana variacional (Variational Bayesian Inference), que se reduz a um problema de otimização de minimização da divergência KL (a energia livre variacional) entre a distribuição de probabilidade do modelo interno do cérebro e a verdadeira distribuição do ambiente externo.

Do ponto de vista da geometria da informação, o cérebro pode ser interpretado como um sistema dinâmico que se move em uma variedade de distribuições de probabilidade acompanhando o gradiente da divergência (ou seja, o gradiente natural). A percepção (atualização do estado interno) e a ação (o estímulo sobre o ambiente externo) podem ser descritas de forma bela como o algoritmo iterativo da e-projeção e da m-projeção nos espaços planos duais. A geometria da informação provê a linguagem matemática que elucida os mecanismos raízes da inteligência.

Como a Fronteira da Matemática Moderna

Sob o ponto de vista da matemática pura, a geometria da informação também estabeleceu um novo paradigma. Conexões profundas com a geometria diferencial afim, a geometria Hessiana e a geometria simplética estão sendo esclarecidas. Especialmente, a integração da geometria de Wasserstein (teoria do transporte ótimo) com a geometria da informação é um dos assuntos de pesquisa mais empolgantes atualmente na matemática e no aprendizado de máquina. Ao passo que a divergência KL (geometria da informação) mede o movimento da “informação”, a distância de Wasserstein mede o movimento da “massa”. As tentativas de unificar essas duas geometrias ligam-se diretamente às clarificações teóricas sobre modelos generativos profundos (como os modelos de difusão ou as GANs).


Conclusão: A Forma do Universo Tecida pela Informação

Originada da simples intuição de Shun’ichi Amari de que “os modelos estatísticos podem ser curvos”, a geometria da informação ultrapassou os limites da estatística, e tornou-se um formidável arcabouço teórico que engloba o aprendizado de máquina, a física quântica e a neurociência. Enxergar a distribuição de probabilidade não como uma mera função, mas sim como um “espaço” geométrico, possibilita-nos uma compreensão visual do fluxo de informação, da trajetória da aprendizagem e da própria natureza da inteligência.

O “grau de curvatura da informação” revelado pela métrica de informação de Fisher. O “Teorema de Pitágoras generalizado” deduzido pelas conexões duais. E a “evolução veloz da IA”, impulsionada pelo método do gradiente natural.

A geometria da informação continuará a ser, com toda a certeza, a nossa mais refinada “bússola” para enxergar constelações de fatos a partir de estrelas de dados. Esta bela e profunda jornada à variedade riemanniana está só a começar.

comments powered by Disqus