Inscription / Connexion Nouveau Sujet
Niveau Master Maths
Partager :

Géométrie et spectre du loss landscape en deep learning

Posté par
Ziraax
20-05-25 à 22:18

Bonjour,

Voici un exercice assez intéressant, pouvez-vous me dire ce que vous en pensez ?

Soit un réseau de neurones profond f_\theta : \mathbb{R}^d \rightarrow \mathbb{R}^k, paramétré par \theta \in \mathbb{R}^p avec une fonction de perte :

L(\theta) = \frac{1}{N} \sum_{i=1}^{N}l(f_{\theta}(x^{(i)}), y^{(i)})

ou l est une perte convexe comme MSE ou cross-entropy. Supposons que le réseau est entièrement différentiable.

On s'intéresse à la géométrie du paysage de la perte, c'est à dire à la forme locale de L autour d'un point critique \theta_{0}.

Questions :

1. Définir et expliciter le hessien H(\theta) = \nabla^2 L(\theta).
2. (Spectre en minimum global)
Supposons que \theta^* est un minimum global tel que f_{\theta*}(x^{(i)}) = y^{(i)} et que l est la MSE.
Montrer que dans ce cas le hessien est semi-défini positif et interprétez les directions du noyau de H(\theta^*) comme des directions plates de l'espace des paramètres.
3. (Lien avec la géométrie Riemannienne)
On définit une métrique de Fisher empirique :

\large F(\theta) = \frac{1}{N} \sum_{i=1}^{N} \nabla_{\theta} log p_{\theta} (y^{(i)} | x^{(i)})  \nabla_{\theta} log p_{\theta} (y^{(i)} | x^{(i)})^{T}

a. Montrez que si l est la cross-entropy et que f_{\theta} paramètre p_{\theta}(y | x), alors F(\theta) \approx H(\theta) autour d'un minimum.
b. Concluez que l'espace des paramètres est localement muni d'une structure de variété riemannienne, et que la dynamique de descente de gradient peut être interprétée comme un flux géodésique naturel.


Voici ce que j'ai fait :

1. Analyse du Hessien

On différencie deux fois la fonction de perte :


 \\ H(\theta)=\nabla^2 \mathcal{L}(\theta)=\frac{1}{N} \sum_{i=1}^N \nabla^2 \ell\left(f_\theta\left(x^{(i)}\right), y^{(i)}\right)
 \\ 
 \\

Comme l est une fonction de perte de f_{\theta}, elle est composée avec le réseau. On applique la règle de la différenciation composée :


 \\ \nabla^2 \ell\left(f_\theta(x), y\right)=J^{\top} H_{\ell} J+\sum_j\left(\nabla^2 f_\theta^{(j)} \cdot \frac{\partial \ell}{\partial f_j}\right)
 \\

donc :

H(\theta)=\frac{1}{N} \sum_{i=1}^N J_i^{\top} H_{\ell}^{(i)} J_i+\frac{1}{N} \sum_{i=1}^N \sum_{j=1}^k \nabla^2 f_\theta\left(x^{(i)}\right)^{(j)} \cdot \nabla_{f_j} \ell

Ou J_i est le jacobien du modèle, et H_l^{(i)} est le hessien de l par rapport à f, evalué en x^{(i)}

2.

Si l = \frac{1}{2} || f(x)-y||^2 alors :
- H_{l}^{(i)} = I_k la matrice identité
- \nabla_{f_j}l =0 au minimum car f(x^{(i)})=y^{(i)}

Donc :

$$
 \\ H\left(\theta^*\right)=\frac{1}{N} \sum_{i=1}^N J_i^{\top} J_i
 \\ $$

C'est une somme de matrices de Gram => semi-définie positive.

- Si certains J_i​ sont de rang partiel, alors HH est dégénéré.
- Les vecteurs v \in ker(H) vérifient : J_i v = 0 \forall i ⇒ directions plates = aucune variation de la sortie du modèle dans ces directions.



Si vous avez des idées pour la question 3, je suis preneur

Merci,

Bonne soirée !



Vous devez être membre accéder à ce service...

Pas encore inscrit ?

1 compte par personne, multi-compte interdit !

Ou identifiez-vous :


Rester sur la page

Désolé, votre version d'Internet Explorer est plus que périmée ! Merci de le mettre à jour ou de télécharger Firefox ou Google Chrome pour utiliser le site. Votre ordinateur vous remerciera !