Pourquoi nous avons prouvé la convergence sur le réseau le plus simple qui soit
La couche linéaire est le seul composant que tous les réseaux de neurones partagent. Sa perte reste non convexe, et son entraînement reste NP-complet. C'est pour cela que c'est le bon endroit où chercher une garantie.
La couche linéaire est le composant central que tous les réseaux de neurones partagent. Nous avons prouvé pourquoi son entraînement converge, et cette analyse éclaire aujourd’hui la façon dont les modèles de fondation passent à l’échelle.
Pourquoi cela compte
Entraîner un modèle d’IA revient à le pousser encore et encore vers de meilleures réponses. Les mathématiques qui garantissent que ces poussées arrivent à la sortie voulue en sont encore à un stade précoce.
La descente de gradient et le réglage du taux d’apprentissage sont les fondations de l’ingénierie de l’IA. Chaque affinage et chaque préentraînement en dépendent. Pourtant, la preuve que la descente de gradient converge, pour les fonctions de perte qu’elle optimise réellement, reste incomplète. Les constantes qui contrôlent le taux d’apprentissage ne se calculent pas à l’avance, donc on les choisit par tâtonnement.
Mes travaux de doctorat ont étudié cela sur les réseaux de neurones linéaires, c’est-à-dire les mêmes transformations linéaires qui, composées avec des activations, construisent tous les transformeurs et tous les perceptrons multicouches. Malgré leur simplicité, l’optimisation y reste difficile. Il a été montré que ces réseaux partagent des comportements d’entraînement essentiels avec les architectures non linéaires utilisées en production.
Le modèle le plus simple a prédit le comportement du modèle complexe.
Comment cela fonctionne
Un réseau linéaire donne l’impression qu’il devrait être facile à entraîner. Même avec des activations identité, sa perte reste non convexe, et son entraînement est NP-complet. L’architecture est simple. L’optimisation reste complexe.
Les analyses antérieures du flot de gradient montraient que ces réseaux préservent un invariant d’équilibrage essentiel à la convergence. Nous nous attendions à le retrouver pour la descente de gradient. Il n’y était pas. La discrétisation a détruit l’équilibrage exact, et l’approche qui avait servi aux résultats antérieurs a cessé de fonctionner.
Nous avons construit un argument par récurrence qui contrôle l’écart des poids à l’équilibrage sous des pas praticables. Cela a donné la convergence pour presque toutes les initialisations, avec des pas qui ne décroissent pas exponentiellement avec la profondeur et dont les constantes se calculent à partir du réseau et des données.
Pour la descente de gradient stochastique, nous avons prouvé l’une des premières bornes sur les itérés pour une perte concrète de réseau de neurones, et établi la convergence presque sûre.
Nous avons ensuite testé si les résultats s’étendent : des réseaux tanh aux profondeurs 2, 3 et 5, dans les mêmes conditions. Même schéma de convergence. Même ordonnancement selon la profondeur.