J'ai soutenu ma thèse : analyse de convergence de l'entraînement des réseaux de neurones linéaires profonds
Le taux d'apprentissage dépend de constantes que la théorie existante ne sait pas calculer avant l'entraînement, donc on les choisit par tâtonnement. J'ai refermé une partie de cet écart, et j'applique aujourd'hui la même rigueur à l'IA en production.
Le 15 juin, j’ai soutenu ma thèse à la LMU Munich : Convergence Analysis of Training Deep Linear Neural Networks.
Pourquoi cela compte
Tout modèle d’IA apprend en s’ajustant sur des millions de petits pas. La convergence est la garantie que ce processus atteint la bonne réponse. Pour les vrais systèmes d’IA, cette garantie est restée incomplète.
Le taux d’apprentissage, c’est-à-dire la taille de chaque pas, dépend de constantes que la théorie existante ne sait pas calculer avant l’entraînement. On les choisit par tâtonnement. Quand un entraînement échoue, les ingénieurs passent des semaines à déboguer à l’intuition.
J’ai étudié cela sur les réseaux de neurones linéaires, dont la perte reste mathématiquement difficile à optimiser et qui partagent des comportements d’entraînement essentiels avec les réseaux non linéaires utilisés en pratique.
J’ai consacré mon doctorat à refermer une partie de cet écart : la distance entre la façon dont nous entraînons les réseaux de neurones et la raison pour laquelle cela marche vient de se réduire.
J’applique maintenant cette même rigueur à l’IA en production. J’ai construit un copilote agentique pour la chaîne d’approvisionnement, qui pose des garanties déterministes autour des décisions d’un modèle de langage.
Comment cela fonctionne
Les résultats antérieurs sur la descente de gradient et sa version stochastique reposaient sur des conditions fortes, comme le caractère lipschitzien du gradient, qui ne tient que si les itérés sont déjà bornés, précisément ce que ces résultats supposent. Il a été montré qu’enfreindre certaines de ces conditions provoque la divergence.
J’ai prouvé la convergence sous des conditions plus faibles. Pour la descente de gradient : vers un minimum global pour presque toutes les initialisations. Les pas ne décroissent pas exponentiellement avec la profondeur, et chaque constante se calcule à partir du réseau et des données.
Pour la version stochastique : l’une des premières bornes sur les itérés pour une perte concrète de réseau de neurones, avec la convergence presque sûre établie.
Ces résultats s’étendent-ils ? J’ai entraîné des réseaux non linéaires (tanh, aux profondeurs 2, 3 et 5) dans les mêmes conditions. Même schéma de convergence. Même ordonnancement selon la profondeur. Les résultats linéaires se sont étendus empiriquement.
Une surprise : certains pas qui violaient nos conditions convergeaient quand même, tandis que d’autres échouaient complètement. Cette frontière est la question ouverte suivante.