← LinkedIn-Beiträge

Ich habe promoviert: Konvergenzanalyse des Trainings tiefer linearer neuronaler Netze

Die Lernrate hängt an Konstanten, die die bestehende Theorie vor dem Training nicht berechnen kann, also wählt man sie durch Probieren. Einen Teil dieser Lücke habe ich geschlossen, und dieselbe Strenge wende ich jetzt auf KI im Betrieb an.

Am 15. Juni habe ich an der LMU München meine Promotion verteidigt: Convergence Analysis of Training Deep Linear Neural Networks.

Warum das zählt

Jedes KI-Modell lernt, indem es sich über Millionen kleiner Schritte anpasst. Die Konvergenz ist die Garantie, dass dieser Vorgang bei der richtigen Antwort ankommt. Für echte KI-Systeme war diese Garantie unvollständig.

Die Lernrate, also wie groß jeder Schritt sein soll, hängt an Konstanten, die die bestehende Theorie vor dem Training nicht berechnen kann. Man wählt sie durch Probieren. Scheitert ein Training, verbringen Entwicklerinnen und Entwickler Wochen mit Fehlersuche nach Gefühl.

Ich habe das an linearen neuronalen Netzen untersucht, deren Verlustfunktion mathematisch schwer zu optimieren bleibt und die wesentliche Trainingseigenschaften mit den nichtlinearen Netzen der Praxis teilen.

Meine Promotion galt einem Teil dieser Lücke: der Abstand zwischen der Art, wie wir neuronale Netze trainieren, und dem Grund, warum es funktioniert, ist gerade kleiner geworden.

Dieselbe Strenge wende ich jetzt auf KI im Betrieb an. Ich habe einen agentischen Copilot für die Lieferkette gebaut, der deterministische Garantien um die Entscheidungen eines Sprachmodells legt.

Wie es funktioniert

Frühere Ergebnisse zum Gradientenabstieg und zu seiner stochastischen Fassung setzten starke Bedingungen voraus, etwa einen lipschitzstetigen Gradienten, der nur gilt, wenn die Iterierten bereits beschränkt sind, also genau das, was diese Ergebnisse annehmen. Es wurde gezeigt, dass die Verletzung einzelner Bedingungen zur Divergenz führt.

Ich habe die Konvergenz unter schwächeren Bedingungen bewiesen. Für den Gradientenabstieg: zu einem globalen Minimum, für fast alle Initialisierungen. Die Schrittweiten fallen nicht exponentiell mit der Tiefe, und jede Konstante lässt sich aus Netz und Daten berechnen.

Für die stochastische Fassung: eine der ersten Schranken für die Iterierten einer konkreten Verlustfunktion eines neuronalen Netzes, mit gezeigter fast sicherer Konvergenz.

Gehen die Ergebnisse über? Ich habe nichtlineare Netze trainiert (tanh, in den Tiefen 2, 3 und 5), unter denselben Bedingungen. Dasselbe Konvergenzmuster. Dieselbe Ordnung nach Tiefe. Die linearen Ergebnisse gingen empirisch über.

Eine Überraschung: manche Schrittweiten, die unsere Bedingungen verletzten, konvergierten trotzdem, während andere völlig scheiterten. Diese Grenze ist die nächste offene Frage.

Through G. M. Nguegnang's Lens. On the gap between how we train neural networks and why it works