← LinkedIn-Beiträge

Warum wir die Konvergenz am einfachsten Netz bewiesen haben, das es gibt

Die lineare Schicht ist der eine Baustein, den alle neuronalen Netze teilen. Ihre Verlustfunktion bleibt nichtkonvex, und ihr Training bleibt NP-vollständig. Deshalb ist sie der richtige Ort, um nach einer Garantie zu suchen.

Die lineare Schicht ist der zentrale Baustein, den alle neuronalen Netze teilen. Wir haben bewiesen, warum ihr Training konvergiert, und diese Analyse prägt heute das Verständnis davon, wie Foundation-Modelle skalieren.

Warum das zählt

Ein KI-Modell zu trainieren heißt, es immer wieder in Richtung besserer Antworten zu schieben. Die Mathematik, die garantiert, dass diese Schübe bei der gewünschten Ausgabe ankommen, steht noch am Anfang.

Der Gradientenabstieg und das Einstellen der Lernrate sind die Grundlage der KI-Entwicklung. Jeder Fine-Tuning-Lauf und jedes Vortraining hängen daran. Trotzdem bleibt der Beweis, dass der Gradientenabstieg konvergiert, für die Verlustfunktionen, die er tatsächlich optimiert, unvollständig. Die Konstanten, die die Lernrate steuern, lassen sich vorher nicht berechnen, also wählt man sie durch Probieren.

Meine Promotionsforschung hat das an linearen neuronalen Netzen untersucht: an denselben linearen Abbildungen, die zusammen mit Aktivierungen jeden Transformer und jedes mehrschichtige Perzeptron aufbauen. Trotz ihrer Einfachheit bleibt die Optimierung schwer. Es wurde gezeigt, dass diese Netze wesentliche Trainingseigenschaften mit den nichtlinearen Architekturen im Betrieb teilen.

Das einfachste Modell hat das Verhalten des komplexen vorhergesagt.

Wie es funktioniert

Ein lineares Netz wirkt, als müsste es leicht zu trainieren sein. Selbst mit identischen Aktivierungen bleibt seine Verlustfunktion nichtkonvex, und das Training ist NP-vollständig. Die Architektur ist einfach. Die Optimierung bleibt komplex.

Frühere Analysen des Gradientenflusses zeigten, dass diese Netze eine Balanciertheit erhalten, die für die Konvergenz entscheidend ist. Wir erwarteten, dass sie auf den Gradientenabstieg übergeht. Sie tat es nicht. Die Diskretisierung zerstörte die exakte Balanciertheit, und der Weg, der bei den früheren Ergebnissen funktionierte, hörte auf zu funktionieren.

Wir haben ein Induktionsargument entwickelt, das die Abweichung der Gewichte von der Balanciertheit unter praktikablen Schrittweiten kontrolliert. Daraus folgte die Konvergenz für fast alle Initialisierungen, mit Schrittweiten, die nicht exponentiell mit der Tiefe fallen und deren Konstanten sich aus Netz und Daten berechnen lassen.

Für den stochastischen Gradientenabstieg haben wir eine der ersten Schranken für die Iterierten einer konkreten Verlustfunktion eines neuronalen Netzes bewiesen und die fast sichere Konvergenz gezeigt.

Danach haben wir geprüft, ob die Ergebnisse übergehen: tanh-Netze in den Tiefen 2, 3 und 5, unter denselben Bedingungen. Dasselbe Konvergenzmuster. Dieselbe Ordnung nach Tiefe.

Through G. M. Nguegnang's Lens. On using the simplest neural network to understand the models we deploy