Agentic AI und Post-Training-Strategien
Frontier-Modelle bei schweren naturwissenschaftlichen Aufgaben besser machen, und die Bewertung so bauen, dass sich der Fortschritt messen lässt statt behaupten.
Wo Frontier-Modelle noch scheitern
Frontier-Modelle tun sich schwer mit mehrstufigem Reasoning in spezialisierter MINT-Arbeit. Lassen Sie eines einen mehrstufigen chemischen Reaktionsprozess durchspielen oder eine Ingenieuraufgabe lösen, bei der Schritt 4 vom Ergebnis aus Schritt 2 abhängt, und es verliert den Faden. Agenten zeigen denselben Bruch auf langen Trajektorien mit Werkzeugen. Ein häufiger Fall: ein administratives Einmal-Zugangsdatum mit begrenzter Gültigkeit, das der Agent anlegt, benutzt und danach nie löscht.
Der Grund liegt im Vortraining. Diese Modelle lernen allgemeine Muster, um das nächste Token vorherzusagen, nicht tiefes Fachwissen, und das Post-Training schließt diese Lücke.
1. Model-Alignment: RLHF und RLVR
RLVR passt zu Aufgaben mit objektiver Antwort, etwa einer Mathematikaufgabe. RLHF passt zu Aufgaben, bei denen die Antwort Ermessenssache ist, etwa dem Schreiben eines Romans. Bewertungsraster stehen dazwischen und geben dem Reward-Modell ein genaueres Signal als eine einzelne Präferenzstimme, weil das Modell eine abgestufte Note bekommt statt einer binären. Bei langen mehrstufigen Aufgaben hält genau diese Abstufung das Reward-Modell kalibriert.
Mein Teil beginnt bei den Prompts. Ich schreibe Prompts, die Schwächen des Modells sichtbar machen, indem sie genaue, aufeinander aufbauende Anforderungen schichten (Fachlichkeit, Inhalt, Form) und die Erwartungen abbilden, die eine Fachperson wirklich hätte. Danach schreibe ich die ideale Antwort für das überwachte Fine-Tuning und bewerte Modellantworten für das bestärkende Lernen. Der Hintergrund in Angewandter Mathematik ist das, was mich Evaluationsverfahren bauen lässt, die die menschliche Absicht treffen statt sie anzunähern.
2. Besseres Reasoning über Chain-of-Thought
Ich zerlege komplexe Aufgaben mit Chain-of-Thought-Verfahren in Schritte, die eine bewertende Person prüfen kann. Damit wird aus einer technischen Lösung ein Trainingsdatensatz mit gesicherter Wahrheit. Ein Beispiel: den Optimierungsweg zur Rekonstruktion von MRT-Bildern so kleinschrittig aufzuschreiben, dass ein Modell ihn nachvollziehen und danach verallgemeinern kann.
3. Fehleranalyse und Bewertung nach Raster
Ich lese die YAML-Dateien, um zu verstehen, was verlangt war, wäge das gegen das Raster ab und verfolge Agenten-Trajektorien bis zum genauen Fehlermodus. Ich prüfe das Reasoning des Agenten und das des Umgebungsagenten, damit ein Fehler des Umgebungsagenten nicht dem bewerteten Agenten angelastet wird. Danach lese ich das Protokoll auf den Fehler beim Function Calling: ein Aufruf, der nie stattfand, oder die richtige Funktion mit den falschen Parametern.
4. Was das Modell danach kann
Nach einem Post-Training-Zyklus nehmen Modelle das Fachwissen zu den Aufgaben auf, an denen sie zuvor scheiterten. Strukturierte mehrstufige Aufgaben, die sie vorher brachen, laufen verlässlich durch.