Agentic AI
Multi-Agenten-Orchestrierung mit MCP-Werkzeuggrenzen und CRAG-Retrieval. Der Agent liest die Anfrage, den Rest erledigen typisierte Verträge und exakte Solver.
Promotion in Angewandter Mathematik · seit 2018 im Betrieb
Ich baue agentische KI-Systeme und bringe sie zu echten Nutzerinnen und Nutzern: Multi-Agenten-Orchestrierung, RAG und MCP, auf Azure betrieben, hinter typisierten Verträgen, einer Testsuite und einem Freigabeschritt durch einen Menschen. In der Promotion in Angewandter Mathematik habe ich gelernt, vorher zu beweisen, dass ein System funktioniert.
Beratung zu Agenten-Engineering, Evaluation, RAG und Context-Engineering sowie zum Betrieb in der Produktion. Nahe München, vor Ort, hybrid oder remote.
Was ich mache
Multi-Agenten-Orchestrierung mit MCP-Werkzeuggrenzen und CRAG-Retrieval. Der Agent liest die Anfrage, den Rest erledigen typisierte Verträge und exakte Solver.
Pipelines, die die Übergabe überstehen: Container, CI/CD, Monitoring und ein Weg zurück. Das Deployment gehört zum Bau, genau wie der Code.
Verteiltes Training und Modellparallelität auf HPC-Clustern. Die Lernraten kommen aus der Theorie, nicht aus einer Suche, die GPU-Stunden kostet.
Eine Konvergenzanalyse, erschienen bei Springer Nature, und die Evaluationsverfahren, die Ihnen sagen, ob ein Modell wirklich besser geworden ist.
Ausgewählte Arbeiten
Ein Multi-Agenten-System im Betrieb, eine Alignment-Pipeline, ein Retrieval-Stack und ein Prognosemodell, das der Betrieb bis heute nutzt. Jede Zahl unten öffnet die Fallstudie dahinter.
Multi-Agenten-System · im Betrieb
Eine Planerin stellt eine Frage zur Beschaffung in normaler Sprache. Das System rechnet exakt, statt zu schätzen, und hält bei allem über 10.000 $ für eine Freigabe an.
Ein LangGraph-Agent leitet die Frage an 1 von 7 exakten Solvern weiter (OR-Tools, CVXPY, SciPy) und an eine CRAG-Pipeline auf pgvector. Ein Human-Gate auf Redis hält teure Entscheidungen an, und 6 typisierte FastMCP-Verträge trennen das Modell von allem, was ausgeführt wird.
Alignment von Frontier-Modellen · laufende Beratung
Frontier-Modelle bei schweren naturwissenschaftlichen Aufgaben besser machen, und die Bewertung so bauen, dass sich der Fortschritt messen lässt statt behaupten.
RLVR, wo die Antwort objektiv ist, RLHF, wo sie es nicht ist, und Bewertungsraster dazwischen für eine abgestufte Note. Dazu die Analyse von Agenten-Trajektorien und die Präferenzdatensätze, die SFT und DPO speisen.
Retrieval-Forschung · laufend
Die Forschung hinter diesem Chatboard: wie sich die eine passende Textstelle unter 47 810 findet, und wann das System zugibt, dass es keine gibt, statt eine Antwort zu erfinden.
SPECTER2- und BM25-Retrieval, per RRF zusammengeführt, ColBERT-v2-Reranking, ein kalibriertes CRAG-Gate und Generierung mit Llama-3.1-8B samt Zitaten im Text. Eine einzige Korrektur an der Antwortextraktion hob den ALCE-Recall von 0,057 auf 0,84.
Prognose · im Betrieb
Telekomstandorte in Kamerun verloren Diesel, und niemand sah wo. Das System sagt vorher, was ein Standort verbrauchen sollte, und meldet die Standorte, die mehr verbrauchen. Der Betrieb nutzt es bis heute.
Ein Random-Forest-Regressor hinter einer Flask-Webanwendung, mit einer Abweichungsschwelle beim Mittelwert plus 2 Standardabweichungen, einem Monitoring-Dashboard und Exporten für Audits.
Zertifiziert in fortgeschrittener Agentenprogrammierung, fortgeschrittenem Prompt-Engineering, generativer KI mit großen Sprachmodellen (LLM), Modellparallelität für Bau und Betrieb großer neuronaler Netze sowie MLOps für die Produktion.
Über mich
Ich habe in Kamerun angefangen und eine App zur Kraftstoffprognose gebaut, die die Technikerinnen und Techniker an den Basisstationen selbst bedienten. Danach habe ich sechs Jahre lang bewiesen, wann der Gradientenabstieg konvergiert und warum.
Beide Hälften stecken in dem, was ich heute liefere: agentische Systeme, die Entscheidungen an exakte Solver geben, Retrieval, das seine Quellen nennt, und eine Zahl an jeder Aussage. Das Deployment ist meine Ziellinie.