KI-Engineering und Agentic AI
Agentische Systeme und Retrieval
6 Projekte zu Betrieb in der Produktion, Model-Alignment, Retrieval-Forschung und Beratung zu Frontier-Modellen. Jedes endet mit einer Zahl, einem Commit oder einer laufenden Adresse. Öffnen Sie ein Projekt für die ganze Fallstudie.
-
Multi-Agenten-System · im Betrieb
Eine Planerin stellt eine Frage zur Beschaffung in normaler Sprache. Das System rechnet exakt, statt zu schätzen, und hält bei allem über 10.000 $ für eine Freigabe an.
98 % Injection-Resistenz · 168 Tests · 10 Geschäftsintents
Ein LangGraph-Agent leitet die Frage an 1 von 7 exakten Solvern weiter (OR-Tools, CVXPY, SciPy) und an eine CRAG-Pipeline auf pgvector. Ein Human-Gate auf Redis hält teure Entscheidungen an, und 6 typisierte FastMCP-Verträge trennen das Modell von allem, was ausgeführt wird.
-
Deployment-Infrastruktur · Produktion
Agentisches ERP: die Deployment-Infrastruktur
AKS · Bicep-IaCDie Pipeline, die den Copilot auf echte Infrastruktur bringt, mit den 6 Prüfungen, die vor jedem Release bestehen müssen.
Bicep-IaC · Kustomize-Overlays · Smoke-Test mit 6 Prüfungen · OTel
Bicep stellt AKS, ACR, Postgres, Redis, CosmosDB und Azure Monitor bereit. Kustomize-Overlays trennen Staging und Produktion, ohne ein Manifest zu duplizieren, und ein Produktions-Deployment wartet auf eine manuelle Freigabe.
-
Model-Alignment · SFT und DPO
Alignment für Finanzfragen mit SFT, RLAIF und DPO
Llama-3-8B · FinQAEinem Modell beibringen, die Finanztabellen eines Unternehmens zu lesen und seinen Rechenweg zu zeigen, damit eine Analystin die Zahl prüfen kann, statt ihr zu vertrauen.
SFT-Loss 2,74 → 0,785 · DPO-Reward-Genauigkeit 97,7 %
Eine dreistufige Pipeline auf Llama-3-8B: überwachtes Fine-Tuning mit annotiertem Rechenweg, 1 800 von einem zweiten Modell gelabelte Präferenzpaare, dann DPO unter 4-Bit-Quantisierung. Ein drittes Modell bewertet die Ergebnisse, also benotet kein Modell die eigene Arbeit.
-
RAG in Produktion · im Betrieb
Stellen Sie eine Frage zu einem Bestand an Forschungsarbeiten und erhalten Sie eine Antwort mit ihren Quellen. Ein Befehl genügt, auf einem gewöhnlichen Laptop.
ALCE-Zitationsgenauigkeit 0,84 · 47 810 indexierte Chunks
FastAPI und Chainlit in einem Docker-Compose-Stack aus zwei Diensten, bei jedem Push nach GHCR veröffentlicht. Keine Python-Umgebung einzurichten und kein Index von Hand zu laden.
-
Retrieval-Forschung · laufend
Vierstufige hybride RAG-Pipeline für wissenschaftliche Fragen
QASPER-BenchmarkDie Forschung hinter diesem Chatboard: wie sich die eine passende Textstelle unter 47 810 findet, und wann das System zugibt, dass es keine gibt, statt eine Antwort zu erfinden.
ALCE 0,8373 · Faithfulness 0,7150 · 84 QASPER-Fragen
SPECTER2- und BM25-Retrieval, per RRF zusammengeführt, ColBERT-v2-Reranking, ein kalibriertes CRAG-Gate und Generierung mit Llama-3.1-8B samt Zitaten im Text. Eine einzige Korrektur an der Antwortextraktion hob den ALCE-Recall von 0,057 auf 0,84.
-
Alignment von Frontier-Modellen · laufende Beratung
Frontier-Modelle bei schweren naturwissenschaftlichen Aufgaben besser machen, und die Bewertung so bauen, dass sich der Fortschritt messen lässt statt behaupten.
RLHF · RLVR · Bewertungsraster · Chain-of-Thought
RLVR, wo die Antwort objektiv ist, RLHF, wo sie es nicht ist, und Bewertungsraster dazwischen für eine abgestufte Note. Dazu die Analyse von Agenten-Trajektorien und die Präferenzdatensätze, die SFT und DPO speisen.