Zum Inhalt springen
GN G. M. Nguegnang
  • English
  • Français
  • Start
  • Über mich
  • Forschung
  • ML-Engineering und Deep Learning
  • KI-Engineering und Agentic AI
  • LinkedIn-Beiträge
  • Lebenslauf
  • Kontakt
  • English
  • Français
  • Start
  • Über mich
  • Forschung
  • ML-Engineering und Deep Learning
  • KI-Engineering und Agentic AI
  • LinkedIn-Beiträge
  • Lebenslauf
  • Kontakt

KI-Engineering und Agentic AI

Agentische Systeme und Retrieval

6 Projekte zu Betrieb in der Produktion, Model-Alignment, Retrieval-Forschung und Beratung zu Frontier-Modellen. Jedes endet mit einer Zahl, einem Commit oder einer laufenden Adresse. Öffnen Sie ein Projekt für die ganze Fallstudie.

  • Multi-Agenten-System · im Betrieb

    Agentischer ERP-Copilot für die Lieferkette

    Eine Planerin stellt eine Frage zur Beschaffung in normaler Sprache. Das System rechnet exakt, statt zu schätzen, und hält bei allem über 10.000 $ für eine Freigabe an.

    98 % Injection-Resistenz · 168 Tests · 10 Geschäftsintents

    Ein LangGraph-Agent leitet die Frage an 1 von 7 exakten Solvern weiter (OR-Tools, CVXPY, SciPy) und an eine CRAG-Pipeline auf pgvector. Ein Human-Gate auf Redis hält teure Entscheidungen an, und 6 typisierte FastMCP-Verträge trennen das Modell von allem, was ausgeführt wird.

    • LangGraph
    • FastMCP
    • Neo4j
    • pgvector
    • OR-Tools
    • Azure AKS
    • Bicep
    Fallstudie ansehen →
    ERP-Entwicklungs-Repository ↗
  • Deployment-Infrastruktur · Produktion

    Agentisches ERP: die Deployment-Infrastruktur

    AKS · Bicep-IaC

    Die Pipeline, die den Copilot auf echte Infrastruktur bringt, mit den 6 Prüfungen, die vor jedem Release bestehen müssen.

    Bicep-IaC · Kustomize-Overlays · Smoke-Test mit 6 Prüfungen · OTel

    Bicep stellt AKS, ACR, Postgres, Redis, CosmosDB und Azure Monitor bereit. Kustomize-Overlays trennen Staging und Produktion, ohne ein Manifest zu duplizieren, und ein Produktions-Deployment wartet auf eine manuelle Freigabe.

    • Azure AKS
    • Bicep
    • Kustomize
    • GitHub Actions
    • OTel
    • NGINX
    Fallstudie ansehen →
    ERP-Deployment-Repository ↗
  • Model-Alignment · SFT und DPO

    Alignment für Finanzfragen mit SFT, RLAIF und DPO

    Llama-3-8B · FinQA

    Einem Modell beibringen, die Finanztabellen eines Unternehmens zu lesen und seinen Rechenweg zu zeigen, damit eine Analystin die Zahl prüfen kann, statt ihr zu vertrauen.

    SFT-Loss 2,74 → 0,785 · DPO-Reward-Genauigkeit 97,7 %

    Eine dreistufige Pipeline auf Llama-3-8B: überwachtes Fine-Tuning mit annotiertem Rechenweg, 1 800 von einem zweiten Modell gelabelte Präferenzpaare, dann DPO unter 4-Bit-Quantisierung. Ein drittes Modell bewertet die Ergebnisse, also benotet kein Modell die eigene Arbeit.

    • Llama-3-8B
    • LoRA / QLoRA
    • SFT
    • DPO
    • RLAIF
    • TRL
    • FinQA
    Fallstudie ansehen →
    FinQA-Alignment-Repository ↗
  • RAG in Produktion · im Betrieb

    RAG-Chatboard für wissenschaftliche Fragen

    Stellen Sie eine Frage zu einem Bestand an Forschungsarbeiten und erhalten Sie eine Antwort mit ihren Quellen. Ein Befehl genügt, auf einem gewöhnlichen Laptop.

    ALCE-Zitationsgenauigkeit 0,84 · 47 810 indexierte Chunks

    FastAPI und Chainlit in einem Docker-Compose-Stack aus zwei Diensten, bei jedem Push nach GHCR veröffentlicht. Keine Python-Umgebung einzurichten und kein Index von Hand zu laden.

    • FastAPI
    • Chainlit
    • SPECTER2
    • ColBERT v2
    • CRAG
    • Docker
    • GHCR
    Fallstudie ansehen →
    RAG-Chatboard-Deployment-Repository ↗RAG-Chatboard-Forschungs-Repository ↗
  • Retrieval-Forschung · laufend

    Vierstufige hybride RAG-Pipeline für wissenschaftliche Fragen

    QASPER-Benchmark

    Die Forschung hinter diesem Chatboard: wie sich die eine passende Textstelle unter 47 810 findet, und wann das System zugibt, dass es keine gibt, statt eine Antwort zu erfinden.

    ALCE 0,8373 · Faithfulness 0,7150 · 84 QASPER-Fragen

    SPECTER2- und BM25-Retrieval, per RRF zusammengeführt, ColBERT-v2-Reranking, ein kalibriertes CRAG-Gate und Generierung mit Llama-3.1-8B samt Zitaten im Text. Eine einzige Korrektur an der Antwortextraktion hob den ALCE-Recall von 0,057 auf 0,84.

    • SPECTER2
    • BM25
    • ColBERT v2
    • CRAG
    • HyDE
    • vLLM
    • RAGAS
    Fallstudie ansehen →
    Forschungs-Repository zum hybriden RAG ↗
  • Alignment von Frontier-Modellen · laufende Beratung

    Agentic AI und Post-Training-Strategien

    Frontier-Modelle bei schweren naturwissenschaftlichen Aufgaben besser machen, und die Bewertung so bauen, dass sich der Fortschritt messen lässt statt behaupten.

    RLHF · RLVR · Bewertungsraster · Chain-of-Thought

    RLVR, wo die Antwort objektiv ist, RLHF, wo sie es nicht ist, und Bewertungsraster dazwischen für eine abgestufte Note. Dazu die Analyse von Agenten-Trajektorien und die Präferenzdatensätze, die SFT und DPO speisen.

    • RLHF
    • RLVR
    • SFT
    • DPO
    • Chain-of-Thought
    • Rubric evaluation
    Fallstudie ansehen →
ML-Engineering und Deep Learning Forschung und Publikationen

Kontakt aufnehmen

Beratung zu agentischen KI-Systemen, von der Evaluation und dem Retrieval bis zum Betrieb in der Produktion. Nahe München, vor Ort, hybrid oder remote.

Schreiben Sie mir an gmaxime@nguegnang-ai.com
GN

KI-Forscher und ML-Engineer

  • Start
  • Über mich
  • Forschung
  • ML-Engineering und Deep Learning
  • KI-Engineering und Agentic AI
  • LinkedIn-Beiträge
  • Lebenslauf
  • Kontakt
  • Lebenslauf herunterladen
  • GitHub
  • LinkedIn
  • Google Scholar
  • E-Mail

© 2026 G. M. Nguegnang