← LinkedIn-Beiträge

Der Copilot antwortet weiter, wenn das Sprachmodell ausfällt

Eine Gratisstufe mit 50 API-Aufrufen am Tag hat jede Entwurfsentscheidung in diesem System bestimmt. Die Grenze ist weg. Die Architektur, die daraus entstand, blieb, weil sie sich ihren Platz verdient hat.

Ich habe einen KI-Copilot gebaut, der weiter antwortet, auch wenn sein Sprachmodell ausfällt. Dieser Entwurf kam aus einer harten Grenze in der frühen Entwicklung: 50 API-Aufrufe am Tag.

Warum das zählt

Ein System, das in der Demo funktioniert, und ein System, das den Betrieb übersteht, sind zwei verschiedene Dinge. Der Unterschied zeigt sich, wenn etwas ausfällt: wenn das Kontingent des Modells am Nachmittag aufgebraucht ist und das System weiter antworten muss, ohne dass jemand eingreifen kann.

Wenn die Rechenleistung unbegrenzt ist, darf die Architektur zerbrechlich sein. Nehmen Sie dieses Budget weg, und jede Entwurfsentscheidung ändert sich. Die Grenze, unter der ich gebaut habe, ist weg. Die Architektur, die sie erzwungen hat, blieb, weil sie sich ihren Platz verdient hat.

Die Systeme, denen Unternehmen vertrauen, sind die, die noch laufen, wenn das Rechenbudget aufgebraucht ist.

Wie es funktioniert

Ich habe einen LangGraph-ERP-Copilot für die Lieferkette mit mehreren Agenten gebaut und auf Azure Kubernetes Service mit GPT-4o in Betrieb genommen. In der frühen Entwicklung lief das Sprachmodell auf einer Gratisstufe mit 50 Anfragen am Tag. Diese Grenze hat den ganzen Entwurf geprägt.

Das System recherchiert jede Frage auf zwei Wegen zugleich und prüft seine eigenen Funde noch einmal, bevor es antwortet. Im Einzelnen: ein Modell für Textvektoren (BGE-large-en-v1.5, 1024 Dimensionen) findet Dokumente über den Sinn, BM25 findet sie über Stichwörter, beide Listen werden über Reciprocal Rank Fusion zusammengeführt, ein zweites Modell ordnet sie neu, und ein Qualitäts-Gate wirft jeden Chunk heraus, den es für irrelevant hält, bevor das Sprachmodell ihn sieht.

Jeder Werkzeugaufruf läuft über einen typisierten Vertrag. 6 Server prüfen die Eingabe gegen ein Schema, bevor ein Solver oder eine Datenbankabfrage läuft, also wird eine fehlerhafte Anfrage abgewiesen, bevor sie die Rechnung erreicht.

Es läuft außerdem ganz ohne das Sprachmodell. Der asynchrone Stack bedient gleichzeitige Sitzungen ohne Blockade. Ist das Modell nicht verfügbar, übernehmen ein Stichwortklassifikator und ein Mustererkenner, und alle 7 Solver des Operations Research laufen unverändert weiter. Eine Einkaufsanalystin, die morgens ihre Prüfung macht, bekommt weiterhin eine Antwort, auch wenn das Modell über Nacht ausgefallen ist.

Was mich kalt erwischt hat: als das Kontingent aufgebraucht war, warf der Agent für den Wissensgraphen keinen Fehler. Er gab still nichts zurück. Ein stiller Ausfall ist schlimmer als ein lauter. Die Korrektur war ein deterministischer Rückfallweg, der bei jeder Ausnahme des Sprachmodells greift, nicht nur beim Kontingent, damit das System immer etwas zurückgibt, wofür es geradestehen kann.

Das Schwerste am Bauen unter Beschränkungen ist die Einsicht, dass die Beschränkung vielleicht der Entwurf ist.

Through G. M. Nguegnang's Lens. On building AI that survives its own failures