Zum Inhalt springen
Alle Systeme betriebsbereitStatusLooking GlassGlossar
IT-Check →
Start / Lösungen / Agenten-Observability

Wenn Sie es nicht wiederholen können, haben Sie es nicht verstanden

Ein Agenten-Lauf ist nicht-deterministisch. Genau deshalb braucht er mehr Instrumentierung als klassische Software, nicht weniger: ein Span je Tool-Call, deterministisches Replay für die Fehlersuche, eine Eval-Suite in der CI und Kosten, die einem Use Case zugeordnet sind.

Geeignet fürTeams, die KI-Agenten produktiv betreiben und einen Fehlschlag hinterher erklären müssen

Traces · Replay · Evals — nachvollziehbar statt „lief einmal"
ECKDATEN
Span je Tool-CallAufruf, Antwort, Dauer, Kosten
Deterministisches ReplayEntscheidungen gegen aufgezeichnete Antworten
Evals in der CIjede Änderung läuft gegen die Suite
365 TageAufbewahrung der Traces
observabilityLive
ASCII-Grafik: drei Signalspuren übereinander — Titelbild zum Thema Wenn Sie es nicht wiederholen können, haben Sie es nicht verstanden
spansje tool-call · dauer und kosten
replaygegen aufgezeichnete antworten
evalslaufen in der ci, nicht im notebook
aufbewahrung365 tage
betrieb durch hostspezial
Granularität ein Span je Tool-CallReproduktion deterministisches ReplayPrüfung Evals in der CIAufbewahrung 365 Tage
AUF EINEN BLICK

Das Wichtigste auf einen Blick

Geeignet für
Teams, die KI-Agenten produktiv betreiben und einen Fehlschlag hinterher erklären müssen
Ausgangssituation
Ein Agentenlauf ist nicht-deterministisch: Der Fehler tritt beim zweiten Versuch schlicht nicht mehr auf
Wir übernehmen
Ein Span je Tool-Call, deterministisches Replay, Eval-Suite in der CI, Kostenzuordnung je Use Case und Mandant
Bei Ihnen bleibt
Ihre Daten und die Entscheidung, welche davon ein Modell sehen darf. Eigentum und Hoheit wechseln nicht.
Vorhandene Systeme
Welche Hardware und welche Schnittstellen sich weiterverwenden lassen, klären wir vor dem Angebot. Das Ergebnis steht schriftlich fest, bevor Sie beauftragen.
Ihr Ergebnis
Jeder Lauf ist wiederholbar — mit Kosten, Laufzeit und Richtlinienentscheidung für jeden einzelnen Schritt
Preisrahmen
Kein Aufpreis — Teil der Betriebspauschale; bei sehr hohen Trace-Volumina vereinbaren wir Sampling-Regeln
Reaktionszeit
Nach vereinbarter Service-Klasse; zur Geschäftszeit im Mittel unter 30 Minuten bis zur ersten Rückmeldung
Dauer
365 Tage Aufbewahrung audit-relevanter Ereignisse; die Eval-Suite startet mit 20 bis 30 Fällen
Erster Schritt
Wir zerlegen einen Ihrer Läufe und zeigen, welche Spans heute fehlen
Agentenbetrieb besprechen → 09571 873149 Ihr Ansprechpartner: Support-Team, Störungen und laufender Betrieb
/01 — 08Überblick

Was in einem Span steht

$ sec1
Span-Attribute je Tool-Call
AttributBeispielWozu
agent.id / agent.versionaction-agent@3Zuordnung zu Identität und Codestand
run.id / stepr-8f21c9 · 4Verknüpfung mit dem Event Log der Runtime
tool.namestripe.refundWelches Werkzeug, welcher MCP-Server
tool.params_sanitized{amount:189.00, order:sha256…}Nachvollziehbarkeit ohne Klartext-Personendaten
policy.decisionallow (limit 250)Warum der Aufruf durchging — oder nicht
latency.ms310Wo die Zeit hingeht
tokens.in / tokens.out4 210 / 380Grundlage der Kostenzuordnung
model.name / model.routeklein → grossNachweis, wann eskaliert wurde
cache.hittrueWirkung des Prompt-Caching
error.typeupstream_timeoutFehlerklassifikation für Alerting
agent.run 7 spans otel sdk auto-instrumentiert collector sanitize · sample trace & log store retention je klasse dashboards alerts · reports kostenattribution use case · team · mandant DERSELBE DATENSTROM TRÄGT FEHLERSUCHE UND ABRECHNUNG
Eine Pipeline, zwei Zwecke. Wer Kosten getrennt erhebt, bekommt Zahlen, die nicht zum Trace passen.
/02 — 08Überblick

Deterministisches Replay

$ sec2
Das eigentliche Problem beim Debuggen von Agenten: Der Fehler tritt beim zweiten Versuch nicht mehr auf. Replay löst das, indem der Lauf gegen die aufgezeichneten Modell- und Tool-Antworten erneut abgespielt wird — ohne echte Aufrufe, ohne neue Kosten, mit identischem Ergebnis.

Damit lassen sich drei Fragen beantworten, die sonst offen bleiben: Welche Eingabe hat die falsche Entscheidung ausgelöst? Ändert ein neuer Prompt das Verhalten in genau diesem Fall? Und hätte die neue Policy den Aufruf verhindert?

replay & evals
# Lauf exakt so wiederholen, wie er passiert ist — ohne echte Tool-Calls.
agentctl replay r-8f21c9

# Derselbe Lauf gegen einen geaenderten Prompt. Zeigt die Abweichung
# Schritt fuer Schritt an, statt nur das Endergebnis zu vergleichen.
agentctl replay r-8f21c9 --prompt-version 12 --diff

# Haette die neue Policy den Refund verhindert?
agentctl replay r-8f21c9 --policy ./tools.policy.yaml --dry-run
eval-suite (python)
from hostspezial.agents.eval import Suite, case, assert_tool_called

suite = Suite("refund-agent")

# Faelle kommen aus echten Laeufen: jeder produktive Fehler wird
# zum Testfall. Die Suite laeuft in der CI, nicht im Notebook.
@case(fixture="runs/r-8f21c9")
def test_refund_unter_limit(run):
    assert_tool_called(run, "stripe.refund", amount=189.00)
    assert run.status == "completed"
    assert run.cost_eur < 0.05

@case(fixture="runs/r-3ac110")
def test_ueber_limit_geht_an_menschen(run):
    # Der teuerste Fehler waere eine stille Selbstfreigabe.
    assert run.status == "awaiting_approval"
    assert not run.tool_called("stripe.refund")
/03 — 08Überblick

Evals gehören in die CI

$ sec3
„Es lief einmal im Notebook“ ist kein Deployment-Kriterium mehr. Jede Änderung an Prompt, Modell, Policy oder Werkzeugliste läuft gegen eine Suite aus echten Fällen — und zwar bevor sie in Produktion geht.

Die Suite wächst von selbst: Jeder produktive Fehlschlag wird als Fixture aufgezeichnet und zum Testfall. Nach einem halben Jahr Betrieb ist das der wertvollste Teil des Projekts — wertvoller als der Prompt.

Was wir messen

Erfolgsquote je Fallklasse, Anteil der Eskalationen an Menschen, Kosten je erfolgreichem Task, p95-Laufzeit und die Rate falsch positiver Aktionen. Nicht: „Zufriedenheit mit der Antwort“ — das ist kein Testkriterium, sondern eine Umfrage.

/04 — 08Überblick

Kosten, die einem Verursacher zugeordnet sind

$ sec4
Kostensicht je Ebene — Beispielwerte aus einem internen Testlauf, nicht aus Kundenabrechnungen
EbeneKennzahlBeispielSteuerhebel
Einzelner LaufKosten je Lauf0,031 €Budget-Cap, Kontext-Kompaktierung
Use CaseKosten je erfolgreichem Task0,047 €Model-Routing, Cache-Quote
TeamAusgaben je MonatkundenspezifischQuoten je Agent, Alarm bei Abweichung
MandantWeiterverrechnungkundenspezifischAttribution über Span-Labels
/05 — 08Überblick

Was das nicht löst

$ sec5

Ehrliche Grenzen

Replay reproduziert Entscheidungen gegen aufgezeichnete Antworten — es beweist nicht, dass das Modell heute dieselbe Antwort gäbe. Und Traces zeigen, was der Agent getan hat, nicht warum das Modell es für richtig hielt. Wer Begründungen braucht, muss sie als strukturierte Ausgabe erzwingen und mitprotokollieren — nachträglich rekonstruieren lässt sie sich nicht.

/06 — 08Überblick

Observability im Detail

$ sec6
/01Können wir die Traces in unser eigenes System exportieren?+

Ja. Der Export erfolgt über OTLP an ein Ziel Ihrer Wahl — Tempo, Jaeger, Datadog oder ein bestehendes SIEM. Wir betreiben den Standard-Stack auf Basis von Prometheus und Grafana, sind aber nicht darauf angewiesen.

/02Wie lange werden Traces aufbewahrt?+

Audit-relevante Ereignisse standardmäßig 365 Tage, vollständige Trace-Details kürzer — abhängig von Volumen und vereinbarter Klasse. Die Aufbewahrung ist Teil des Auftragsverarbeitungsvertrags, nicht eine Einstellung im Produkt.

/03Landen personenbezogene Daten in den Traces?+

Nur soweit konfiguriert. Der Collector sanitisiert Parameter vor der Ablage: Feldnamen und Typen bleiben, Klartextwerte werden gehasht oder verworfen. Welche Felder wie behandelt werden, wird je Werkzeug festgelegt und dokumentiert.

/04Was kostet Observability zusätzlich?+

Nichts extra — sie ist Teil der Betriebspauschale. Bei sehr hohen Trace-Volumina vereinbaren wir Sampling-Regeln, damit die Ablage nicht teurer wird als der Betrieb. Details auf der Preisseite.

/05Wie viele Eval-Fälle braucht eine sinnvolle Suite?+

Zum Start reichen 20 bis 30 Fälle, wenn sie die realen Randfälle abdecken statt den Normalfall zu wiederholen. Entscheidend ist nicht die Anzahl, sondern dass jeder produktive Fehlschlag als Fall hinzukommt.

/06Ersetzt Replay einen Testlauf gegen echte Systeme?+

Nein. Replay prüft Entscheidungslogik gegen aufgezeichnete Antworten. Integrationsfehler — geänderte Schemata, neue Fehlercodes, verändertes Verhalten eines Werkzeugs — findet nur ein echter Lauf gegen ein Testsystem.

/07 — 08Überblick

Weiter in der Plattform

$ sec7
/08 — 08Überblick

Lassen Sie uns einen Ihrer Läufe zerlegen

$ sec8
Schicken Sie uns einen Prozess, der heute schon mit KI läuft. Wir instrumentieren ihn in der Sandbox und zeigen Ihnen den Span-Baum, die Kosten je Lauf und die drei Stellen, an denen er still scheitert.
// nächster schritt

Nachvollziehbarkeit klären.

Was ein Agent getan hat, muss nach Wochen noch belegbar sein. Wir klären, welche Spuren Ihre Revision und Ihre Aufsicht dafür brauchen. Ausführlich beschrieben ist das unter Agentic AI.

Betrieb in deutschen Rechenzentren

$ traces --anforderung
Nachweispflichten besprechen → 09571 873149
Termin vereinbaren →
30 Minuten, unverbindlich und direkt mit einem technischen Ansprechpartner.