Zum Inhalt springen
Alle Systeme betriebsbereitStatusLooking GlassGlossar
IT-Check →
Start / Lösungen / Incident Response mit Freigabe

Incident Response mit Freigabe

Nachts um drei ist die knappste Ressource nicht Rechenleistung, sondern Aufmerksamkeit. Ein Agent, der Alerts korreliert, Logs liest und einen begründeten Rollback vorschlägt, verkürzt die Zeit bis zur Entscheidung — die Entscheidung selbst trifft weiterhin ein Mensch.

Geeignet fürBetriebsteams mit Rufbereitschaft, deren Systeme über Prometheus und Wazuh sauber instrumentiert sind

Guardrails: keine freien Kommandos, jeder Fall im Trace nachvollziehbar
ECKDATEN
340 Alertsje Monat nach Deduplizierung
6 % echte Fällerund 20 Vorgänge, der Rest ist Rauschen
22 min Medianbisherige Zeit bis zur ersten Reaktion, nachts länger
62 % gebündeltals bekanntes Muster in den Morgenbericht statt Weckruf
use case incident responseLive
ASCII-Grafik: eine Sirene neben einer ansteigenden Zeitachse — Titelbild zum Thema Incident Response mit Freigabe
korrelationbekannte muster gebündelt statt geweckt
tracejeder gebündelte fall bleibt nachvollziehbar
remediate-agentnur benannte kommandos, keine freien
grenzeursachen außerhalb instrumentierter systeme
betrieb durch hostspezial
Alertvolumen 340 je MonatEchte Fälle 6 % — rund 20Median bisher 22 Minuten bis zur ReaktionGebündelt 62 % in den Morgenbericht
AUF EINEN BLICK

Das Wichtigste auf einen Blick

Geeignet für
Betriebsteams mit Rufbereitschaft, deren Systeme über Prometheus und Wazuh sauber instrumentiert sind
Ausgangssituation
Im Beispiel: 340 Alerts, davon nur 6 % echte Vorfälle, 22 Minuten Median bis zur ersten Diagnose
Wir übernehmen
Korrelation, Diagnose mit Konfidenzangabe, Postmortem-Entwurf und genau vier benannte Maßnahmen, jede nach Freigabe
Bei Ihnen bleibt
Ihre Daten und die Entscheidung, welche davon ein Modell sehen darf. Eigentum und Hoheit wechseln nicht.
Vorhandene Systeme
Welche Hardware und welche Schnittstellen sich weiterverwenden lassen, klären wir vor dem Angebot. Das Ergebnis steht schriftlich fest, bevor Sie beauftragen.
Ihr Ergebnis
Nachts wird seltener geweckt. Im Beispiel gingen 62 % der Alerts gebündelt in den Morgenbericht
Preisrahmen
ab 690 € im Monat (Einstiegsklasse)Business 1.490 €, Enterprise 3.900 €; im Beispiel 0,40 € Modellbudget je Vorfall
Reaktionszeit
30 Minuten Freigabefrist in der Rufbereitschaft, danach verfällt der Vorschlagfür die Plattform zugesichert 4 Stunden (Professional), 1 Stunde (Enterprise)
Dauer
Vier Wochen nur mitlesend, dann entscheiden Sie über Aktionsrechte12 Monate Regellaufzeit, 3 Monate Kündigungsfrist
Erster Schritt
Wir schalten den Agenten beobachtend auf Ihre Alerts und vergleichen seine Diagnosen mit Ihren Befunden
Beobachtungsphase besprechen → 09571 873149 Ihr Ansprechpartner: Sales-Team, Beratung und Angebot
/01 — 06Überblick

1. Ausgangslage

$ sec1
Ausgangslage vor dem Agenten-Einsatz — Modellwerte aus Projekterfahrung, keine gemessenen Kundendaten
KennzahlWertAnmerkung
Alerts je Monat340nach Deduplizierung
davon echte Vorfälle6 %rund 20 Fälle
Zeit bis zur ersten Diagnose22 minMedian, nachts deutlich länger
Postmortems geschrieben35 %der Rest bleibt undokumentiert
/02 — 06Überblick

2. Agent-Design

$ sec2
Guardrails: Der remediate-Agent kennt keine freien Kommandos, sondern nur benannte Maßnahmen mit festen Parametern — kein ssh, keine Shell. Maßnahmen sind auf die Systeme des betroffenen Dienstes begrenzt. Jede Ausführung erzeugt einen Eintrag im Audit-Log mit der Person, die freigegeben hat.
22 → 3 minbis Diagnose
62 %ohne Weckruf
4Maßnahmen
Bewusste Entscheidung

Wir bauen hier keinen selbstheilenden Betrieb. Ein Agent, der nachts eigenmächtig zurückrollt, kann aus einer Teilstörung einen Totalausfall machen. Der Gewinn liegt in der Diagnosezeit, nicht in der Autonomie.

/03 — 06Überblick

3. Architektur

$ sec3

alerts

prometheus · wazuh

correlate

read:metrics, alerts

diagnose

logs · deployments

freigabe

rufbereitschaft

remediate

4 maßnahmen
alerts prometheus · wazuh correlate read:metrics, alerts diagnose logs · deployments freigabe rufbereitschaft remediate 4 maßnahmen postmortem-entwurf aus trace & audit-log KEINE FREIEN KOMMANDOS · NUR BENANNTE MASSNAHMEN MIT FESTEN PARAMETERN
Die Freigabe sitzt zwischen Diagnose und Maßnahme — nicht davor und nicht danach.
/04 — 06Überblick

4. Code

$ sec4
code
import { defineAgent, step, approval } from "@hostspezial/agent-sdk";

// Der Agent kennt genau diese vier Massnahmen. Kein freies
// Kommando, keine Shell — das ist der eigentliche Guardrail.
const ACTIONS = ["rollback_deployment", "restart_service",
                 "drain_node", "scale_up"] as const;

export default defineAgent({
  name: "incident-responder",
  budget: { eur: 0.40, wallClockMs: 600_000 },

  async run(ctx, alert) {
    const cluster = await step(ctx, "correlate", () =>
      ctx.tools.prometheus.window({ service: alert.service, minutes: 30 }));

    const hypothesis = await step(ctx, "diagnose", { model: "gross" }, () =>
      ctx.reason({ cluster, deployments: ctx.tools.git.recent(alert.service) }));

    // Unter 0.7 Konfidenz gibt es keinen Vorschlag, sondern eine
    // Zusammenfassung. Ein unsicherer Vorschlag kostet mehr Zeit,
    // als er spart — er muss zusaetzlich widerlegt werden.
    if (hypothesis.confidence < 0.7) return { summary: hypothesis.text };

    const ok = await approval(ctx, {
      queue: "oncall", ttlMinutes: 30,
      proposal: { action: hypothesis.action, reason: hypothesis.text },
    });
    if (!ok.approved) return { status: "declined", by: ok.actor };

    await step(ctx, "remediate", { idempotencyKey: `${ctx.runId}:fix` }, () =>
      ctx.tools.ops.execute(hypothesis.action, { service: alert.service }));

    return step(ctx, "postmortem", () => ctx.writePostmortem(ctx.runId));
  },
});
/05 — 06Überblick

5. Ergebnis

$ sec5
Die mittlere Zahl bedeutet nicht, dass 62 Prozent der Alerts ignoriert werden. Sie bedeutet, dass der Agent sie korreliert, als bekanntes Muster einordnet und gebündelt in den Morgenbericht schreibt — statt jemanden zu wecken. Jeder dieser Fälle bleibt im Trace nachvollziehbar.

Funktioniert nicht bei …

… Störungen, deren Ursache außerhalb der instrumentierten Systeme liegt — ein Netzproblem beim Provider sieht der Agent nur als Symptom. … Erstvorfällen ohne Vergleichsdaten: Die Diagnosequalität hängt an der Historie. … Umgebungen ohne saubere Deployment-Historie; ohne die Frage „was hat sich zuletzt geändert“ fällt der wichtigste Hinweis weg. Und der Agent ersetzt keine Rufbereitschaft — er bereitet ihre Entscheidung vor.

/06 — 06Überblick

Erst mitlesen, dann mitentscheiden

$ sec6
Wir schalten den Agenten zunächst nur beobachtend auf Ihre Alerts. Nach vier Wochen vergleichen Sie seine Diagnosen mit dem, was Ihr Team tatsächlich gefunden hat — und entscheiden dann über Aktionsrechte.
// nächster schritt

Freigabewege festlegen.

Welche Schritte ein Agent im Vorfall allein gehen darf und wo ein Mensch zustimmen muss, gehört vor den ersten Einsatz geklärt. Ausführlich beschrieben ist das unter Agentic AI.

Betrieb in deutschen Rechenzentren

$ freigaben --entwurf
Freigabewege besprechen → 09571 873149
Termin vereinbaren →
30 Minuten, unverbindlich und direkt mit einem technischen Ansprechpartner.