HostSpezial Agent Runtime · Managed Service

Jeder Tool-Call autorisiert.
Jeder Lauf wiederherstellbar.
Jeder Euro zugeordnet.

Die HostSpezial Agent Runtime ist die Betriebsschicht zwischen Modell und Fachanwendung: zustandsbehaftete Läufe, ein Gateway vor jedem Tool, Traces je Span — betrieben in deutschen Rechenzentren.

  • < 5 sRecovery
  • 8 msGateway p95
  • 100 %Daten in DE
npx @hostspezial/agentctl init
  • ISO/IEC 27001:2022 zertifiziert
  • Rechenzentren in Deutschland
  • AVV nach Art. 28 DSGVO
TRIGGER webhook invoice.disputed RUN r-8f21c9 REGION eu-de-1 ORCHESTRATOR · DAG planner fan-out 3 retrieval 4 belege · 1 vertrag analysis risiko 0.18 · erstattung action refund ≤ 250 € a2a.handoff dispute-desk signed card ✓ TOOL-LAYER · MCP postgres.query SELECT … FROM orders allow 42 ms stripe.refund amount=189,00 · limit 250,00 allow 310 ms crm.update case=4711 status=resolved allow 88 ms mail.send template=refund_confirm 502 · upstream timeout attempt 1/3 allow 211 ms checkpoint restored · resume @ tool 4 STATUS completed · 2.4 s · 7 tool calls TRACE · OPENTELEMETRY SPAN DAUER agent.run 2 400 ms planner.plan 180 ms tool.postgres.query 42 ms tool.stripe.refund 310 ms tool.crm.update 88 ms tool.mail.send ✗ 502 tool.mail.send ↻ 211 ms TOKENS 0 KOSTEN € 0,000 CACHE-HIT 68 % ROUTING klein → gross ERGEBNIS completed DAUER 2,4 s
Ein Lauf in Zeitraffer — inklusive Fehlschlag bei mail.send und Wiederaufnahme auf dem letzten Checkpoint.

Agentic AI Infrastruktur ist die Betriebsschicht zwischen Modell und Fachanwendung. Sie führt Agenten-Läufe zustandsbehaftet aus, überlebt Neustarts durch Checkpointing, autorisiert jeden Tool-Call einzeln, protokolliert jeden Schritt als Trace und ordnet Tokens und Kosten dem einzelnen Lauf zu. Das Modell bleibt austauschbar.

Das Produkt

Eine Konsole, in der Sie sehen, was Ihre Agenten tun

Kein Framework zum Selbstbauen und kein Beratungsprojekt: Sie bekommen eine betriebsbereite Oberfläche, Ihre Systeme angebunden und einen Betrieb mit Namen dahinter.

console.hostspezial.de/agents m.huber@kunde.de Übersicht Läufe Agenten Werkzeuge Policies Freigaben 2 Kosten Audit-Log EU-DE-1 · COBURG ISO/IEC 27001 Läufe heute alle Agenten RUN AGENT STATUS DAUER CALLS KOSTEN r-8f21c9 refund-agent completed 2,4 s 7 0,031 € r-8f21c4 refund-agent wartet auf Freigabe 4 0,019 € r-8f2199 invoice-agent completed 1,8 s 5 0,024 € r-8f2188 incident-agent wiederaufgenommen 3,1 s 9 0,047 € r-8f2170 migration-agent läuft 41 min 812 12,90 € FREIGABE ERFORDERLICH · LÄUFT AB IN 22:41 H refund-agent · Erstattung 412,00 € über Limit 250,00 € · Bestellung 4711 Freigeben Ablehnen LETZTER LAUF · SPANS agent.run tool.postgres.query tool.stripe.refund tool.mail.send ✗ tool.mail.send ↻ 2 400 ms · 7 calls HEUTE 1.284 Läufe 41 % ohne Menschen abgeschlossen 38,40 € Kosten LÄUFE JE STUNDE SERVICE Verfügbarkeit 99,95 % p95 Laufzeit 4,2 s Offene Freigaben 2 Budget-Cap je Lauf 0,50 € MONATSREPORT juli-2026.pdf herunterladen

Konsole · Ansicht „Läufe“ mit offener Freigabe Daten im Bild sind Beispielwerte

Lieferumfang

Was Sie am ersten Tag bekommen

Sechs Bestandteile, alle im Vertrag benannt. Was nicht enthalten ist, steht auf der Preisseite.

Konsole

Läufe, Agenten, Werkzeuge, Policies und Kosten in einer Oberfläche. Zugang für Ihr Team, Rechte nach Rolle.

ab Tag 1

Angebundene Systeme

Wir binden Ihre Systeme als MCP-Server an — Datenbank, M365, Ticketsystem, ERP. Sieben Server sind Standardkatalog.

2–4 Wochen

Policies und Freigaben

Betragsgrenzen, Scopes und Freigabeschwellen als versionierte Regeln. Jede Entscheidung landet im Audit-Log.

im Betrieb gepflegt

Traces und Kostenausweis

Jeder Tool-Call als Span, Kosten je Lauf, Use Case und Mandant. Export in Ihr eigenes Monitoring.

laufend

Monatlicher Betriebsreport

Verfügbarkeit, Erfolgsquote, Kosten je Task, Vorfälle und Änderungen — als Dokument, das ein Auditor lesen kann.

monatlich

Ansprechpartner

Benannte Personen statt Ticket-Warteschlange. Ab Klasse Business mit 4-Stunden-Reaktion, Enterprise mit 24/7-Rufbereitschaft.

vertraglich
Was sich ändert

Drei Situationen, in denen der Unterschied auffällt

Nachts

Der Lauf überlebt Ihr Deployment

Ein Agent, der 40 Minuten arbeitet, verliert bei einem Neustart nichts. Er setzt auf dem letzten Checkpoint auf — und bucht die Erstattung nicht ein zweites Mal.

Im Audit

Sie können jede Aktion erklären

Wer hat was womit ausgelöst, mit welcher Begründung, wann freigegeben? Steht im Audit-Log, nicht in der Erinnerung eines Kollegen.

Am Monatsende

Die Rechnung überrascht Sie nicht

Budget-Cap je Lauf, Rate-Limit je Werkzeug, Kosten je erfolgreichem Task. Eine Retry-Schleife läuft ins Limit, nicht in Ihre Kostenstelle.

So starten Sie

Erst ein Lauf, dann ein Pilot, dann ein Vertrag

In dieser Reihenfolge — nicht umgekehrt. Sie entscheiden nach dem ersten echten Lauf, nicht nach einer Präsentation.

Schritt 1 · 45 Minuten

Sandbox mit Ihrem Prozess

Wir binden ein System an, schreiben eine Policy und lassen einen echten Vorgang durchlaufen. Sie sehen Trace, Latenzen und Kosten.

kostenfrei, ohne Vorleistung
Schritt 2 · 2–4 Wochen

Pilot mit einem Use Case

Ein Prozess geht produktiv — zunächst lesend, dann mit eng begrenztem Aktionsrecht. Eval-Suite und Freigabewege stehen am Ende.

Aufwand nach Umfang, vorab kalkuliert
Schritt 3 · laufend

Betrieb mit SLA

Wir betreiben, überwachen und dokumentieren. Neue Use Cases kommen kontrolliert dazu.

ab 690 €/Monat zzgl. USt.

Schritt 1 kostet Sie 45 Minuten

Wir brauchen dazu ein System, das der Agent lesen darf, und einen Prozess, den Sie heute manuell erledigen.

Der eigentliche Engpass

Der Prototyp funktioniert. Die Produktion nicht.

Fast nie ist das Modell das Problem. Es sind vier Betriebsfragen, die im Notebook nicht existieren.

Die Plattform

Fünf Schichten, die den Unterschied zwischen Demo und Betrieb ausmachen

Jede Schicht ist einzeln nutzbar. Wer nur ein Tool-Gateway braucht, bekommt ein Tool-Gateway — nicht die ganze Plattform.

Systemkarte

Klicken Sie sich durch den Weg eines Laufs

Zwölf Bausteine, drei Pfade: der Lauf selbst, die Kontrollebene darüber und die Telemetrie darunter. Jeder Baustein führt in die passende Tiefe.

Pfad
prompt checkpoint mcp CONTROL PLANE Konsole · Policies · Freigaben · Audit-Log rechte nach rolle · regeln versioniert EINGANG Auslöser webhook · api zeitplan · queue 02 Orchestrator planner-worker-dag a2a-handoff 01 Runtime durable execution recovery < 5 s 05 Policy Engine entscheid je call allow/deny/ask 03 Tool-Gateway registry · schema auth · rate-limit FREIGABE Mensch im Lauf wartezustand · 24 h MODELLE Modell-Gateway vllm · extern ZUSTAND State-Store event-log · snapshots 04 Observability traces · kosten WERKZEUGE Ihre Systeme postgres · m365 · erp BETRIEB Rechenzentrum Deutschland · SÜC Coburg, DR SWN Neustadt oder on-premise auf Ihrer infrastruktur ISO/IEC 27001:2022
Systemkarte

Der Weg eines Laufs

Von links nach rechts: Ein Ereignis startet den Lauf, der Orchestrator plant, die Runtime führt zustandsbehaftet aus, die Policy Engine entscheidet über jeden Tool-Call, das Gateway spricht mit Ihren Systemen. Klicken Sie einen Baustein an — Sie sehen, woran er hängt.

  • Zwölf Bausteine, drei Pfade
  • Klick, Tab-Taste, Pfeiltasten
  • Esc hebt die Auswahl auf
Vollständige Architektur

Klick oder Tab-Taste wählt einen Baustein · Pfeiltasten wechseln · Esc hebt die Auswahl aufKarte seitlich scrollbar · Tippen wählt einen Baustein, Details erscheinen darunter

  • Stand Mitte 2026MCP ist der De-facto-Standard für die Tool-Anbindung; die Registry verschiebt die Werkzeugauswahl von der Startzeit in die Laufzeit.
  • Protokolle konsolidiertA2A steht unter neutraler Governance der Linux Foundation, ACP ist darin aufgegangen. Signierte Agent Cards sind Baseline-Schutz.
  • Neue RisikoklasseAgentische Lieferkette: Ein MCP-Server, ein Connector oder ein Prompt-Template kann sich zur Laufzeit anders verhalten als deklariert.
Use Cases

Vier Szenarien, die wir konkret gerechnet haben

Jedes mit Ausgangslage, Agenten-Design, Architektur, Code und Ergebnis — inklusive der Fälle, in denen es nicht funktioniert.

Ehrliche Einordnung

Agenten funktionieren dort, wo sich Ergebnisse maschinell prüfen lassen

Das ist das belastbarste Muster aus zwei Jahren Praxis — und die wichtigste Frage bei der Auswahl Ihres ersten Use Case.

Funktioniert

Maschinell prüfbares Ergebnis

Tests laufen durch, Summen stimmen, Schema validiert, Datensatz existiert. Hier arbeiten Agenten zuverlässig und der Nutzen ist messbar.

Braucht Leitplanken

Nur menschlich beurteilbar

Freitext mit Außenwirkung, Ermessensentscheidungen, offene Recherche. Machbar — aber mit Freigaben, und mit deutlich geringerem Ertrag.

Wovon wir abraten

Agenten, die frei in fremden Web-Oberflächen klicken. Entscheidungen mit rechtlicher Außenwirkung ohne menschliche Freigabe. Prozesse ohne definiertes Erfolgskriterium. In allen drei Fällen ist der Betriebsaufwand höher als der Ertrag — unabhängig von der Plattform.

Betrieb und Nachweis

Wer den Betrieb verantwortet, muss ihn auch belegen können

Im DACH-Markt entscheidet häufig nicht das Feature, sondern die Frage, wer bei einem Vorfall mit welchen Nachweisen haftet.

Ehrliche Vergleiche

Drei Wege führen zum selben Ziel. Wir sagen auf jeder Seite dazu, wann der andere Weg der bessere ist.

Häufige Fragen

Was technische Käufer zuerst fragen

Was ist Agentic AI Infrastruktur?

Die Betriebsschicht zwischen Modell und Fachanwendung. Sie führt Agenten-Läufe zustandsbehaftet aus, überlebt Neustarts durch Checkpointing, autorisiert jeden Tool-Call einzeln, protokolliert jeden Schritt als Trace und ordnet Tokens und Kosten dem einzelnen Lauf zu. Das Modell selbst ist dabei austauschbar.

Warum scheitern Agenten in Produktion, obwohl der Prototyp funktioniert?

Weil die Fehlerquellen nicht im Modell liegen, sondern in der Infrastruktur: nicht-deterministische Retries, Zustandsverlust bei Neustarts, Tool-Calls ohne Autorisierungsgrenze, fehlende Traces beim Debuggen und Token-Kosten ohne Deckel. Ein Notebook-Lauf hat keine dieser Anforderungen, ein Produktivsystem alle.

Was bedeutet Durable Execution bei KI-Agenten?

Dass der Fortschritt eines Laufs außerhalb des Prozesses persistiert wird. Fällt der Node aus, wird der Lauf auf dem letzten Checkpoint fortgesetzt statt neu gestartet. Bereits ausgeführte Tool-Calls mit Seiteneffekten werden über Idempotenz-Keys nicht wiederholt. Details im Runtime-Kapitel.

Läuft die Plattform in Deutschland?

Ja. Betrieb und Datenhaltung erfolgen in deutschen Rechenzentren — primär im Rechenzentrum der SÜC Coburg, mit Disaster-Recovery-Standort bei der SWN Neustadt. Alternativ betreiben wir die Plattform on-premise auf Ihrer Infrastruktur. HostSpezial ist nach ISO/IEC 27001:2022 zertifiziert. Details auf der Trust-Seite.

Welche Modelle und Protokolle werden unterstützt?

Modellseitig offene, selbst hostbare Modelle über vLLM sowie externe Anbieter über ein Gateway mit OpenAI-kompatibler API. Protokollseitig MCP für die Tool-Anbindung und A2A für die Kommunikation zwischen Agenten, einschließlich signierter Agent Cards unter /.well-known/agent-card.json.

Was kostet der Betrieb von KI-Agenten?

Die Betriebspauschalen entsprechen den Managed-KI-Klassen: 690 €, 1.490 € und ab 3.900 € pro Monat, jeweils zzgl. USt. Dazu kommen nutzungsabhängige Komponenten je Lauf, je Tool-Call und je Million Tokens. Aussagekräftig ist nicht der Preis je Token, sondern der Preis je erfolgreich abgeschlossenem Task — inklusive der Fehlversuche. Rechner auf der Preisseite.

Wofür ist die Plattform nicht gebaut?

Nicht für Echtzeit-Inferenz unter 50 Millisekunden, nicht für Training oder Feintuning großer Modelle und nicht für Agenten, die ungeprüft in offenen Web-Oberflächen klicken. Sie ist auf serverseitige, mehrstufige Tool-Nutzung mit maschinell prüfbaren Ergebnissen ausgelegt. Der vollständige Abschnitt steht in der Architektur.

Erst ein Lauf, dann ein Vertrag

Wir richten eine Sandbox mit einem Ihrer echten Prozesse ein — ein Tool, eine Policy, ein Trace. Danach wissen Sie, ob der Use Case trägt. Ohne Vorleistung Ihrerseits.

Oder direkt: 09571 873149 · info@hostspezial.de

Aus dem Blog

Die Serie zur Betriebsschicht

Zwölf Beiträge zu den Fragen, die vor dem ersten produktiven Agenten stehen — jeweils mit Rechenbeispiel und ehrlicher Grenze.

Passend dazu bei HostSpezial