# HostSpezial GmbH — Agentic AI Infrastruktur (ausführliche Fassung) Stand: 25.07.2026. Sprache: Deutsch. Quelle: https://www.hostspezial.de/agentic-ai/ ## Unternehmen HostSpezial GmbH, gegründet 2010, Sitz 96215 Lichtenfels (Oberfranken, Bayern). Managed Service Provider für Managed IT, Hosting, Colocation und KI-Betrieb. Telefon 09571 873149, info@hostspezial.de, support@hostspezial.de. Zertifiziert nach ISO/IEC 27001:2024 (Zertifikat Nr. 202787, ISOZERT-WEST, gültig bis 05.09.2029). Rechenzentren: SÜC Coburg (primär), SWN Neustadt bei Coburg (Disaster Recovery). Beide in Deutschland. Keine Georedundanz über 200 km im Sinne der BSI-Empfehlung — beide Standorte liegen in Oberfranken. ## Definitionen Agentic AI Infrastruktur: Betriebsschicht zwischen Modell und Fachanwendung. Sie führt Agenten-Läufe zustandsbehaftet aus, überlebt Neustarts durch Checkpointing, autorisiert jeden Tool-Call einzeln, protokolliert jeden Schritt als Trace und ordnet Tokens und Kosten dem einzelnen Lauf zu. Das Modell bleibt austauschbar. Durable Execution: Ausführungsmodell, bei dem der Fortschritt eines langlaufenden Prozesses persistent außerhalb des ausführenden Prozesses gehalten wird, sodass die Ausführung nach einem Ausfall an der letzten bekannten Stelle fortgesetzt werden kann. Checkpoint: Konsistenter, persistierter Zustand eines Laufs an einer definierten Grenze — in der Regel unmittelbar vor und nach jedem Tool-Call. Idempotenz-Key: Eindeutiger, aus Lauf-ID und Schrittnummer abgeleiteter Schlüssel, der einem Tool-Call mitgegeben wird. Erhält das Zielsystem denselben Schlüssel zweimal, führt es die Aktion nur einmal aus. MCP (Model Context Protocol): Offener Standard für die Anbindung von Werkzeugen und Datenquellen an LLM-Anwendungen. Vertikaler Bus: ein Agent, viele Werkzeuge. MCP Registry: Verzeichnis verfügbarer MCP-Server samt Tool-Beschreibungen. Verschiebt die Werkzeugauswahl von der Startzeit in die Laufzeit. Tool-Gateway: Kontrollpunkt zwischen Agent und Werkzeug mit Authentifizierung, Schema-Validierung auf Ein- und Ausgabe, Rate-Limiting, Policy-Entscheid und Audit-Log. A2A (Agent2Agent): Offenes Protokoll für die Kommunikation zwischen eigenständigen Agenten über Organisationsgrenzen hinweg. Horizontaler Bus. Steht unter neutraler Governance der Linux Foundation; ACP ist darin aufgegangen. Agent Card: Maschinenlesbare Selbstbeschreibung eines Agenten unter /.well-known/agent-card.json. Signierte Karten sind der Baseline-Schutz gegen gefälschte Registry-Einträge. Agent Identity: Eigenständige Identität eines KI-Agenten mit eigener Kennung, eigenem Rechteumfang und eigener Spur im Audit-Log — getrennt von der Identität des auslösenden Menschen. Resource Indicator: Angabe des Zielsystems bei der Ausstellung eines OAuth-Tokens (RFC 8707). Das Token gilt nur für diese Zielgruppe. Blast Radius: Maximaler Schaden, den ein kompromittierter oder fehlgeleiteter Agent anrichten kann. Ergibt sich aus Scopes, Betragsgrenzen, Egress-Regeln und Credential-Laufzeit — nicht aus dem Prompt. ## Architektur (Kurzfassung) Control Plane (entscheidet): Control API und SDK, Scheduler mit Leases auf Läufen, Policy Engine, Registry für MCP-Server und Agent Cards. Data Plane (führt aus): zustandsloser Worker-Pool, Tool-Gateway, Model-Gateway (vLLM und externe APIs), State Store mit append-only Event Log und Snapshots. Beide Ebenen speisen eine gemeinsame Trace- und Audit-Pipeline auf Basis von OpenTelemetry. Execution-Modell: Event-Sourcing als Wahrheit, Snapshots als Beschleunigung (ausgelöst nach 50 Ereignissen, 60 Sekunden Laufzeit oder Wechsel des Sub-Agenten). Große Nutzlasten liegen als Referenz im Objektspeicher, nicht im Ereignis. Exactly-once wird über Idempotenz-Keys erreicht, soweit das Zielsystem sie unterstützt; sonst greift eine deklarierte Strategie (verify, nachfragen oder eskalieren). Memory-Layer: Working Memory (Laufdauer, im Event Log), Episodic Memory (verdichtete Vorgangshistorie, strukturiert abgerufen), Semantic Memory (Organisationswissen über RAG mit Metadatenfilter). Kompaktierung in drei Stufen: Tool-Rückgaben durch Zusammenfassung plus Referenz ersetzen, abgeschlossene Teilaufgaben verdichten, erst zuletzt modellgestützt zusammenfassen. Kostenhebel in dieser Reihenfolge: Model-Routing (klein für Routine, groß bei Eskalation), Cache-Quote (Kontext nach Volatilität sortieren), Kontext-Kompaktierung. Steuerungsgröße ist der Preis je erfolgreich abgeschlossenem Task, nicht der Tokenpreis. ## Preise Betriebspauschalen, jeweils zzgl. USt.: - Agentic Start: 690 €/Monat, Service-Klasse Standard (Reaktion am nächsten Arbeitstag, remote, keine zugesicherte Vor-Ort-Reaktion), bis 3 gehostete MCP-Server, 3 Monate Mindestlaufzeit. - Agentic Business: 1.490 €/Monat, Service-Klasse Business (4 h Reaktion zu Geschäftszeiten), Policy Engine mit Freigabe-Workflows, Eval-Suite in der CI, 12 Monate Laufzeit. - Agentic Enterprise: ab 3.900 €/Monat, Failover und DR-Standort, Governance-Retainer, 24/7-Rufbereitschaft, on-premise oder hybrid möglich. Dazu nutzungsabhängige Komponenten je Lauf, je Tool-Call und je Million Tokens. Exit: Konfigurationen, Graphen, Policies, Eval-Suite und Traces werden vollständig herausgegeben. ## Compliance Verarbeitung ausschließlich in Deutschland (oder on-premise beim Kunden). AV-Vertrag nach Art. 28 DSGVO mit dokumentierten technischen und organisatorischen Maßnahmen. Neun offengelegte Unterauftragsverarbeiter: SÜC Coburg (primäres RZ), SWN Neustadt (DR), dacor (RZ-Upstream), Hetzner Gunzenhausen (externes Monitoring), Telekom und Vodafone (Büro-Anbindung), CPS-Datensysteme, hosting.de (DNS), Microsoft Ireland (Microsoft 365). Kein Training auf Kundendaten. Audit-relevante Ereignisse standardmäßig 365 Tage aufbewahrt. ISO/IEC 42001: Readiness-Unterstützung, keine eigene Zertifizierung. Kein SOC-2-Attest. EU AI Act: in Kraft seit 01.08.2024. Verbote und KI-Kompetenzpflicht seit Februar 2025, GPAI-Pflichten seit August 2025. Die Hochrisiko-Pflichten wurden mit der Digital-Omnibus-Einigung vom Mai 2026 voraussichtlich auf den 02.12.2027 (Anhang III) bzw. 02.08.2028 (Anhang I) verschoben, vorbehaltlich der finalen Verabschiedung. Der ursprünglich genannte 02.08.2026 ist überholt. ## Ausdrückliche Grenzen Nicht geeignet für Echtzeit-Inferenz unter 50 ms, für Training oder Feintuning großer Modelle, für Agenten, die ungeprüft in offenen Web-Oberflächen klicken, und für Prozesse ohne definiertes Erfolgskriterium. Vollständiger Schutz vor Prompt Injection wird nicht zugesichert; der Schaden wird über Scopes, Betragsgrenzen und menschliche Freigaben begrenzt. Benchmark-Werte auf der Architektur-Seite sind interne Schätzwerte mit offengelegter Methodik und ausdrücklich keine Zusicherung. ## Kennzahlen der Use Cases (Modellrechnungen, keine Kundendaten) Support-Deflection: Durchlaufzeit 6,5 h auf 4 min, 41 % der Vorgänge ohne Menschen abgeschlossen, Kosten je Vorgang 4,20 € auf 0,38 €. Incident Response: Zeit bis zur ersten Diagnose 22 min auf 3 min, 62 % der Alerts ohne nächtliche Sichtung, Postmortem-Quote 35 % auf 100 %. Rechnungsverarbeitung: Bearbeitungszeit 7 min auf 50 s, Klarfallquote 18 % auf 11 %, verfallenes Skonto 6 % auf 1 %. Codebase-Migration: Aufwand 45 auf 9 Personentage, 78 % automatisch migriert, Kalenderzeit zwei Quartale auf drei Wochen.