KI Full Stack Providing — ein Partner für den gesamten KI-Stack
Sechs Bausteine, ein Vertrag: Beratung, On-Premise-Infrastruktur, KI-System, Gateway, Integration und Betrieb. Kein Zusammensetzen aus vier Angeboten, keine Lücke, in der niemand zuständig ist.
Jeder Baustein ist eine vollwertige Leistung — auch ohne die anderen fünf.
Das Wichtigste auf einen Blick
- Geeignet für
- Unternehmen, die KI im eigenen Haus betreiben wollen — mit eigener Hardware, eigenen Modellen, eigenen Daten
- Ausgangssituation
- KI scheitert selten am Modell, sondern am Betrieb: Wer betreut die Hardware, wer aktualisiert die Modelle, wer haftet für die Nachweise?
- Wir übernehmen
- Sechs Ebenen von der Hardware bis zur Anwendung — jede auch einzeln beauftragbar, mit einem Ansprechpartner von der Strategie bis zur Rufbereitschaft
- Bei Ihnen bleibt
- Ihre Daten und die Entscheidung, welche davon ein Modell sehen darf. Eigentum und Hoheit wechseln nicht.
- Vorhandene Systeme
- Welche Hardware und welche Schnittstellen sich weiterverwenden lassen, klären wir vor dem Angebot. Das Ergebnis steht schriftlich fest, bevor Sie beauftragen.
- Ihr Ergebnis
- Ihre Daten verlassen das Haus nicht. Offene Modelle wie Llama, Mistral, Qwen oder Gemma, wechselbar ohne Anbieterbindung
- Preisrahmen
- Feste Monatspauschale statt Preis je KopfCloud-Abos wie ChatGPT Enterprise oder Microsoft 365 Copilot kosten rund 25–32 € je Mitarbeiter und Monat — jeden Monat, pro Person
- Reaktionszeit
- Betrieb mit Rufbereitschaft nach vereinbarter Serviceklasse
- Dauer
- Sechs Schritte bis zum betriebsbereiten StackHardwarebedarf klären wir vorab — dafür gibt es einen Konfigurator auf dieser Seite
- Erster Schritt
- Gespräch über Anwendungsfälle und Hardware — danach Vorschlag mit Kostenlogik
Warum KI im Alltag scheitert — und was sich ändert.
KI Full Stack Providing setzt dort an: Wir verantworten alle sechs Ebenen – Beratung, Infrastruktur, System, Gateway, Entwicklung und Betrieb. Aufeinander abgestimmt geplant, sauber integriert, durchgängig betreut. Sie haben einen Vertrag, einen Ansprechpartner und ein klares Ergebnis.
Klassisch fragmentiert
- Mehrere Anbieter koordinieren
- Schnittstellen-Lücken
- Schuldzuweisungen bei Störungen
- Niemand betreibt das Ganze
Mit Full Stack Providing
- Ein Partner, ein Vertrag
- Bausteine greifen ineinander
- Klare Verantwortung
- Durchgängig betreut
Eine Verantwortung
Kein Koordinieren mehr zwischen Hardware-Lieferant, Software-Haus und Beratung. Ein Vertrag, ein Ansprechpartner – bei Fragen und Störungen wissen Sie sofort, wen Sie erreichen.
Schneller produktiv
Abgestimmte Bausteine statt Integrationsschleifen zwischen Gewerken. Ein erster nutzbarer Stack steht in Wochen – nicht in Quartalen, in denen die Begeisterung längst verflogen ist.
Volle Datenkontrolle
Der gesamte Stack läuft On-Premise. Kundendaten, Verträge und Wissen verlassen das Haus nicht – die Basis für DSGVO-Konformität und Nachweise nach dem EU AI Act.
Planbare Kosten
Transparenter Projektpreis für den Aufbau, feste monatliche Pauschale für den Betrieb. Keine nutzungsabhängigen Cloud-Rechnungen, die mit jedem neuen Anwendungsfall unkontrolliert wachsen.
Sechs Ebenen — und wie sie zusammenspielen.
KI-Beratung
Bevor Technik gebaut wird, klären wir das Warum: Welche Prozesse lohnen sich, was ist umsetzbar, was bringt es wirtschaftlich.
- Use-Case-Analyse & Priorisierung
- KI-Roadmap mit Aufwand & Nutzen
- Förderprüfung & Wirtschaftlichkeit
KI OnPremise
Die Grundlage: eigene GPU-Server im Haus. Modelle und Daten bleiben in Ihrem Netzwerk – DSGVO-konform und ohne Cloud.
- GPU-Server, dimensioniert auf Ihre Last
- Inferenz-Runtime & Modell-Hosting
- Air-Gapped-Betrieb auf Wunsch
KI-System
Aus Modell und Infrastruktur wird ein nutzbares System: Wissensdatenbank, Assistenten und Agenten, die echte Aufgaben erledigen.
- RAG-Pipeline auf Ihren Dokumenten
- Assistenten & KI-Agenten
- Integration in bestehende Software
KI-Gateway
Der kontrollierte Zugangspunkt: alle Modelle hinter einer API, mit Rechten, Protokollierung und Kostentransparenz.
- Routing über Modelle & Anbieter
- Rollen, Rechte & Audit-Logs
- Kostenkontrolle & Limits
Individuelle KI-Entwicklung
Wo Standardsoftware aufhört: individuelle Tools, Integrationen und Prototypen – KI-gestützt in Tagen statt Monaten umgesetzt, aber versioniert, getestet und sauber in den Stack integriert. Kein Wildwuchs.
- Individuelle Tools & Oberflächen
- Schnittstellen zu Ihren Systemen
- Schnelle Prototypen zum Anfassen
KI-Administration
Damit die KI dauerhaft läuft: Monitoring, Sicherheitsupdates, Modellpflege, Backups und SLA-Support – als Managed Service.
- 24/7-Monitoring & Alerting
- Updates & Modellpflege
- Backup, Recovery & SLA
06 · KI-Administration
Betrieb, Monitoring & SLA – durchgängig über alle Ebenen01 · KI-Beratung
Strategie & Roadmap – gibt dem ganzen Stack die Richtung vor 05KI-Entwicklung
Individuelle Tools, Oberflächen & IntegrationenKI-System
RAG, Wissensdatenbank, Assistenten & AgentenKI-Gateway
Routing, Rechte, Logging & KostensteuerungKI OnPremise
GPU-Server, Inferenz-Runtime & Modell-HostingLesehilfe: Die Infrastruktur trägt den Stack von unten, das Gateway regelt den Zugriff, das KI-System liefert den Nutzen, Individuelle KI-Entwicklung ergänzt Individuelles. Beratung und Administration klammern das Ganze. Jede Ebene ist anklickbar und führt zur Detailseite des Bausteins.
Wie der Stack technisch aufgebaut ist.
Für die Entscheidung reicht der Block oben. Wer den Aufbau fachlich prüfen will — Ihre IT-Leitung, ein Datenschutzbeauftragter, ein Auditor — findet hier die Einzelheiten.
/01So fließt eine Anfrage durch den Stack+
Mitarbeiter
stellt eine Frage im gewohnten ToolKI-Gateway
prüft Rechte, wählt das Modell, protokolliertKI-System · RAG
findet die passenden Stellen im VektorindexModell · GPU
erzeugt die Antwort lokal auf Ihrer HardwareAntwort mit Quelle
landet beim Mitarbeiter – belegt & nachvollziehbarRichtwerte für ein mittelgroßes Modell auf passend dimensionierter Hardware. Die tatsächliche Antwortzeit hängt von Modellgröße, Kontextlänge und Auslastung ab.
/02Ihr gesamter KI-Stack auf einen Blick+
Schematische Darstellung. Den konkreten Funktionsumfang stimmen wir auf Ihren Stack ab.
/03Viele Modelle. Ein Server+
Modellnamen exemplarisch – die konkrete Auswahl richtet sich nach Anwendungsfall, Sprache und Hardware. Alle Modelle laufen lokal auf Ihrem Server.
/04Was unter der Haube des Full Stack läuft+
Infrastruktur & GPU
NVIDIA-GPU-Server mit CUDA-Toolkit, sauberer VRAM-Zuteilung und Container-Isolation. Dimensionierung auf Basis der richtigen GPU-Wahl – mit Reserve für Wachstum.
Inferenz-Runtime & Modelle
Self-hosted LLMs wie Llama oder Mistral auf vLLM und Ollama. Quantisierung mit GGUF, GPTQ und AWQ sowie KV-Cache für mehr Durchsatz pro GPU.
RAG & Wissens-Retrieval
Eine RAG-Pipeline verknüpft Ihre Dokumente mit dem Modell: deutsche Embedding-Modelle, eine Vektordatenbank und geprüfte Retrieval-Qualität.
Gateway & Governance
Ein Gateway mit OpenAI-kompatibler API bündelt alle Modelle: rollenbasierte Rechte, Audit-Logs, Rate-Limits und Kostentransparenz pro Team.
Individuelle KI-Entwicklung & Custom Dev
Individuelle Tools entstehen mit einem on-premise Coding-Assistenten. Schnittstellen, Oberflächen und Automatisierungen werden versioniert und sauber in den Stack integriert.
LLMOps & Observability
Im Betrieb sorgt strukturiertes LLMOps für Stabilität: Latenz-Perzentile, Token-Durchsatz, Evaluierung und schwellwertbasiertes Alerting über alle Ebenen.
Der Stack in Komponenten.
Welche Ebene welcher Baustein abdeckt – und mit welchen Technologien wir sie umsetzen.
| Ebene | Baustein | Technologien & Komponenten |
|---|---|---|
| Strategie | KI-Beratung | Use-Case-Mapping, ROI-Modell, Roadmap, Förderprüfung |
| Infrastruktur | KI OnPremise | NVIDIA-GPU-Server, CUDA, Docker, Air-Gap-Option |
| Inferenz & Modelle | KI-System | vLLM, Ollama, Llama / Mistral, GGUF- & AWQ-Quantisierung |
| Wissen & Retrieval | KI-System | RAG-Pipeline, Vektordatenbank, deutsche Embedding-Modelle |
| Zugriff & Governance | KI-Gateway | OpenAI-kompatible API, Routing, RBAC, Audit-Logs |
| Entwicklung | Individuelle KI-Entwicklung | On-Prem Coding-Assistent, individuelle Tools & Schnittstellen |
| Betrieb | KI-Administration | Monitoring, Observability, LLMOps, Backup & SLA |
/05Bereit für den Konzern-Einsatz+
Single Sign-On & Identity
Anmeldung und Rechte direkt aus Ihrem bestehenden Verzeichnis: Active Directory beziehungsweise Entra ID, SAML 2.0 und OIDC, automatische Nutzer-Provisionierung über SCIM. Kein zweites Identitätssilo, kein manuelles Anlegen von Konten.
Rollen, Rechte & Audit
Feingranulares Rollen- und Rechtemodell pro Team und Anwendungsfall über das Gateway, lückenlose Audit-Logs und nachvollziehbare Protokollierung jeder Anfrage – die Basis für interne Revision und externe Prüfungen.
Mandanten- & standortfähig
Getrennte Mandanten für Tochtergesellschaften, Geschäftsbereiche und Abteilungen – mit eigenen Daten, Rechten und Modellen. Der Stack lässt sich standortübergreifend über mehrere Werke und Niederlassungen hinweg betreiben.
Hochverfügbarkeit & DR
Redundante GPU-Knoten, Failover und ein zweiter Rechenzentrumsstandort für Disaster Recovery. Der Betrieb läuft gegen definierte Verfügbarkeits- sowie RTO/RPO-Ziele – passend zur gewählten SLA-Klasse.
ISMS & ISO 27001
Betrieb durch einen nach ISO/IEC 27001:2024 zertifizierten Managed Service Provider: gehärtete Systeme, dokumentierte Prozesse und ein gelebtes Informationssicherheits-Managementsystem – anschlussfähig an Ihre Audits, ISO- und Compliance-Nachweise.
Vendor-Risk & Verträge
Ein deutscher Vertragspartner mit eigenem Rechenzentrumsbetrieb, AVV nach DSGVO und klaren Verantwortlichkeiten. Wir unterstützen die Security-Assessments und Lieferanten-Fragebögen Ihrer Einkaufs- und Compliance-Abteilung – statt Sie an mehrere Sub-Anbieter zu verweisen.
Welche Ausbaustufen Sie brauchen, richtet sich nach Größe, Standorten und Compliance-Anforderungen – wir legen sie gemeinsam in der Architektur-Phase fest.
/06Wie viel Hardware braucht Ihr Stack?+
| Modellklasse | Typischer Einsatz | GPU-Auslegung (Richtwert) | Gleichzeitige Nutzer |
|---|---|---|---|
| 7–8 B Parameter | Standard-Assistenz, Textentwürfe, einfache Recherche | 1 GPU · 24 GB VRAM | bis ~20 |
| 13–14 B Parameter | anspruchsvolle Antworten, größere Wissensbasis | 1 GPU · 48 GB VRAM | bis ~40 |
| 70 B Parameter | höchste Antwortqualität, komplexe Fachfragen | 2 GPUs · je 48 GB VRAM | 40 und mehr |
| Multi-Modell-Cluster | mehrere Modelle parallel, Lastspitzen abfangen | mehrere GPU-Knoten hinter dem Gateway | horizontal skalierbar |
| Enterprise · Multi-Site | konzernweiter Betrieb, Mandanten & Standorte | HA-Cluster + zweiter RZ-Standort (DR) | 1.000+ · standortübergreifend |
Richtwerte für quantisierte Open-Source-Modelle. Die genaue Auslegung ergibt sich aus Lastprofil, Kontextlänge und Antwortzeit-Zielen – auf Basis der richtigen GPU-Wahl für KI-Server.
/07Ein Stack, der sich selbst meldet+
Schematische Darstellung. Im Betrieb läuft die Überwachung automatisiert – Sie erhalten Reports, keine Kommandozeile.
/08KI Full Stack Providing verständlich erklärt+
KI Full Stack Providing bezeichnet die schlüsselfertige Bereitstellung einer kompletten Lösung für Künstliche Intelligenz durch einen einzigen Anbieter. Statt Hardware, Software, Beratung, Entwicklung und Betrieb getrennt einzukaufen, erhalten Unternehmen den gesamten KI-Stack aus einer Hand – von der Strategie bis zum laufenden Betrieb. ki·spezial tritt dabei als KI-Komplettanbieter, KI-Systemhaus und KI-Generalunternehmer zugleich auf und verantwortet jede Ebene der Lösung.
Was unterscheidet Full Stack Providing von klassischer KI-Beratung?
Eine reine KI-Beratung endet mit einem Konzept – die Umsetzung bleibt beim Unternehmen oder verteilt sich auf weitere Dienstleister. Full Stack Providing geht den ganzen Weg: Beratung, On-Premise-Infrastruktur, KI-System mit RAG, KI-Gateway, individuelle Entwicklung per Individuelle KI-Entwicklung und der Betrieb über die KI-Administration greifen als ein durchgängiger Prozess ineinander. Das Ergebnis ist keine Empfehlung, sondern eine produktive, betreute KI.
Für welche Unternehmen eignet sich ein KI-Full-Stack?
Full Stack Providing richtet sich an mittelständische Unternehmen, die Künstliche Intelligenz ernsthaft einsetzen wollen, aber keine eigene KI-Abteilung mit GPU-, LLMOps- und RAG-Kompetenz aufbauen können oder wollen. Besonders gefragt ist das Modell dort, wo Datenschutz nicht verhandelbar ist – etwa bei Kanzleien, Arztpraxen, Versicherungen, Maschinenbauern und KRITIS-Betreibern. Wer eine datenschutzkonforme ChatGPT-Alternative sucht, findet im Full Stack die organisatorische Antwort darauf.
Warum On-Premise das Fundament jedes Full Stack ist
Der Stack wird auf eigener Hardware im Haus betrieben. Sprachmodelle, Dokumente und Vektordatenbanken bleiben im Unternehmensnetzwerk, es entsteht keine Abhängigkeit von US-Cloud-Diensten. Damit ist On-Premise KI nicht nur eine technische, sondern eine strategische Entscheidung: Sie sichert digitale Souveränität, erfüllt die DSGVO und schafft die Nachweisbarkeit, die der EU AI Act verlangt. Ob sich der Aufwand lohnt, lässt sich vorab mit dem ROI-Rechner und dem KI-Schnellcheck einschätzen.
Was 2026 regulatorisch auf Unternehmen zukommt
Der regulatorische Druck steigt – und spielt einem souveränen Stack in die Hände. Die KI-Kompetenzpflicht aus dem EU AI Act (Art. 4) gilt bereits seit Februar 2025: Wer KI einsetzt, muss seine Mitarbeitenden nachweislich schulen. Die strengeren Pflichten für Hochrisiko-Anwendungen wurden im Zuge des „Digital Omnibus" auf Ende 2027 verschoben, die Richtung bleibt aber klar. Parallel ist das NIS2-Umsetzungsgesetz in Deutschland in Kraft und erfasst erstmals viele Mittelständler – mit Anforderungen an Risikomanagement, Monitoring und Meldewege. Ein On-Premise-Stack lässt sich nahtlos in Ihr eigenes Sicherheits-Monitoring einbinden und erspart Ihnen Drittlandtransfer- und Auftragsverarbeitungs-Themen, die bei US-Cloud-KI sonst zu klären wären. Den Strategie- und Konzeptionsteil decken zudem Förderprogramme wie die BAFA-Beratungsförderung häufig ab – wir prüfen das im Rahmen der KI-Beratung mit Ihnen.
/09Was dabei herauskommt — in drei Szenarien+
Technische Dokumentation in Sekunden
Servicetechniker suchen Informationen in tausenden Seiten Handbüchern, Stücklisten und Konstruktionsdokumenten – Wissen, das nicht in fremde Hände darf.
On-Premise-Infrastruktur, KI-System mit RAG über die gesamte Dokumentation, Gateway für die Werks-IT und ein per Individuelle KI-Entwicklung gebautes Such-Tool.
Antworten mit Quellenangabe in Sekunden – das Konstruktions-Know-how bleibt vollständig im Haus.
Akten und Schriftsätze ohne Cloud
Mandantendaten dürfen die Kanzlei nicht verlassen, öffentliche KI-Dienste sind aus berufsrechtlichen Gründen tabu.
Air-Gapped On-Premise-KI, KI-System mit RAG über den Aktenbestand, Administration mit lückenlosem Audit-Log.
Recherche und Entwurfshilfe – DSGVO- und berufsrechtskonform, ohne dass ein Dokument das Haus verlässt.
Anfragen bearbeiten mit Nachweis
Hohe Anfragelast, strenge regulatorische Vorgaben und knappe IT-Ressourcen treffen aufeinander.
Full Stack mit Gateway-Rechten je Fachbereich, Assistenten für die Sachbearbeitung und Managed-Betrieb mit Nachweisen nach EU AI Act.
Spürbare Entlastung der Sachbearbeitung – bei vollständiger Protokollierung und digitaler Souveränität.
Schematisches Beispiel. Welche Quellen, Tonalität und Oberfläche Ihr Assistent nutzt, legen wir gemeinsam fest.
/10Drei Wege — und ein Konfigurator+
| Leistung | Einzel-Baustein | Full Stack Providing Empfohlen | Managed Full Stack |
|---|---|---|---|
| Strategie & Beratung | einzeln buchbar | enthalten | enthalten & laufend |
| On-Premise-Infrastruktur | einzeln buchbar | enthalten | enthalten |
| KI-System & RAG | einzeln buchbar | enthalten | enthalten |
| KI-Gateway | optional | enthalten | enthalten |
| Individuelle KI-Entwicklung | einzeln buchbar | enthalten | enthalten & Weiterentwicklung |
| Laufender Betrieb | – | Übergabe & Doku | 24/7 Managed-Betrieb |
| Architektur abgestimmt | je Baustein | gesamter Stack | gesamter Stack |
| Ansprechpartner | pro Baustein | ein Projektleiter | dediziertes Team |
| Abrechnung | pro Leistung | Projektpreis | Projekt + monatliche Pauschale |
Sie starten mit einem Baustein und wachsen in den Full Stack hinein – oder umgekehrt. Konkrete Konditionen nach einem kostenlosen Erstgespräch.
Ihr konfigurierter Stack
Aktualisiert sich live mit Ihrer Auswahl.
Unverbindlich · Richtwerte zur Orientierung, keine endgültige Kalkulation
In sechs Schritten zum betriebsbereiten Stack.
Assessment & Strategie
Wir analysieren Prozesse, Use Cases und Voraussetzungen und leiten eine priorisierte KI-Roadmap ab.
Architektur & Dimensionierung
Wir entwerfen die Stack-Architektur und dimensionieren GPU-Hardware, Modelle und Gateway passgenau.
Infrastruktur-Aufbau
Die On-Premise-Infrastruktur wird aufgebaut, gehärtet und mit der Inferenz-Runtime in Betrieb genommen.
System & Individuelle KI-Entwicklung
KI-System, RAG-Pipeline und individuelle Tools werden umgesetzt und an Ihre Prozesse angepasst.
Integration & Go-Live
Gateway, Rechte und Schnittstellen werden integriert, getestet und kontrolliert in Produktion gebracht.
Betrieb & Weiterentwicklung
Die KI-Administration übernimmt Monitoring, Updates und Support – und entwickelt den Stack weiter.
Was es kostet — und wie es sich gegen Cloud-KI rechnet.
Feste Pauschale statt Pro-Kopf-Abo
Cloud-KI-Abos wie ChatGPT Enterprise oder Microsoft 365 Copilot kosten rund 25–32 € pro Mitarbeiter und Monat – jeden Monat, pro Person. Ihr On-Premise-Stack läuft als feste Monatspauschale, unabhängig von Nutzerzahl und Anfragevolumen. Je mehr Mitarbeiter die KI nutzen, desto deutlicher der Vorteil.
Hardware, die Ihnen gehört
Statt dauerhafter Cloud-Miete investieren Sie einmal in GPU-Infrastruktur in Ihrem Haus. Bei solider Auslastung amortisiert sich On-Premise gegenüber laufenden Cloud-Kosten als Richtwert meist binnen ein bis zwei Jahren – danach sinken die Stückkosten je Anfrage weiter.
Keine bösen Überraschungen
Kein Token-Zähler, keine nutzungsabhängige Rechnung, die mit jedem neuen Anwendungsfall unkontrolliert wächst. Genau daran scheitern viele Cloud-KI-Projekte: Die Kosten steigen mit der Nutzung – planbare TCO ist die Antwort darauf.
Ehrlich gerechnet
On-Premise lohnt sich ab einer gewissen Auslastung – bei sehr kleiner Nutzung kann die Cloud günstiger sein. Wir rechnen Ihnen beide Wege transparent vor und empfehlen, was zu Ihrer Größe passt, statt On-Premise um jeden Preis zu verkaufen.
Richtwerte zur Einordnung – die verbindliche Kalkulation erstellen wir nach einem kostenlosen Erstgespräch, ohne versteckte Kosten.
| Kriterium | Public-Cloud-KI | Eigenbau im Haus | Full Stack Providing ki·spezial |
|---|---|---|---|
| Datenstandort | Anbieter-Cloud, oft USA | im Haus | im Haus, On-Premise |
| Anlaufzeit | schnell, Datenschutz offen | Monate bis Jahre | wenige Wochen |
| Eigenes KI-Know-how nötig | mittel | hoch (GPU, LLMOps, RAG) | gering |
| Anpassbarkeit an Ihre Prozesse | begrenzt | hoch | hoch |
| Kostenmodell | nutzungsabhängig, schwer planbar | hohe Anfangsinvestition | Projektpreis + feste Pauschale |
| Verantwortung im Betrieb | Anbieter – aber Blackbox | komplett bei Ihnen | bei ki·spezial, transparent |
| Lock-in-Risiko | hoch | niedrig | niedrig, offene Modelle |
Full Stack Providing verbindet die Datenhoheit des Eigenbaus mit der Geschwindigkeit der Cloud – ohne dass Sie selbst KI-Spezialisten einstellen müssen.
Häufige Fragen zum KI Full Stack Providing.
/01Was bedeutet KI Full Stack Providing genau?+
KI Full Stack Providing bedeutet, dass ein einziger Partner den kompletten KI-Stack liefert und betreibt: von der strategischen Beratung über die On-Premise-Infrastruktur, das eigentliche KI-System und das Gateway bis zur individuellen Entwicklung per Individuelle KI-Entwicklung und zum laufenden Betrieb durch die KI-Administration. Sie koordinieren keine Einzelgewerke mehr – Sie haben einen Vertrag und einen Ansprechpartner für die gesamte KI.
/02Aus welchen Bausteinen besteht der KI Full Stack?+
Der Full Stack besteht aus sechs Bausteinen: KI-Beratung (Strategie und Roadmap), KI OnPremise (eigene GPU-Infrastruktur), KI-System (RAG, Assistenten und Agenten), KI-Gateway (zentraler, kontrollierter Zugang), Individuelle KI-Entwicklung (individuelle Entwicklung) und KI-Administration (Monitoring, Updates und Betrieb). Die Bausteine greifen technisch ineinander, lassen sich aber auch einzeln buchen.
/03Müssen wir alle sechs Bausteine buchen?+
Nein. Jeder Baustein ist auch einzeln verfügbar. Der Vorteil des Full Stack Providing liegt darin, dass die Bausteine aufeinander abgestimmt geplant, dimensioniert und integriert werden – ohne Schnittstellenlücken und ohne Schuldzuweisungen zwischen mehreren Anbietern. Sie können klein starten und den Stack später erweitern.
/04Bleiben unsere Daten beim Full Stack Providing im Haus?+
Ja. Der gesamte Stack ist auf On-Premise-Betrieb ausgelegt. Modelle, Dokumente und Vektordatenbanken laufen auf Ihrer Infrastruktur in Ihrem Netzwerk. Es besteht keine Abhängigkeit von US-Cloud-Diensten. Auf Wunsch betreiben wir den Stack vollständig air-gapped, also ohne jede Internetverbindung.
/05Übernehmen Sie auch eine bereits bestehende KI-Umgebung?+
Ja. Wir übernehmen bestehende KI-Installationen und ergänzen fehlende Bausteine. Vor der Übernahme führen wir ein Assessment durch: Wir prüfen Architektur, Sicherheitsstand, Infrastruktur und Dokumentation, halten den Ist-Zustand fest und definieren gemeinsam, welche Stack-Ebenen ausgebaut oder in den Betrieb übernommen werden.
/06Wie lange dauert der Aufbau eines kompletten KI Full Stack?+
Das hängt vom Umfang ab. Ein erster produktiver Stack mit Infrastruktur, KI-System und Gateway ist je nach Hardware-Verfügbarkeit typischerweise innerhalb von vier bis acht Wochen einsatzbereit. Per Individuelle KI-Entwicklung lassen sich erste nutzbare Tools oft schon in wenigen Tagen zeigen. Den konkreten Zeitplan legen wir nach dem Assessment fest.
/07Was kostet KI Full Stack Providing?+
Der Projektanteil (Beratung, Infrastruktur, System, Gateway, Entwicklung) wird als transparenter Projektpreis kalkuliert, der laufende Betrieb über die KI-Administration als planbare monatliche Pauschale. Die Höhe richtet sich nach Anzahl der Nutzer, Modellgrößen und Service-Level. Nach einem kostenlosen Erstgespräch erhalten Sie ein verbindliches Angebot ohne versteckte Kosten.
/08Brauchen wir für den Full Stack eine eigene IT- oder KI-Abteilung?+
/09Ist KI Full Stack Providing über die BAFA-Förderung förderfähig?+
Beratungs- und Konzeptionsleistungen sind je nach Programm förderfähig. Im Rahmen der KI-Beratung prüfen wir mit Ihnen passende Förderprogramme und unterstützen bei der Antragstellung. Hardware- und Betriebskosten sind in der Regel nicht förderfähig, der Strategie- und Planungsanteil des Full Stack jedoch häufig.
/10Welche Sprachmodelle kommen im KI Full Stack zum Einsatz?+
Wir setzen auf offene, selbst hostbare Modelle wie Llama oder Mistral in verschiedenen Größen von 7 bis 70 Milliarden Parametern – je nach Anforderung an Antwortqualität und Antwortzeit. Die Modelle laufen quantisiert auf Ihren GPUs. Über das KI-Gateway lassen sich mehrere Modelle parallel betreiben und je Anwendungsfall gezielt ansteuern.
/11Wie fügt sich der Full Stack in unsere bestehende IT ein?+
Der Stack wird in Ihr Netzwerk integriert und über das KI-Gateway mit einer OpenAI-kompatiblen Schnittstelle bereitgestellt. Bestehende Software, Intranet-Anwendungen und Fachsysteme können diese Schnittstelle nutzen. Active Directory beziehungsweise vorhandene Rechte- und Rollensysteme binden wir für Anmeldung und Berechtigungen an.
/12Was passiert, wenn wir später wachsen oder neue Use Cases haben?+
Der Full Stack ist auf Erweiterung ausgelegt. Neue Anwendungsfälle werden über die KI-Beratung priorisiert, per Individuelle KI-Entwicklung umgesetzt und in den laufenden Betrieb übernommen. Die Infrastruktur lässt sich um weitere GPU-Knoten ergänzen, das Gateway skaliert die Last horizontal. Sie wachsen, ohne den Stack neu aufsetzen zu müssen.
/13Geht der Full Stack auch hybrid – mit Cloud-Modellen, wo es passt?+
Ja. On-Premise ist die Standardeinstellung, weil sensible Daten so das Haus nicht verlassen – Pflicht ist es nicht. Über das KI-Gateway lassen sich bei Bedarf auch externe Modelle anbinden, etwa für unkritische Aufgaben oder Spitzenlasten. So bleiben vertrauliche Daten lokal, während Sie für einzelne Anwendungsfälle gezielt Cloud-Leistung dazuschalten können. Welche Workloads on-premise bleiben und welche hybrid laufen, entscheiden Sie pro Anwendungsfall – kontrolliert und protokolliert über ein zentrales Gateway.
/14Lässt sich der Stack an unser SSO und Active Directory / Entra ID anbinden?+
Ja. Anmeldung und Berechtigungen laufen über Ihr bestehendes Verzeichnis – Active Directory oder Entra ID, per SAML 2.0 oder OIDC. Nutzer und Gruppen lassen sich über SCIM automatisch provisionieren, sodass Ein- und Austritte sowie Rollenänderungen ohne manuelle Pflege übernommen werden. Es entsteht kein zweites Identitätssilo, und die Rechte im KI-Gateway folgen Ihren bestehenden Rollen.
/15Ist der Stack mandantenfähig und über mehrere Standorte betreibbar?+
Ja. Für Konzerne und Unternehmensgruppen richten wir getrennte Mandanten je Tochtergesellschaft, Geschäftsbereich oder Abteilung ein – mit eigenen Daten, Modellen und Rechten. Der Stack kann an einem zentralen Standort gebündelt oder über mehrere Werke und Niederlassungen verteilt betrieben werden. Die genaue Architektur – zentral, verteilt oder gemischt – legen wir nach Ihren Anforderungen an Latenz, Datentrennung und Verfügbarkeit fest.
/16Wie sind Hochverfügbarkeit, SLA und Disaster Recovery geregelt?+
Der Stack wird redundant ausgelegt: mehrere GPU-Knoten mit Failover und ein zweiter Rechenzentrumsstandort für Disaster Recovery. Der Betrieb erfolgt über die KI-Administration gegen vereinbarte Verfügbarkeits- sowie RTO/RPO-Ziele – in der passenden Service-Klasse inklusive zugesicherter Reaktionszeiten. HostSpezial betreibt die Plattform als nach ISO/IEC 27001:2024 zertifizierter Managed Service Provider aus deutschen Rechenzentren.
/17Unterstützen Sie Security-Assessments und Lieferanten-Fragebögen?+
Ja. Sie haben einen deutschen Vertragspartner mit eigenem Rechenzentrumsbetrieb, AVV nach DSGVO und klar dokumentierten Verantwortlichkeiten. Wir liefern Ihrer Einkaufs-, IT-Sicherheits- und Compliance-Abteilung die nötigen Nachweise zu, beantworten Security-Fragebögen und stehen für Audits bereit – ohne dass Sie sich durch mehrere Sub-Anbieter arbeiten müssen.
Gesamten KI-Stack besprechen.
Hardware, Modelle, Anbindung und Betrieb hängen zusammen. Wir klären, welche Teile Sie selbst halten wollen und welche wir übernehmen. Ausführlich beschrieben ist das unter KI On-Premise.
Betrieb in deutschen Rechenzentren
