Zum Inhalt springen
Alle Systeme betriebsbereitStatusLooking GlassGlossar
IT-Check →
Start / Lösungen / KI On-Premise

KI On-Premise: Rechenleistung, die Ihnen gehört.

Large Language Models auf eigenen Enterprise-GPU-Servern — im deutschen Rechenzentrum oder in Ihrem Serverraum. Kein Token-Zähler, kein Modellwechsel über Nacht, kein Byte außerhalb Ihres Netzes.

ECKDATEN
3.900Token/s gemessen, Qwen3 27B
0Token-Kosten pro Anfrage
100 %Verarbeitung im eigenen Netz
DERechenzentrum Coburg
ki-on-premiseLive
ASCII-Grafik: ein Datenfluss zwischen Modell, Server und Anwendung — Titelbild zum Thema KI On-Premise
GPU-ServerH100 · L40S · RTX 6000 Ada
ModelleQwen3 · Llama · Mistral · GPT-OSS
BetriebRechenzentrum Coburg oder Ihr Serverraum
betrieb durch hostspezial
Token/s gemessen, Qwen3 27B 3.900Token-Kosten pro Anfrage 0Verarbeitung im eigenen Netz 100 %Rechenzentrum Coburg DE
AUF EINEN BLICK

Das Wichtigste auf einen Blick

Geeignet für
Unternehmen, die sensible Daten verarbeiten, DSGVO-Konformität brauchen oder unabhängig von US-Anbietern sein wollen
Ausgangssituation
Cloud-KI überträgt Inhalte an fremde Server, rechnet pro Token ab und bindet Sie an Modellversionen, die der Anbieter ändert
Wir übernehmen
GPU-Server als Miete in unserem Rechenzentrum oder als Kauf in Ihrem Serverraum, offene Modelle mit vLLM, OpenAI-kompatible interne APIs, RAG über eine Vektordatenbank — dazu Betrieb, Updates und Support
Bei Ihnen bleibt
Ihre Daten und das Protokoll jeder einzelnen Anfrage. Bei On-Premise gehört auch die Hardware Ihnen; Aufbewahrung nach Ihrer Vorgabe, kein Export an Dritte.
Vorhandene Systeme
Bestehende Anwendungen binden sich über die OpenAI-kompatible Schnittstelle an, ohne umgeschrieben zu werden. Anmeldung über Active Directory oder LDAP, RAG-Zugriff auf Confluence, SharePoint oder Dateiserver.
Ihr Ergebnis
Kein Byte außerhalb Ihres Netzes. Betrieb auch ohne Internetanbindung, gemessen 3.900 Token/s mit Qwen3 27B
Preisrahmen
Keine Pauschale — der Rahmen hängt an Modellgröße, Nutzerzahl und Betriebsmodell: GPU-Server gemietet oder gekauftToken-Kosten je Anfrage entfallen; wo Ihr Kipppunkt gegenüber der Cloud liegt, rechnen wir im Workshop mit Ihren realen Volumina durch
Dauer
2 bis 4 Wochen für die Basis mit vorkonfiguriertem GPU-Server und StandardmodellMit RAG-Integration, Fine-Tuning und Anbindung an bestehende Systeme 2 bis 3 Monate
Erster Schritt
Auslegung im Rechner weiter oben durchspielen, dann Workshop zur Anforderungsanalyse — auf Wunsch mit Proof of Concept an Ihren Daten
Auslegung anfragen → 09571 873149 Ihr Ansprechpartner: Sales-Team, Beratung und Angebot
/01 — 114 Ausschlusskriterien

Warum Cloud-KI im Unternehmen ausscheidet

$ warum
01.1

Die Daten verlassen das Haus

Jede Anfrage an einen Cloud-Dienst überträgt Inhalte an fremde Server, häufig außerhalb der EU. Bei Verträgen, Personalakten oder Konstruktionsdaten ist das eine Frage, die der Datenschutzbeauftragte stellt — nicht die IT.

01.2

Die Kosten hören nie auf

Abgerechnet wird pro Token. Was im Pilotbetrieb mit fünf Anwendern unauffällig bleibt, wird zum dauerhaften Posten, sobald ein Assistent in Ticketsystem oder Dokumentenablage eingebunden ist — und wächst mit jedem neuen Anwendungsfall weiter.

01.3

Sie sind an Modell und Anbieter gebunden

Preise, Nutzungsbedingungen und Modellversionen ändert der Anbieter. Wird ein Modell abgekündigt, ändert sich das Verhalten Ihrer Anwendung, ohne dass Sie etwas getan haben.

01.4

Anpassung endet an der Schnittstelle

Sie können Prompts formulieren, aber das Modell nicht auf Ihre Fachsprache, Ihre Dokumentstruktur oder Ihre internen Abkürzungen einstellen. Genau dort entsteht der Unterschied zwischen einer Demo und einem Werkzeug, das täglich benutzt wird.

/02 — 114 Bausteine · alle im eigenen Netz

Woraus Ihre Private-AI-Infrastruktur besteht

$ woraus
02.1

Enterprise GPU-Server

Dedizierte Server mit NVIDIA-Karten für die Ausführung von KI-Modellen mit maximaler Performance — als Miete in unserem Rechenzentrum oder als Kauf in Ihrem Serverraum.

L40S · A100 · H100 · H200
02.2

LLM lokal

Offene Modelle wie Qwen3, GPT-OSS, Mistral oder DeepSeek laufen komplett lokal — ohne Cloud-Verbindung, betrieben mit vLLM.

Qwen3 · GPT-OSS · Mistral
02.3

Interne APIs

REST-APIs im eigenen Netzwerk, kompatibel zum OpenAI-Format — bestehende Anwendungen lassen sich anbinden, ohne sie umzuschreiben.

OpenAI-kompatibel
02.4

RAG-System

Retrieval Augmented Generation: Das Modell greift über eine Vektordatenbank auf Ihre Wissensbestände zu und antwortet mit Quellenangabe.

Vektor-DB · Quellenangabe
/03 — 113 Schichten · modular austauschbar

So ist die Plattform aufgebaut

$ so
L3Anwendungsschicht
AnwendungenChat · Suche · Analyse
API-GatewayOpenAI-kompatibel
L2Modellschicht
Inference EnginevLLM / TGI / Ollama
RAG / Vektor-DBIhre Wissensbestände
L1Basisschicht
GPU-ServerNVIDIA L40S / A100 / H100
Security LayerAuth · Logging · Audit
/04 — 11$ diff betriebsmodelle

KI-Hosting, On-Premise oder Private Cloud?

$ ki
MERKMAL
Standort
Hardware
Investition
Datenhoheit
Betrieb
MEISTGEWÄHLT FÜR DEN START

KI-Hosting

Schneller Start ohne Beschaffung

unser RZ, Deutschland
gemietet
keine
hoch
durch uns
AV-Vertrag · kein Drittlandzugriff

KI On-Premise

Daten bleiben im Haus

Ihre Räume
Ihr Eigentum
GPU-Server
vollständig
Sie oder wir
Betrieb auch ohne Internetanbindung

Private Cloud KI

Abgetrennte Umgebung beim Anbieter

Anbieter-RZ
des Anbieters
keine
anbieterabhängig
Anbieter
Region und Zugriff vertraglich prüfen
IN DER PRAXIS

Die meisten Unternehmen starten mit KI-Hosting, weil es ohne Beschaffung und ohne Platz im eigenen Serverraum funktioniert — und wechseln später auf eigene Hardware, wenn die Auslastung es rechtfertigt oder eine Zertifizierung es verlangt. Beide Wege betreiben wir; der Umzug dazwischen ist eingeplant und kein Neuaufbau, weil Modelle, RAG-Index und Schnittstellen dieselben bleiben. Wenn Sie den Betrieb ganz abgeben wollen, ist KI Managed Services die Ebene darüber.

/05 — 116 Einsatzszenarien

LLM On-Premise in der Praxis

$ llm
05.1

Interne Wissensdatenbank

Mitarbeiter fragen das Modell zu internen Prozessen, Dokumentationen oder Richtlinien — mit Zugriff auf Confluence, SharePoint oder Dateiserver.

RAGChatSelf-Service
05.2

IT-Support-Copilot

KI-Assistent für das IT-Helpdesk: automatische Ticket-Analyse, Lösungsvorschläge und Wissensdatenbank-Abfragen für schnellere Problemlösung.

HelpdeskITSMAutomatisierung
05.3

Vertragsanalyse

Automatische Analyse von Verträgen, AGB und rechtlichen Dokumenten: Klauseln extrahieren, Risiken identifizieren, Zusammenfassungen erstellen.

LegalComplianceNLP
05.4

HR-Assistenz

Unterstützung für HR: Bewerbungsanalyse, Mitarbeiter-FAQs zu Benefits und Richtlinien, Begleitung beim Onboarding.

HRRecruitingOnboarding
05.5

Engineering & Produktion

Technische Dokumentation durchsuchen, CAD-Daten analysieren, Wartungsanleitungen generieren, Qualitätsdaten auswerten.

Industrie 4.0DokumentationQualität
05.6

Code-Assistenz

Internes Pendant zu GitHub Copilot: Code-Generierung, Review, Dokumentation und Refactoring — mit Zugriff auf interne Codebasen.

EntwicklungDevOpsReview
/06 — 11Formel offengelegt · Werte aus eigenem Betrieb

GPU-Server für Ihr Modell dimensionieren

$ gpu

Die Frage, die am Anfang jedes Projekts steht — und die sonst niemand beantwortet, ohne vorher ein Angebot zu schicken. Rechnen Sie selbst. Die Formel steht darunter, die Durchsatzwerte stammen aus unserem eigenen Betrieb.

MODELL
QUANTISIERUNG

32k
8
VRAM-BEDARF
0GB
  • Modellgewichte
  • KV-Cache
  • Laufzeit-Overhead
    GEWICHTE

    Parameter × Bytes je Parameter. FP16 = 2, FP8 = 1, Int4 = 0,5. Bei MoE-Modellen zählen die Gesamtparameter, weil alle Experten im Speicher liegen müssen — nur die Rechenlast sinkt, nicht der Speicherbedarf.

    KV-CACHE

    Kontextlänge × gleichzeitige Anfragen × modellspezifischer Faktor. Der Cache wächst linear mit beidem und wird regelmäßig unterschätzt: Bei 128k Kontext und 32 parallelen Anfragen übersteigt er die Gewichte.

    EHRLICH

    Das ist eine Abschätzung, keine Zusage. Die Formel reproduziert unsere eigenen Messwerte auf 5–10 % genau — für die Kaufentscheidung reicht das, für die Beschaffung rechnen wir es an Ihrer konkreten Umgebung nach.

    /07 — 11Kostentreiber statt Momentaufnahme

    Was On-Premise-KI wirtschaftlich macht — und wann nicht

    $ was
    CLOUD-API — nutzungsabhängig
    Investition vorabkeine
    Abrechnungpro Token
    Skaliert mitNutzung
    Preisentwicklungfallend
    Planbarkeitgering
    StärkeEinstieg
    ON-PREMISE — kapazitätsabhängig
    Investition vorabGPU-Server
    AbrechnungKapazität
    Skaliert mitNutzerzahl
    Preisentwicklungfix
    Planbarkeithoch
    StärkeDauerbetrieb
    DIE FÜNF GRÖSSEN, DIE DEN KIPPPUNKT BESTIMMEN
    GRÖSSESPRICHT FÜR CLOUDSPRICHT FÜR ON-PREMISE
    1 Anfragevolumen schwankend, saisonal, wenige Fachnutzer gleichmäßig hoch, viele Nutzer, Dauerbetrieb
    2 Kontextlänge kurze Prompts lange Dokumente und RAG über große Bestände — hier explodieren Token-Kosten
    3 Datenklasse unkritische Inhalte Personal-, Mandanten-, Patienten- oder Konstruktionsdaten
    4 Auslastung sporadische Nutzung, die GPU stünde still planbare Grundlast über den Arbeitstag
    5 Betriebskompetenz kein Team für Modell- und Treiberpflege vorhandenes Team oder Managed Service
    FAUSTREGEL AUS UNSEREN PROJEKTEN

    Bei sporadischer Nutzung durch eine Handvoll Fachanwender rechnet sich die Cloud fast immer. Sobald eine Grundlast über den Arbeitstag entsteht — etwa weil ein Assistent in Ticketsystem oder Dokumentenablage eingebunden ist — kippt die Rechnung Richtung eigener Hardware, und zwar umso deutlicher, je länger die verarbeiteten Dokumente sind.

    /08 — 11Protokoll liegt bei Ihnen

    Nachvollziehbar bis zur einzelnen Anfrage

    $ nachvollziehba

    Wer KI in regulierten Bereichen einsetzt, muss im Zweifel belegen können, wer wann welche Frage gestellt hat und welches Modell geantwortet hat. On-Premise heißt: Dieses Protokoll liegt bei Ihnen — nicht bei einem Anbieter, der es auf Anfrage herausgibt.

    DATENHALTUNGausschließlich in Deutschland, keine Übertragung an Dritte
    ANMELDUNGSingle Sign-on über Active Directory oder LDAP, rollenbasiert
    PROTOKOLLIERUNGjede Anfrage mit Nutzer, Modellversion und Zeitstempel
    RECHENZENTRUMISO/IEC 27001:2024 zertifiziert · Zertifikat Nr. 202787
    audit.log — llm-gateway BEISPIELAUSSCHNITT
    • 09:14:02m.huberqwen3-27bzugelassen
    • 09:14:08m.huberrag: vertragsablage3 Treffer
    • 09:17:41s.kellerqwen3-27bzugelassen
    • 09:18:03extern-01rag: personalaktenabgelehnt — Rolle
    • 09:22:17j.brandtqwen3-27bzugelassen
    • 09:22:19systemmodell-hash geprüftunverändert
    Aufbewahrung nach Ihrer Vorgabe kein Export an Dritte
    /09 — 11gestaffelte Fristen

    Was die KI-Verordnung von Ihnen verlangt

    $ was

    Verbotene Praktiken & KI-Kompetenz

    Die Schulungspflicht für Beschäftigte gilt unabhängig von der Risikoklasse — sie trifft praktisch jeden, der KI einsetzt.

    Pflichten für Modellanbieter

    Betrifft Sie nur, wenn Sie selbst Modelle trainieren oder bereitstellen. Beim Einsatz offener Modelle liegen diese Pflichten beim Modellanbieter.

    Hochrisiko in regulierten Produkten

    Relevant, wenn Ihre KI Sicherheitsbauteil eines Produkts ist, das ohnehin CE-pflichtig ist.

    Hochrisiko nach Anhang III

    Personalauswahl, Kreditvergabe, kritische Infrastruktur und vergleichbare Felder.

    EHRLICH

    Die meisten betrieblichen Anwendungsfälle — interne Wissenssuche, Dokumentenanalyse, Support-Assistenz — fallen nicht unter Hochrisiko, sondern unter Transparenz- und Dokumentationspflichten. Der Aufwand bleibt überschaubar, wenn er von Anfang an mitläuft: Zweckbeschreibung je Anwendung, Modell- und Versionsstand, Protokollierung der Zugriffe, Kennzeichnung KI-erzeugter Ausgaben und eine benannte verantwortliche Person.

    Die Fristen für Hochrisiko-Anwendungen wurden im Rahmen des Digital-Omnibus-Pakets nach hinten verschoben — Stände, die noch den 02.08.2026 nennen, sind überholt. Genau hier zahlt sich On-Premise aus: Modellstand, Protokolle und Trainingsdaten liegen bei Ihnen und lassen sich einem Prüfer zeigen, ohne dass ein Anbieter zuarbeiten muss.

    /10 — 116 Schritte

    Von der Idee zur produktiven KI-Plattform

    $ von
    01

    Workshop

    Anforderungsanalyse, Use Cases definieren

    02

    Proof of Concept

    Teststellung mit Ihren Daten

    03

    Hardware

    Sizing, Beschaffung, Installation

    04

    Integration

    RAG-Setup, API-Anbindung

    05

    Rollout

    Schulung, Go-Live, Monitoring

    06

    Betrieb

    Support, Updates, Optimierung

    /11 — 119 Fragen

    Häufig gestellte Fragen

    $ haeufig
    /01Was ist KI On-Premise und warum ist es für Unternehmen relevant?+

    KI On-Premise bedeutet, dass Large Language Models (LLMs) und KI-Systeme auf eigener Infrastruktur im Unternehmen oder im deutschen Rechenzentrum betrieben werden - statt über Cloud-APIs wie ChatGPT oder Claude. Das ist relevant für Unternehmen, die sensible Daten verarbeiten, DSGVO-Konformität benötigen oder unabhängig von US-Anbietern sein möchten.

    /02Läuft KI wirklich vollständig offline?+

    Ja. Modellgewichte liegen lokal, die Inferenz läuft auf Ihrer Hardware, es besteht keine Verbindung nach außen. Was Sie einplanen müssen: Modell-Updates sind ein bewusster Vorgang, und die Qualität offener Modelle liegt bei manchen Aufgaben unter der kommerzieller Spitzenmodelle — bei Dokumentenverarbeitung, Klassifikation und Recherche im eigenen Bestand ist der Abstand aber gering.

    /03Welche Hardware wird für KI On-Premise benötigt?+

    Der Bedarf richtet sich nach Modellgröße und Parallelnutzung, nicht nach dem Modellnamen. Für kleinere Modelle (7B–13B) mit einer Handvoll gleichzeitiger Nutzer reicht eine einzelne professionelle Karte mit 24–48 GB VRAM, etwa RTX 6000 Ada oder L40S. Für größere Modelle (70B+) oder viele parallele Nutzer werden H100/H200 oder mehrere Knoten nötig. Der Rechner weiter oben auf dieser Seite gibt Ihnen den VRAM-Bedarf für Ihren Fall.

    /04Ist KI On-Premise DSGVO-konform?+

    Ja, KI On-Premise ist vollständig DSGVO-konform, da alle Daten in Ihrer eigenen Infrastruktur oder im deutschen Rechenzentrum verbleiben. Es erfolgt keine Datenübertragung an Dritte oder in Drittländer. Sie behalten die volle Kontrolle über Ihre Daten und können Löschfristen, Zugriffsrechte und Protokollierung selbst definieren.

    /05Welche Anbieter liefern DSGVO- und KI-VO-konforme KI-Lösungen, die offline oder on-premise laufen?+

    Der Markt ist klein, weil die meisten Anbieter auf US-Modelle per API aufsetzen — damit ist weder Offline-Betrieb noch ein einfacher Drittlandnachweis möglich. Wir betreiben offene Modelle wie Qwen, GPT-OSS und MiniMax auf eigener oder Ihrer GPU-Hardware mit vLLM, vollständig ohne externen Modellzugriff, inklusive der nach EU-AI-Act geforderten Dokumentation.

    /06Wie hoch sind die Kosten für KI On-Premise im Vergleich zu Cloud-APIs?+

    Eine pauschale Zahl wäre nach wenigen Monaten falsch — Inferenzpreise in der Cloud fallen seit Jahren, GPU-Preise schwanken mit der Verfügbarkeit. Entscheidend sind fünf Größen: Anfragevolumen, Kontextlänge, Datenklasse, Auslastung und vorhandene Betriebskompetenz. Cloud rechnet sich bei sporadischer Nutzung durch wenige Fachanwender, On-Premise ab einer planbaren Grundlast über den Arbeitstag. Wo genau Ihr Kipppunkt liegt, rechnen wir im Workshop mit Ihren realen Volumina durch.

    /07Welche Open-Source-Modelle können On-Premise betrieben werden?+

    Wir betreiben offene Modelle wie Qwen3, GPT-OSS, MiniMax, Mistral und DeepSeek — je nach Aufgabe als dichtes Modell oder Mixture-of-Experts. Die Gewichte sind frei nutzbar und lassen sich auf Ihre Fachsprache und Dokumentstruktur fein-tunen. Für Code-Assistenz kommen spezialisierte Varianten derselben Familien zum Einsatz.

    /08Wie lange dauert die Implementierung einer KI On-Premise Lösung?+

    Eine Basis-Implementierung mit vorkonfiguriertem GPU-Server und Standard-LLM ist in 2-4 Wochen möglich. Komplexere Projekte mit RAG-Integration, Fine-Tuning und Anbindung an bestehende Systeme benötigen 2-3 Monate. Wir bieten auch Proof-of-Concept-Projekte zum Testen an.

    /09Was verlangt der EU AI Act von uns?+

    Das hängt an der Risikoklasse Ihrer Anwendung. Für die meisten betrieblichen Anwendungsfälle greifen Transparenz- und Dokumentationspflichten, nicht die strengen Hochrisiko-Auflagen. Wir klassifizieren Ihre Anwendungen und erstellen die geforderte Dokumentation — das ist überschaubarer, als die Diskussion vermuten lässt.

    MEHRWeiterlesen

    Das könnte Sie auch interessieren.

    $ related
    FORMULARAnfrage

    Auslegung anfragen.

    $ auslegung --anfragen

    Ihre Auslegung

    Modell—
    Quantisierung—
    Kontextlänge—
    Parallele Anfragen—
    VRAM-Bedarf—
    Empfehlung—

    Die Werte stammen aus dem Rechner weiter oben und gehen mit der Anfrage raus. Ändern Sie sie dort, ändert sich hier mit.

    // Lieber telefonisch? 09571 873149 · Termin vereinbaren · Montag bis Freitag · Rückmeldung in der Regel am selben Werktag.