- Geeignet für
- Unternehmen, die sensible Daten verarbeiten, DSGVO-Konformität brauchen oder unabhängig von US-Anbietern sein wollen
- Ausgangssituation
- Cloud-KI überträgt Inhalte an fremde Server, rechnet pro Token ab und bindet Sie an Modellversionen, die der Anbieter ändert
- Wir übernehmen
- GPU-Server als Miete in unserem Rechenzentrum oder als Kauf in Ihrem Serverraum, offene Modelle mit vLLM, OpenAI-kompatible interne APIs, RAG über eine Vektordatenbank — dazu Betrieb, Updates und Support
- Bei Ihnen bleibt
- Ihre Daten und das Protokoll jeder einzelnen Anfrage. Bei On-Premise gehört auch die Hardware Ihnen; Aufbewahrung nach Ihrer Vorgabe, kein Export an Dritte.
- Vorhandene Systeme
- Bestehende Anwendungen binden sich über die OpenAI-kompatible Schnittstelle an, ohne umgeschrieben zu werden. Anmeldung über Active Directory oder LDAP, RAG-Zugriff auf Confluence, SharePoint oder Dateiserver.
- Ihr Ergebnis
- Kein Byte außerhalb Ihres Netzes. Betrieb auch ohne Internetanbindung, gemessen 3.900 Token/s mit Qwen3 27B
- Preisrahmen
- Keine Pauschale — der Rahmen hängt an Modellgröße, Nutzerzahl und Betriebsmodell: GPU-Server gemietet oder gekauftToken-Kosten je Anfrage entfallen; wo Ihr Kipppunkt gegenüber der Cloud liegt, rechnen wir im Workshop mit Ihren realen Volumina durch
- Dauer
- 2 bis 4 Wochen für die Basis mit vorkonfiguriertem GPU-Server und StandardmodellMit RAG-Integration, Fine-Tuning und Anbindung an bestehende Systeme 2 bis 3 Monate
- Erster Schritt
- Auslegung im Rechner weiter oben durchspielen, dann Workshop zur Anforderungsanalyse — auf Wunsch mit Proof of Concept an Ihren Daten