- Claude Opus 5.5 ist seit 22. September 2026 verfügbar, kostet 4 US-Dollar je Million Eingabe-Token und fasst 1 Million Token Kontext.
- „Opus 5.5 Max" gibt es nicht als Modell; „Max" ist die Abo-Stufe von claude.ai, in der API heißt das Modell claude-opus-5-5 ohne Zusatz.
- Hirn und Arbeiter heißt: Das große Modell plant, entscheidet und prüft; lokale Modelle auf eigener Hardware erledigen die Masse.
- Der Datenfluss entscheidet die Datenschutzfrage: Das Hirn sieht Strukturen und Vorlagen, die Rohdokumente bleiben im Haus.
- Der Betrieb eines solchen Gespanns — Router, lokale Inferenz, Evaluationssatz — beginnt bei HostSpezial bei 690 Euro im Monat.
/01Was Anthropic am 22. September 2026 veröffentlicht hat
Die Fakten zuerst, weil um Modellveröffentlichungen viel Nebel liegt. Anthropic hat am 22. September 2026 Claude Opus 5.5 freigegeben, zwei Monate nach Opus 5 vom 24. Juli. Der Hersteller beschreibt das Modell als Nachfolger für „long-running agentic coding and knowledge work" und stellt drei Aussagen in den Vordergrund: Es arbeite auf den meisten Aufgaben auf dem Niveau von Claude Fable 5.1, es koste im Betrieb 40 Prozent weniger als Opus 5, und es erzeuge Ausgaben mehr als 30 Prozent schneller als der Vorgänger. Die Benchmarkwerte, die Anthropic selbst nennt: Terminal-Bench 4.0 66,4 Prozent (Opus 5: 52,3), OSWorld 2.0 81,8 Prozent (74,0), GDPval-AA v2.1 1846 Elo (1708). Das sind Herstellerangaben; unabhängige Messungen kommen erfahrungsgemäß in den Wochen danach.
| Merkmal | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Veröffentlicht | 22. September 2026 | 24. Juli 2026 |
| Modell-ID (API, Bedrock, Vertex AI, Foundry) | claude-opus-5-5 | claude-opus-5 |
| Kontextfenster | 1 Mio. Token | 1 Mio. Token |
| Ausgabe maximal | 128k Token (300k über Batch-API, Beta) | 128k Token |
| Eingabe / Ausgabe je Mio. Token | 4 / 20 US-Dollar | 5 / 25 US-Dollar |
| Cache-Lesen je Mio. Token | 0,20 US-Dollar | 0,50 US-Dollar |
| Batch-API | 50 Prozent Rabatt auf Ein- und Ausgabe | 50 Prozent |
| Fast Mode (Research Preview) | 8 / 40 US-Dollar | — |
| Thinking | adaptiv, nicht abschaltbar, Standard-Effort medium | adaptiv |
| Wissensstand | Juni 2026 | — |
| Abschaltung | nicht vor 22. September 2027 | — |
Verfügbar ist das Modell laut Anthropic auf der Claude-API, auf Amazon Bedrock, in Google Cloud (Vertex AI), in Microsoft Foundry und auf der Claude Platform on AWS — überall unter derselben ID. In den Abos von claude.ai (Pro, Max, Team, Enterprise) ist es ebenfalls freigeschaltet, mit um 20 Prozent erhöhten Nutzungslimits je Fünf-Stunden-Fenster.
Zum Namen: Ein Modell namens
„Opus 5.5 Max" gibt es nicht — weder in der Ankündigung noch in der
Modellübersicht von Anthropic. „Max" ist die Abo-Stufe von claude.ai
oberhalb von „Pro". Wer in einer Anfrage oder einem Angebot „Opus 5.5 Max"
liest, sollte nachfragen, ob das Modell oder das Abo gemeint ist. In der API
heißt das Modell auf allen Plattformen claude-opus-5-5.
/02Warum ein Frontier-Modell allein im Mittelstand nicht die Antwort ist
Ein Preis von 4 US-Dollar je Million Eingabe-Token klingt nach wenig. Er ist es auch — je Anfrage. Die Rechnung dreht sich, sobald ein Modell nicht gelegentlich gefragt wird, sondern die tägliche Masse verarbeitet: jede eingehende Rechnung, jedes Ticket, jede Bewerbung, jeden Vertrag im Archiv. Ein Mittelständler mit 200 Beschäftigten hat davon keine Handvoll, sondern Zehntausende im Monat, und jeder dieser Vorgänge trägt Personen- oder Vertragsdaten.
Drei Gründe sprechen dagegen, das alles an ein Frontier-Modell in der Cloud zu geben — unabhängig davon, wie gut es ist:
- Daten. Rohdokumente mit personenbezogenen Daten an einen US-Anbieter zu senden, braucht einen Auftragsverarbeitungsvertrag, eine Rechtsgrundlage nach DSGVO und eine Antwort auf den CLOUD Act. Das ist machbar, aber für jede Datenklasse einzeln — und für Gesundheits-, Bewerber- oder Mandantendaten meist nicht gewollt.
- Kosten. Token-Preise sind variabel. Wer die Masse über die API schickt, hat eine Rechnung, die mit dem Geschäft wächst und die niemand im Voraus kennt. Ein lokales Modell auf einer bezahlten Karte hat Fixkosten und eine Obergrenze: die Auslastung.
- Abhängigkeit. Anthropic sagt eine Verfügbarkeit von Opus 5.5 bis mindestens 22. September 2027 zu. Danach entscheidet der Anbieter. Ein Prozess, der auf ein Modell abgestimmt ist, das in einem Jahr verschwinden kann, braucht einen Rückweg.
Keiner dieser Gründe spricht gegen das Modell. Sie sprechen dagegen, ihm die falsche Aufgabe zu geben. Was das Frontier-Modell besser kann als jedes lokale Modell, ist nicht die Masse, sondern das Urteil: einen mehrstufigen Plan aufstellen, eine Ausnahme erkennen, ein Ergebnis prüfen. Genau das ist die Aufgabe, die es bekommen sollte — und die ist klein.
/03Das Muster: Opus als Hirn, lokale Modelle als Arbeiter
Das Muster hat zwei Ebenen und eine Grenze dazwischen. Das Hirn ist ein Frontier-Modell — hier Opus 5.5 — und bekommt die Aufgaben, die Urteil brauchen: Es zerlegt einen Auftrag in Schritte, entscheidet, welcher Schritt zu welchem Arbeiter geht, prüft die Ergebnisse auf Plausibilität und zieht die Fälle heraus, die ein Mensch sehen muss. Es sieht dabei Strukturen, Zusammenfassungen und Kennzahlen — nicht die Rohdaten.
Die Arbeiter sind lokale Open-Weight-Modelle auf eigener Hardware, betrieben über einen Inferenzserver wie vLLM. Sie lesen die Rechnung, klassifizieren das Ticket, ziehen Felder aus dem Vertrag, erzeugen die Embeddings für die Suche und beantworten die RAG-Anfrage aus dem Firmenwissen. Sie sind kleiner, schneller und billiger je Aufruf — und sie sehen alles, weil alles im Haus bleibt.
Die Grenze ist ein Router: ein Stück Software, das jede Anfrage einer Ebene zuweist und protokolliert, was wohin ging. Er ist die Stelle, an der die Datenschutzregel technisch wird — nicht als Richtlinie, sondern als Weiche. Das Muster ist kein Entweder-oder zwischen Cloud und On-Premise; es ist eine bewusst gebaute Hybridarchitektur mit einer Regel, die jeder im Haus in einem Satz sagen kann: Rohdaten bleiben hier, Urteile dürfen raus.
In der Praxis: Ein gutes Verhältnis in unseren Projekten liegt bei unter fünf Prozent der Aufrufe am Hirn und über 95 Prozent an den Arbeitern — als Beobachtung, nicht als Regel. Wer merkt, dass das Hirn 30 Prozent bekommt, hat meist einen Arbeiter zu wenig oder eine Routing-Regel zu grob.
/04Arbeitsteilung konkret: welche Aufgabe wohin
Die Zuordnung ist keine Frage der Modellgröße, sondern der Frage: Braucht dieser Schritt Urteil, oder braucht er Durchsatz? Und: Enthält die Eingabe Rohdaten, die das Haus nicht verlassen sollen?
| Aufgabe | Ebene | Warum | Was die andere Ebene sieht |
|---|---|---|---|
| Rechnungen lesen, Felder extrahieren | Arbeiter (lokal) | Masse, Rohdaten, gut messbar | Hirn: nur Ausreißer mit Kennzahlen |
| Tickets klassifizieren und zuweisen | Arbeiter (lokal) | Tausende je Monat, feste Klassen | Hirn: Fälle ohne eindeutige Klasse |
| Firmenwissen durchsuchen (RAG) | Arbeiter (lokal) | Embeddings und Antworten aus internen Dokumenten | Hirn: nichts |
| Verträge auf Klauseln prüfen | Arbeiter (lokal), Hirn prüft Stichprobe | Rohdaten vertraulich; Urteil bei Unklarheit | Hirn: Klausel ohne Namen und Beträge |
| Mehrstufigen Vorgang planen (z. B. Onboarding-Ablauf) | Hirn (Opus 5.5) | Planung über viele Schritte, wenige Aufrufe | Arbeiter: bekommen die Teilaufträge |
| Ergebnisse der Arbeiter prüfen | Hirn (Opus 5.5) | Urteil über Plausibilität, Stichprobe statt Masse | Arbeiter: nichts |
| Code für Integrationen schreiben | Hirn (Opus 5.5) | Agentic Coding ist die Stärke des Modells; kein Kundendatenbezug | — |
| Ausnahmen an Menschen eskalieren | Hirn (Opus 5.5) | Entscheidung, was ein Mensch sehen muss | — |
Die Tabelle ist ein Ausgangspunkt, keine Vorschrift. Was in Ihrem Haus Rohdaten sind, entscheidet Ihr Datenschutzbeauftragter, nicht die Architektur. Aber die Architektur muss ihm die Wahl lassen — und das tut sie nur, wenn die Grenze im Router liegt und nicht im Prompt.
/05Datenfluss: Was das Hirn sieht — und was nicht
Der Datenfluss ist der Teil, an dem das Muster steht oder fällt. Ein typischer Vorgang — eine eingehende Rechnung — läuft so:
1 Eingang Rechnung (PDF) -> lokaler Speicher, Hash, Protokoll
2 Arbeiter lokales Modell liest PDF, extrahiert Felder (Betrag, Datum,
Lieferant, Positionen), prüft gegen Bestellung im ERP
3 Router Treffer eindeutig? ja -> Buchungsvorschlag, Ende
nein -> Fall an das Hirn, ohne Rohdaten
4 Hirn bekommt: Abweichung (Betrag +12 %), Lieferantenklasse,
Bestellstatus, drei Regeln aus dem Handbuch
liefert: Entscheidung (nachfragen / freigeben / sperren)
und Begründung
5 Mensch sieht Entscheidung + Begründung, gibt frei oder nicht
6 Protokoll Router hat notiert: was, wohin, welche Felder
Das Hirn hat in Schritt 4 keinen Lieferantennamen, keine IBAN, keine Positionen gesehen — nur die Struktur des Problems. Das reicht ihm, weil seine Aufgabe das Urteil ist, nicht das Lesen. Und es reicht dem Datenschutzbeauftragten, weil er die Übermittlung im Router nachlesen kann. Was nicht reicht, ist eine Richtlinie, die sagt „Rohdaten nicht an Cloud-Modelle senden", während der Prompt des Agenten beliebige Dokumente anhängen darf. Prompt Injection über ein manipuliertes Dokument ist dann nicht nur ein Sicherheits-, sondern ein Datenschutzvorfall.
Der lokale Teil des Musters — Inferenzserver, Modelle, Wissensbasis auf eigener Hardware — ist das, was wir als Betrieb anbieten. KI On-Premise — lokale Sprachmodelle mit vLLM, RAG und Monitoring, ab 690 Euro im Monat.
/06Kostenrechnung: ein Beispiel mit Listenpreisen
Die Rechnung nutzt ausschließlich die Listenpreise von Anthropic vom 22. September 2026 und ausgewiesene Annahmen. Die Zahlen für Ihr Haus werden anders sein; die Größenordnung ist der Punkt.
Annahmen: 10.000 Rechnungen im Monat, je etwa 5.000 Eingabe-Token als Text und 500 Token Ausgabe. Fünf Prozent der Fälle sind unklar und gehen ans Hirn — mit einer Entscheidungsvorlage von etwa 2.000 Eingabe-Token und 500 Token Ausgabe.
| Variante | Aufrufe am Hirn | Eingabe-Token | Ausgabe-Token | Token-Kosten Hirn |
|---|---|---|---|---|
| Alles ans Frontier-Modell | 10.000 | 50 Mio. | 5 Mio. | 200 + 100 = 300 US-Dollar |
| Hirn und Arbeiter (5 % eskaliert) | 500 | 1 Mio. | 0,25 Mio. | 4 + 5 = 9 US-Dollar |
| Hirn und Arbeiter, 20 % eskaliert | 2.000 | 4 Mio. | 1 Mio. | 16 + 20 = 36 US-Dollar |
Die Token-Kosten am Hirn sind in diesem Beispiel bei allen Varianten klein. Das ist die eigentliche Erkenntnis: Nicht die Token-Rechnung entscheidet, sondern die Datenfrage. 300 US-Dollar im Monat wären für die meisten Häuser tragbar; 10.000 Rechnungen mit Lieferanten- und Bankdaten an einen US-Anbieter zu senden, ist es oft nicht. Umgekehrt: Wer die Arbeiter lokal betreibt, zahlt dafür Hardware und Betrieb — eine GPU-Karte für ein Modell dieser Klasse, Strom, Monitoring, Modellpflege. Diese Kosten sind fix und planbar, aber sie sind nicht null. Wie sich Kosten je erledigter Aufgabe sauber rechnen, inklusive der Fälle, die ein Mensch nacharbeitet, steht in Kosten je erfolgreichem Task.
Zwei Hebel senken die Hirn-Kosten weiter, wenn sie doch einmal ins Gewicht fallen: Cache-Lesen kostet bei Opus 5.5 0,20 US-Dollar je Million Token — ein gleichbleibender Systemprompt mit Regeln aus dem Handbuch wird also fast umsonst wiederverwendet. Und die Batch-API halbiert Ein- und Ausgabepreis für alles, was nicht sofort beantwortet sein muss — die nächtliche Prüfung der Tagesarbeit etwa.
/07Architektur und Betrieb: Router, Inferenz, Evaluation
Das Muster braucht vier Bausteine, und keiner davon ist exotisch:
- Inferenzserver im Haus. vLLM mit ein bis zwei Open-Weight-Modellen auf einer oder zwei GPU-Karten, dazu ein Embedding-Modell und eine Vektordatenbank für die Wissensbasis. Welche Modelle und welche Hardware im Mittelstand tragen, steht in On-Premise KI mit vLLM, Qwen3 und GPT-OSS. Mehrere Dienste teilen sich die Karten über GPU-Pooling.
- Router. Ein Gateway, das jede Anfrage nach Regel zuweist (Aufgabe, Datenklasse, Unsicherheit des Arbeiters), die Übermittlung protokolliert und die Schlüssel für die Cloud-API zentral hält. Kein Arbeitsplatz spricht direkt mit Anthropic. Wer Agenten über MCP an Werkzeuge anschließt, hängt auch das an den Router.
- Anbindung des Hirns. Über die Claude-API oder — wenn das
Haus schon dort ist — über Amazon Bedrock, Google Vertex AI oder Microsoft
Foundry, jeweils mit der ID
claude-opus-5-5. Die Wahl der Plattform ist eine Vertrags- und Regionsfrage, keine technische. - Evaluationssatz. Fünfzig bis zweihundert echte Aufgaben mit bekannter Antwort, die nach jeder Änderung durchlaufen — für die Arbeiter und für das Hirn. Ohne Evaluationssatz ist ein Modellwechsel eine Diskussion; mit ihm ist er eine Messung. Das ist der Kern von LLMOps, und er entscheidet, ob das Muster ein Jahr überlebt.
Der Modellwechsel ist beim Hirn eingebaut: Anthropic hat Opus 5 nach zwei Monaten abgelöst, und Opus 5.5 bringt laut Modellseite vier Änderungen mit, die laufenden Code betreffen — unter anderem, dass sich das Thinking nicht mehr abschalten lässt und erzwungene Werkzeugaufrufe einen Fehler zurückgeben. Wer das Hirn über einen Router mit Evaluationssatz anspricht, tauscht die Modell-ID, lässt den Satz laufen und sieht, was sich geändert hat. Wer es direkt in zwanzig Skripten eingetragen hat, sucht.
Router, Inferenzserver, Evaluationssatz und Modellwechsel sind Betriebsarbeit, die jemand jeden Monat tun muss. KI Managed Services — Betriebsübernahme ab 690 Euro, kompletter Stack ab 1.490 Euro, hochverfügbarer Betrieb mit Governance ab 3.900 Euro im Monat.
/08Wo es hakt: Grenzen und Fallstricke
Ehrlich: Das Muster ist nicht kostenlos, und es löst nicht alles.
- Die Grenze rutscht. Der häufigste Fehler ist ein Arbeiter, der „zur Sicherheit" das ganze Dokument an das Hirn weiterreicht, weil die Entscheidungsvorlage zu dünn war. Dann ist die Datenschutzregel verletzt, ohne dass es jemand gewollt hat. Gegenmittel: Der Router filtert Felder, nicht der Prompt.
- Die Arbeiter sind schlechter. Ein lokales Modell liest Rechnungen sehr gut, komplizierte Verträge weniger gut. Wer das nicht misst, merkt es an den Eskalationen — oder gar nicht. Deshalb der Evaluationssatz für beide Ebenen.
- Zwei Betriebsmodelle. Lokale Hardware braucht jemanden, der sie betreibt; die Cloud-API braucht jemanden, der Vertrag, Region und Modellwechsel im Blick hat. Das Muster verdoppelt die Betriebsfragen, es halbiert sie nicht.
- Latenz und Textfluss. Das Thinking von Opus 5.5 ist immer an; wer eine Antwort in unter einer Sekunde braucht, ist beim Hirn falsch — und laut Modellseite kommt Text zwischen Werkzeugaufrufen jetzt in Thinking-Blöcken zurück, die in der Standardeinstellung leer sind. Eine Oberfläche, die Fortschritt anzeigt, wird dann stumm, bis sie umgestellt ist.
- Preise sind Listenpreise. Bedrock und Vertex AI rechnen selbst ab, regionale Endpunkte kosten dort mehr als globale. Der Router sollte deshalb Token je Aufruf mitzählen, nicht nur Aufrufe.
Merksatz: Das Hirn ist nicht die teure Ebene. Die teure Ebene ist die, die niemand betreibt.
/09Die Entscheidung: wann welches Muster
Drei Fälle, in denen die Antwort klar ist:
- Nur Cloud-Modell, wenn die Masse klein ist, die Daten unkritisch sind und niemand im Haus Hardware betreiben will — ein Assistent für Textentwürfe, Protokolle, Recherche. Dann Opus 5.5 über die API mit Auftragsverarbeitungsvertrag, fertig.
- Nur lokal, wenn jede Anfrage Rohdaten trägt und die Aufgaben klar umrissen sind — Rechnungslesen, Klassifikation, Suche im Firmenwissen. Dann Open-Weight-Modelle auf eigener Hardware, kein Cloud-Anteil, wie in KI On-Premise und DSGVO beschrieben.
- Hirn und Arbeiter, wenn beides zusammenkommt: Masse mit Rohdaten und Vorgänge, die Planung und Urteil brauchen — ein Agent, der Vorgänge über mehrere Systeme steuert, ein Prozess mit Ausnahmen, die jemand entscheiden muss. Das ist der häufigste Fall im Mittelstand ab etwa 100 Beschäftigten, und der, für den Opus 5.5 mit seinem neuen Preis das Hirn günstiger macht, ohne die Arbeiter zu ersetzen.
Unsere Empfehlung: Mit den Arbeitern anfangen. Ein lokales Modell, das Rechnungen liest, ist in Wochen produktiv und liefert die Nutzungszahlen, mit denen sich die Frage nach dem Hirn belastbar beantworten lässt. Das Hirn nachzurüsten ist ein Router und ein API-Schlüssel. Die Arbeiter nachzurüsten, wenn alles schon in der Cloud hängt, ist ein Umbau — und eine Datenschutzdiskussion, die man rückwärts führt.
/10Häufige Fragen
/01Gibt es ein Modell „Opus 5.5 Max"?+
/02Was kostet Opus 5.5 gegenüber Opus 5?+
/03Können wir Opus 5.5 lokal betreiben?+
/04Reicht ein lokales Modell nicht für alles?+
/05Welche Daten darf das Hirn sehen?+
/06Was kostet der Betrieb eines solchen Gespanns?+
- Introducing Claude Opus 5.5, Anthropic, anthropic.com/claude-opus-5-5, 22.09.2026, abgerufen am 22.09.2026.
- Claude Opus 5.5 — Modellseite (Preise, Kontextfenster, Plattformen, Änderungen), Anthropic, platform.claude.com/docs/en/models/opus-5-5/overview, abgerufen am 22.09.2026.
- Models overview (Vergleich Fable 5.1, Opus 5.5, Sonnet 5, Haiku 4.5), Anthropic, platform.claude.com/docs/en/about-claude/models/overview, abgerufen am 22.09.2026.
- Anthropic releases Opus 5.5 with lower prices and Fable-level performance, TechCrunch, techcrunch.com, 22.09.2026.
- Claude Opus 5.5 matches Fable 5.1 performance at lower cost, The Decoder, the-decoder.com, 22.09.2026.
- KI Managed Services (Preise und Leistungsstufen) und KI On-Premise, HostSpezial, hostspezial.de/ki-managed-services.html und hostspezial.de/loesungen/ki-on-premise.html, abgerufen am 22.09.2026.
