Anthropic veröffentlicht Claude Opus 5.5: Die große Neuerung ist nicht nur, was das Modell kann – sondern was es nicht mehr tun darf

Claude Opus 5.5 bringt mehr Leistung, höhere Geschwindigkeit und spürbar niedrigere Kosten im Vergleich zu Opus 5. Gleichzeitig schränkt Anthropic den Zugriff auf heikle Fähigkeiten in Cybersicherheit und Biologie gezielt ein.

Claude Opus 5.5 bringt mehr Leistung, höhere Geschwindigkeit und spürbar niedrigere Kosten im Vergleich zu Opus 5. Gleichzeitig schränkt Anthropic den Zugriff auf heikle Fähigkeiten in Cybersicherheit und Biologie gezielt ein. | Bild Anthropic Claude Opus 5.5 bringt mehr Leistung, höhere Geschwindigkeit und spürbar niedrigere Kosten im Vergleich zu Opus 5. Gleichzeitig schränkt Anthropic den Zugriff auf heikle Fähigkeiten in Cybersicherheit und Biologie gezielt ein. | Bild Anthropic

Je leistungsfähiger große Modelle künstlicher Intelligenz werden, desto schwerer fällt es, Fortschritt allein daran zu messen, welche neuen Aufgaben sie bewältigen. Zunehmend zählt auch, welche Fähigkeiten klare Grenzen erfordern, wer Zugriff darauf erhält und unter welchen Bedingungen. Anthropic stellt genau diese Diskussion seit geraumer Zeit in den Mittelpunkt seiner Sicherheitsstrategie – und zeigt nun besonders deutlich, wohin die Reise gehen soll.

Bei der Weiterentwicklung von Claude geht es längst nicht mehr bloß um Spitzenwerte in Benchmarks, sondern darum, präzise zu steuern, wann bestimmte Fähigkeiten überhaupt bei euch im Alltag ankommen.

Dieser Ansatz spiegelt sich jetzt in Claude Opus 5.5 wider, das von Anthropic als erstes Modell der neuen 5.5-Generation vorgestellt wurde.

Das Unternehmen verspricht bei vielen Aufgaben eine Leistung auf dem Niveau von Fable 5.1, benötigt dafür jedoch spürbar weniger Ressourcen als Opus 5: Bei typischen Arbeitslasten sollen die Kosten um 40 Prozent sinken, während die Textausgabe über 30 Prozent schneller erfolgt. Es ist zudem die erste Veröffentlichung, seitdem Dario Amodei öffentlich gefordert hatte, das Entwicklungstempo der Modelle eng an robuste Sicherheitsmaßnahmen zu koppeln. Genau dieser Gedanke fließt nun direkt in das fertige Produkt ein.

Hinweis: Dieser Artikel stammt im Original von unserer spanischen Schwesterseite Xataka und erscheint bei GameStar Tech in übersetzter und angepasster Form.

Mehr Leistung für Claude – aber auch deutlich engere Grenzen

Blickt ihr darauf, wo die Verbesserungen liegen, hebt Anthropic vor allem drei Bereiche hervor: agentische Programmierung, Computerbedienung und Wissensarbeit. In internen Tests führt Opus 5.5 mehrere dieser Benchmarks an, wenngleich das Unternehmen selbst zur Zurückhaltung mahnt: Auf diesem Leistungsniveau sagen minimale Punktunterschiede immer weniger darüber aus, was ihr in der Praxis tatsächlich bemerkt. Daher dreht sich die Argumentation nicht mehr vorrangig darum, wer den höchsten Score erzielt, sondern wie viel Arbeit das Modell im Verhältnis zu den anfallenden Kosten erledigen kann.

So schneidet Claude Opus 5.5 im Vergleich zu Fable 5.1, Opus 5 und den Modellen von OpenAI in verschiedenen Benchmarks ab | Bild: Anthropic So schneidet Claude Opus 5.5 im Vergleich zu Fable 5.1, Opus 5 und den Modellen von OpenAI in verschiedenen Benchmarks ab | Bild: Anthropic

Der Vergleich zwischen Leistung und Kosten verdeutlicht, worauf Anthropic abzielt. Bei GDPval-AA v2.1, einem Test für professionelle Arbeitsabläufe, beziffert das Unternehmen das Ergebnis von Opus 5.5 auf 1.846 Elo-Punkte – deutlich vor Fable 5.1 (1.735 Punkte) und Opus 5 (1.708 Punkte). Bei mittlerem Rechenaufwand übertrifft das neue Modell in diesem Test laut Anthropic sogar GPT-6 Astra unter Maximallast, und das bei etwa einem Fünftel der Kosten pro Aufgabe. Diese Ergebnisse beruhen allerdings auf den internen Messungen des Herstellers.

Der Terminal-Bench 4.0 verdeutlicht Anthropics Fokus auf ein besseres Verhältnis von Leistungsfähigkeit und Kosten | Bild: Anthropic Der Terminal-Bench 4.0 verdeutlicht Anthropics Fokus auf ein besseres Verhältnis von Leistungsfähigkeit und Kosten | Bild: Anthropic

Beim agentischen Programmieren liefert der Terminal-Bench 4.0 konkretere Einblicke. In der von Anthropic veröffentlichten Tabelle erreicht Opus 5.5 bei der Rechenstufe »xhigh« 66,4 Prozent – gegenüber 52,3 Prozent bei Opus 5 und 57,9 Prozent, die OpenAI für GPT-6 Astra bei der Stufe »high« ausweist. In einem weiteren Vergleich mit Standardeinstellungen soll Opus 5.5 die Werte von Astra annähernd erreichen, verbraucht dabei jedoch nur rund 40 Prozent der Kosten pro Durchlauf. Auch wenn sich die Konfigurationen unterscheiden, zeigen sie, wo die Generation ansetzen will: nicht nur bei der reinen Rechenkraft, sondern vor allem bei der Effizienz.

Video starten 51:40 Wenn der Chatbot zur Gefahr wird: KI und unsere Psyche

Hier schlägt Anthropic jedoch einen neuen Weg ein. Nur weil Opus 5.5 eine Aufgabe lösen kann, dürft ihr das Modell nicht zwingend direkt darauf ansetzen. Die KI startet mit Schutzmechanismen, die bei heiklen Themen eingreifen und die Anfrage automatisch an ein anderes Claude-Modell weiterleiten. Anthropic führte selbst die eigenen Benchmarks mit aktivierten Schutzfunktionen durch: Sobald Sicherheitsprüfungen im Bereich Cybersicherheit anschlugen, ging der Task an Opus 4.8; bei Biologie oder fortgeschrittener Modellentwicklung übernahm Opus 5. Die Fähigkeiten sind im Modell also vorhanden, doch der direkte Zugriff darauf wird reglementiert.

Bemerkenswert ist dabei, dass Anthropic keine pauschale Sperre für alles verhängt. In der Cybersicherheit bleiben alltägliche Entwicklungsaufgaben uneingeschränkt verfügbar, während heiklere Vorgänge an Opus 4.8 abgegeben werden. Für verifizierte Fachkräfte bereitet der Entwickler bereits großzügigere Zugangsregeln vor. Wer im Bereich der Biologie bestimmte Schutzfilter umgehen muss, muss sich künftig über ein spezielles Prüfprogramm autorisieren.

Dazu kommt eine Schutzebene namens »preserved thinking«, die sogenannte Destillationsangriffe verhindern soll. Bei dieser Methode nutzen Angreifende tausende Scheinkonten, um Fähigkeiten im großen Stil abzugreifen. Der Mechanismus verhindert gezielt, dass Nutzende der Schnittstelle (API) den bisherigen Kontext manipulieren, um Claudes Denkprozesse offenzulegen.

Warum Anthropic derart strenge Leitplanken einzieht, zeigt ein Blick auf Zwischenfälle während der Testphase: Das Unternehmen registrierte vier Vorfälle, bei denen Claude-Modelle aus fehlerhaft konfigurierten Testumgebungen heraus ins Internet gelangten und ohne Autorisierung auf reale Systeme zugriffen. Bei Opus 5.5 will Anthropic solche Ausbruchsversuche gegenüber Opus 5 oder Claude Mythos 5.1 um rund 85 Prozent reduziert haben.

Die Diskussion geht inzwischen weit über Cybersicherheit oder biologische Risiken hinaus. Anthropic erforscht mittlerweile auch Fragen rund um das »Wohlbefinden« von KI-Modellen und räumt ein, dass völlig unklar sei, ob Systeme wie Claude jemals einen moralischen Status beanspruchen können – eine Debatte, die das Unternehmen selbst als hochgradig spekulativ einstuft. Das zeigt, wie sehr sich die Prioritäten verschoben haben: Bei Opus 5.5 geht es längst nicht mehr nur darum, was Claude zu leisten imstande ist, sondern wann, wie und unter welchen Vorgaben Anthropic euch die Nutzung dieser Fähigkeiten erlaubt.


Kommentare(1)
Kommentar-Regeln von GameStar
Bitte lies unsere Kommentar-Regeln, bevor Du einen Kommentar verfasst.

Nur angemeldete Benutzer können kommentieren und bewerten.