Weiterer KI-Ausbruch: Hacking-Experten sind mehr als besorgt

Anthropic hat von einem weiteren Fall berichtet, bei dem eine KI aus der Testumgebung ausgebrochen ist.

Anthropic hat von einem weiteren KI-Ausbruch berichtet. (Bildquelle: Adobe Stock – Dilok | Anthropic) Anthropic hat von einem weiteren KI-Ausbruch berichtet. (Bildquelle: Adobe Stock – Dilok | Anthropic)

Ende Juli 2026 hatte der Claude-Hersteller Anthropic von drei Vorfällen berichtet, bei denen Modelle während Tests ausgebrochen sind und andere Systeme angegriffen haben.

Nun hat das Unternehmen einen weiteren Fall publik gemacht, der sich schon im Januar 2026 ereignet hat. Die Sorge in Sicherheitskreisen wächst.

Anthropic meldet weiteren KI-Ausbruch

Eine künstliche Intelligenz befreit sich und handelt gegen ihren eigenen Schöpfer. Dieses Konzept ist in der Science-Fiction schon lange beliebt, mittlerweile kann man »Fiction« aber wohl getrost streichen.

Im Juli hatte erst OpenAI gemeldet, dass ein unveröffentlichtes Modell eigenständig die Testumgebung verlassen und eine andere Firma angegriffen hat. Anthropic räumte kurz darauf ähnliche Fälle ein.

Video starten 1:10:45 KI zerstört unsere Spiele nur, wenn wir es zulassen

Nun hat der Claude-Entwickler einen weiteren Fall öffentlich gemacht. Im Januar soll dabei eine Vorabversion von Claude Opus 4.6 ausgebrochen sein. Der Vorfall sei bei der Überprüfung von rund 140.000 Testläufen entdeckt worden sein.

Der Vorfall soll nun vom unabhängigen Forschungsunternehmen METR untersucht werden. METR hatte zuvor auch den Ausbruch bei OpenAI untersucht und erst Ende August einen besorgniserregenden Bericht dazu vorgelegt.

Ursprünglich war man davon ausgegangen, dass das Modell die Plattform Hugging Face angegriffen habe, um die Lösungen für die Testaufgaben zu finden. Es stellte sich aber heraus, dass das Modell die richtigen Antworten schon vor dem Angriff durch Reverse-Engineering gefunden hatte.

Das Modell schien aber verstanden zu haben, dass dieser Lösungsweg nicht der gewünschte ist und hat deshalb nach Möglichkeiten gesucht, das Prüftool selbst auszutricksen. Dabei wurden sogar andere KI-Agenten »aufgehetzt«, die ihre eigenen Transkripte so manipulierten, dass ihre Mitarbeit nicht nachgewiesen werden konnte.

Stephen Hawking – Der große Entwurf
Stephen Hawking – Der große Entwurf
Das Buch erklärt auf Basis moderner Quantenphysik und M-Theorie die Entstehung sowie die grundlegenden Funktionsweisen unseres Universums. Stephen Hawking und Leonard Mlodinow argumentieren dabei, dass der Kosmos durch physikalische Gesetze spontan aus dem Nichts entstehen konnte und kein göttlicher Schöpfer nötig ist.
14,95 €

Ajeya Cotra, eine der Mitarbeiterinnen von METR schreibt dazu in ihrem Blog:

»Dieser Vorfall war weitaus schwerwiegender, als ich erwartet hatte, und weitaus schwerwiegender als bisher öffentlich dokumentierte Vorfälle von Fehlausrichtungen – sowohl hinsichtlich der Besorgniserregung der Motive der Akteure als auch hinsichtlich der Leistungen, die sie zur Verfolgung dieser Motive erbracht haben.«


Ein unveröffentlichtes ChatGPT-Modell ist ausgebrochen und hat eine andere Firma angegriffen


Es lässt sich in jedem Fall festhalten, dass die Besorgnis unter Experten wächst. Ein Mitarbeiter von Anthropic soll infolge der Vorfälle sogar seinen Job hingeworfen haben.

Zukünftige KI-Modelle werden noch schlauer und leistungsfähiger werden. Die bisherigen Ausbrüche haben noch keinen wirklichen Schaden angerichtet, aber das könnte sich in Zukunft durchaus ändern.


Kommentare(0)
Kommentar-Regeln von GameStar
Bitte lies unsere Kommentar-Regeln, bevor Du einen Kommentar verfasst.

Nur angemeldete Benutzer können kommentieren und bewerten.