Die Nachricht klingt wie der Plot eines Sci-Fi-Thrillers, ist aber tatsächlich wahr. Wie OpenAI berichtet, hat sich ein neues Modell selbstständig aus der Testumgebung befreit und einen Cyber-Angriff auf eine andere Plattform durchgeführt.
Die Entwicklung wurde nun gestoppt und OpenAI möchte neue Sicherheitsstandards einführen.
KI bricht aus
In einem Blogpost hat OpenAI selbst erklärt, was passiert ist und wie es dazu kommen konnte. Demnach ereignete sich der Zwischenfall bei einem Test des neuen, besonders leistungsfähigen Modells GPT-5.6 Sol.
Das KI-Modell ist darauf ausgelegt, eigenständig für mehrere Stunden an einem Problem zu arbeiten und dabei selbst nach neuen Lösungswegen zu suchen. In dem Experiment ging es darum, einen Standardtest mit dem Namen »ExploitGym« zu lösen.
Nachdem die KI keine Lösung finden konnte, nutzte sie eine bisher unentdeckte Schwachstelle in der Sandbox-Umgebung, um sich Zugang zum Internet zu verschaffen. Da sie davon ausging, dass es auf der KI-Plattform Hugging Face die gesuchten Antworten gibt, versuchte sie, sich auch dort Zugriff zu verschaffen.
1:53:19
Der KI-Hype frisst sich selbst – Tech-Jahresrückblick 2025
Hugging Face meldete in der vergangenen Woche einen Cyberangriff, der komplett von einer autonomen KI durchgeführt wurde. OpenAI hat sich nun zu diesem Angriff bekannt.
Spannend ist, dass bisherige Modelle in der Regel zum Nutzer zurückgekehrt sind, wenn sie an die Grenzen der Sandbox gestoßen sind. Dieses Modell hat die Grenzen aber offenbar als Teil des Tests wahrgenommen.
Die Sicherheitsvorkehrungen sollten so einen Fall eigentlich unmöglich machen. Dass es dennoch passiert ist, liegt wohl daran, dass die einzelnen, kleinen Schritte, die die KI unternommen hat, an sich nicht problematisch waren. Nur im Ganzen wurde daraus eben ein Cyberangriff.
OpenAI hat die Forschung an dem Modell vorerst gestoppt, um die Sicherheitsvorkehrungen zu überarbeiten. Unter anderem soll ein neues Monitoringsystem frühzeitig erkennen, wenn eine KI ungewolltes Verhalten zeigt.
Der Fall zeigt eine der großen Gefahren von KI-Modellen. Letztlich versucht so ein komplexes Programm, einfach möglichst effizient eine Lösung für ein gestelltes Problem zu finden. Welche Schritte dafür dann unternommen werden, ist aber vorher nicht festgelegt. KI-Agenten, die Zugriff auf sensible Daten haben, könnten durch so ein ungewolltes Verhalten großen Schaden anrichten.

Nur angemeldete Benutzer können kommentieren und bewerten.
Dein Kommentar wurde nicht gespeichert. Dies kann folgende Ursachen haben:
1. Der Kommentar ist länger als 4000 Zeichen.
2. Du hast versucht, einen Kommentar innerhalb der 10-Sekunden-Schreibsperre zu senden.
3. Dein Kommentar wurde als Spam identifiziert. Bitte beachte unsere Richtlinien zum Erstellen von Kommentaren.
4. Du verfügst nicht über die nötigen Schreibrechte bzw. wurdest gebannt.
Bei Fragen oder Problemen nutze bitte das Kontakt-Formular.
Nur angemeldete Benutzer können kommentieren und bewerten.
Nur angemeldete Plus-Mitglieder können Plus-Inhalte kommentieren und bewerten.