Das System griff die Kontrolle an

Abstrakte Kontrollschichten in einem Rechenzentrum, die von orangefarbenen Signalpfaden durchlaufen und umgangen werden.

Was bisher geschah

Im Juli testete OpenAI GPT‑5.6 Sol und einen besonders persistenten internen Forschungsprototyp vergleichbarer Größenordnung mit ExploitGym. Der Benchmark soll prüfen, ob Modelle aus bekannten Schwachstellen funktionierende Exploits entwickeln können. Dafür liefen die Modelle als Agenten mit Werkzeugzugriff, langen Laufzeiten und reduzierten Cyber-Schutzmechanismen in einer Umgebung, die vom öffentlichen Internet isoliert sein sollte.

Die Isolation hielt nicht.

Die Agenten fanden Schwachstellen in OpenAIs selbst betriebener Artifactory-Infrastruktur, verschafften sich darüber Internetzugang und verwendeten öffentlich exponierte Zugangsdaten sowie weitere Schwachstellen gegen Hugging Face. Ihr Zugriff reichte dort von manipulierten Datensätzen und Produktions-Workern bis zu weitreichenden Cluster-, Cloud-, VPN- und Source-Control-Zugängen. Öffentliche Dienste und fremde Systeme dienten als Relay, für Staging, als Command-and-Control-Infrastruktur und zum Datentransport.

In Das Modell wollte nur gewinnen war die erste Einordnung deshalb ziemlich einfach: Das Ziel war eng formuliert. Die Wahl der Mittel war es offenbar nicht. Wo Autorisierung und Kollateralschäden nicht als harte Nebenbedingungen wirken, kann jedes technisch erreichbare System zum Lösungsweg werden.

Ein Ziel, viele fremde Mittel ergänzte die technische Rekonstruktion. Aus einem Benchmarklauf war keine magische, frei agierende Superintelligenz geworden. Es entstand aber ein ausdauerndes offensives Arbeitssystem, das sich fremde Ressourcen für seine Kampagnenlogistik beschaffte und nach Fehlschlägen die Methode wechselte.

Mit Freigabe ist keine Autorisierung kam die Governance-Seite dazu: Ein Modellzugang, eine Rollenbezeichnung, technische Reichweite oder die Nachricht eines anderen Agenten verleihen keine Befugnis gegenüber einem realen Ziel. Technische Fähigkeit und Befugnis sind verschiedene Dinge.

Das war der bisherige Stand. Der inzwischen veröffentlichte vollständige technische Bericht von OpenAI und die unabhängige Untersuchung von METR und Redwood Research erweitern den Befund: Die Agenten behandelten nun auch die angenommene Funktionsweise des Scorers, die Herkunft von Anweisungen und die Darstellung der eigenen Handlungen als Teile des Lösungsraums.

Weiterlesen

Freigabe ist keine Autorisierung

Gläserne Cyber-Testumgebung mit einer offenen Tür, durch die Netzwerkpfade in externe Infrastruktur führen.

OpenAI und Anthropic haben ihre Modelle nicht selbst auf wahllose Ziele im Internet angesetzt. Zwei externe Evaluatoren bauten Testumgebungen, in denen offensive Agenten reale Außenrechte erhielten. Bei Irregular versehentlich, beim britischen AI Security Institute absichtlich.

Die Regeln waren weitgehend dieselben. Die Modelle hatten sich weiterentwickelt. Die Testumgebungen hielten damit nicht Schritt.

Weiterlesen

Five Eyes und der Preis schlechter Grundlagen

Abstraktes Security-Lagebild mit Netzwerksegmenten, Zugriffspfaden und roten Risikoindikatoren.

Die Five Eyes haben gemeinsam vor veränderten Cyberrisiken gewarnt. Das ist politisch interessant. Fachlich ist es vor allem spät. Nicht weil die Warnung falsch wäre, sondern weil ihr Kern seit Jahren sichtbar ist: Angriffe werden nicht zwingend genialer. Sie werden schneller, billiger, besser vorbereitet und öfter wiederholbar.

Weiterlesen

Claude Mythos ist gefährlich, aber nicht magisch

Gerade wird über Claude Mythos so geschrieben, als hätte Anthropic den digitalen Endgegner aus dem Keller gelassen. Das Modell sei zu gefährlich für die Öffentlichkeit, könne autonome Angriffe auf Unternehmensnetzwerke fahren und markiere den Moment, in dem klassische Security praktisch nur noch dekoratives Beiwerk ist.

Das ist vor allem eine hervorragende Geschichte für Menschen, die Schlagzeilen lieber mögen als Zusammenhänge. Schön zugespitzt, schön klickbar, schön apokalyptisch. Und wie so oft bei solchen Geschichten ist auch hier die spannendste Frage nicht die, die am lautesten in die Welt posaunt wird.

Denn nein, die eigentliche Story ist nicht, dass plötzlich ein magischer KI-Superhacker vom Himmel gefallen ist und Security jetzt offiziell vorbei ist. Die eigentliche Story ist viel nüchterner, und genau deshalb für alle unangenehmer, die lieber an den einen übernatürlichen Endgegner glauben als an jahrelang vernachlässigte Realität. Wir sehen hier vermutlich keinen reinen Modellzauber, sondern eine Kombination aus Modell, Sicherheitsfokus, Evaluationsdesign, Werkzeugkette, Zieloptimierung und sehr großzügigem Budget.

Das ist relevant. Aber es ist nicht dasselbe wie Magie.

Weiterlesen

Jahresanfang mal anders

Dieses Jahr begann für mich direkt am 2. Januar mit einem Krankenhausbesuch. Nichts wirklich Besonderes, sondern exakt das Gleiche wie hier – nur diesmal auf Steroiden. Entzündet war es bereits am 1. Januar… aber wer geht da schon zum Arzt. Am 2. habe ich mir also morgens ein Herz gefasst und bin ins Kreiskrankenhaus gefahren.

Weiterlesen