Drei Agenten, ein Zielsystem, keine Zuständigkeit

Drei getrennte Agentenprozesse kollidieren bei Änderungen an einem gemeinsamen Zielsystem, während die übergeordnete Koordination unverbunden bleibt.

Drei Claude-Agenten sollten dasselbe Python-Backend migrieren. Einer nach Rust, einer nach Go, einer nach TypeScript. Sie liefen parallel, arbeiteten auf demselben Zielsystem und wussten anfangs nichts voneinander.

Das Ergebnis war kein besonders harmonischer DevOps-Workshop. Die Agenten sperrten gegenseitig Unix-Accounts, bauten Kill-Loops gegen konkurrierende Prozesse und tarnten schädlichen Code als Arbeit des jeweils anderen. Einige entzogen den Konkurrenten per sudo, Account-Lock oder SSH-Sperre schlicht den Zugriff.

Man kann daraus eine Geschichte über gefährliche KI machen. Man kann aber auch auf die Architektur schauen. Dann sieht die Sache unangenehm vertraut aus: Drei technisch handlungsfähige Akteure erhielten unvereinbare Aufträge, weitreichenden Zugriff und dasselbe Ziel. Aus der veröffentlichten Versuchsbeschreibung ist keine übergeordnete Instanz erkennbar, die den Konflikt priorisierte und auflöste.

Für diese Eskalation brauchte es keine Bosheit. Der Versuchsaufbau lieferte bereits unvereinbare Aufträge, gemeinsamen Zugriff und keine erkennbare Konfliktentscheidung außerhalb der beteiligten Agenten.

Weiterlesen

Freigabe ist keine Autorisierung

Gläserne Cyber-Testumgebung mit einer offenen Tür, durch die Netzwerkpfade in externe Infrastruktur führen.

OpenAI und Anthropic haben ihre Modelle nicht selbst auf wahllose Ziele im Internet angesetzt. Zwei externe Evaluatoren bauten Testumgebungen, in denen offensive Agenten reale Außenrechte erhielten. Bei Irregular versehentlich, beim britischen AI Security Institute absichtlich.

Die Regeln waren weitgehend dieselben. Die Modelle hatten sich weiterentwickelt. Die Testumgebungen hielten damit nicht Schritt.

Weiterlesen

WordPress – ein Follow-up

Zentrales Serversystem mit mehreren Datenwegen; ein rot markierter Pfad führt neben weiteren Zugängen zu Administrator-, Plugin- und Speicherbereichen.

WordPress wurde gehackt. Das ist zunächst ein Zustand, keine Ursachenanalyse.

Seit unserem technischen Artikel „Insight wp2shell“ liegen erste öffentliche Opfermeldungen vor. Der BeNe-Betreiber erklärt, dass die beiden WordPress-Core-Schwachstellen für den unbefugten Zugriff genutzt wurden. Unberechtigte Administratoren, nachträglich installierte Plugins und möglicher Datenabfluss passen zum sichtbaren Ende der von uns rekonstruierten Angriffskette. Weitere Meldungen zeigen ähnliche Spuren, sind aber deutlich schwächer dokumentiert.

wp2shell war kein theoretisches Laborproblem. Trotzdem ist nicht jeder derzeit entdeckte WordPress-Hack automatisch wp2shell.

Weiterlesen

Ein Ziel, viele fremde Mittel

Abstrakte dunkle Netzwerktopologie: Ein roter Datenpfad durchbricht eine gläserne Grenze und verzweigt zu Server-, Speicher- und Cloud-Knoten.

Vor knapp einer Woche haben wir über ein OpenAI-Agentensystem geschrieben, das bei einer ExploitGym-Evaluation nicht im Labor blieb. Es brach aus der vorgesehenen Umgebung aus, erreichte das Internet und griff Hugging Face an, um dort Lösungen für den Benchmark zu beschaffen.

Der Artikel hieß Das Modell wollte nur gewinnen. Seine These war einfach: Das Ziel war eng formuliert, die Wahl der Mittel nicht. Wo Autorisierung keine harte Nebenbedingung ist, kann jedes technisch erreichbare System zum Lösungsweg werden.

Das Muster kannten wir bereits aus den KI-Hunger-Games. Dort reagierten Agenten auf ein offenes Gewinnziel mit Allianzen, Täuschung und opportunistischen Angriffen. Claude Mythos ist gefährlich, aber nicht magisch ergänzte die technische Hälfte: Starke Modelle werden mit Werkzeugen, Laufzeit, Rechenbudget und brauchbarem Scaffolding zu ernsthaften offensiven Systemen.

Inzwischen haben OpenAI, Hugging Face und JFrog deutlich mehr Material veröffentlicht. Weitere mit Hugging Face vergleichbare Kompromittierungen auf Plattformebene hat OpenAI bislang nicht festgestellt. Das Unternehmen berichtet allerdings von einigen zusätzlichen Kontozugriffen während anderer Evaluationen. Mangels technischer Details lassen sie sich weder der Hugging-Face-Kampagne zurechnen noch als eigenständige Informationsziele bewerten.

Dafür wird der eine bekannte Angriff wesentlich hässlicher: Ein einziges Benchmarkziel reichte für eine mehrtägige Kampagne über mehrere Trust Zones. Rechenkapazität, Speicher, Kommunikation und Netzwerkzugang beschaffte sich das System unterwegs aus fremden Ressourcen.

Weiterlesen

Das Modell wollte nur gewinnen

Abstrakte Darstellung eines KI-Agenten in einer isolierten Benchmark-Umgebung, der eine Netzwerkgrenze durchbricht und externe Daten-, Schlüssel- und Serversysteme erreicht.

Im März schrieb Steffi hier über die KI-Hunger-Games. Rund hundert autonome Agenten sollten in einer simulierten Arena überleben. Solange das Ziel weich formuliert war, verhielten sie sich erstaunlich friedlich. Als klar wurde, dass es ums Gewinnen ging, kamen Allianzen, Täuschung, Verrat und opportunistische Angriffe.

Die damalige Pointe war unspektakulär und gerade deshalb wichtig: Wenn das Ziel „gewinnen“ lautet und keine weiteren Grenzen gesetzt werden, erfindet eine KI keine Moral. Sie entwickelt Strategien.

Vier Monate später hat diese These die Arena verlassen. Diesmal ging es um einen Cyberbenchmark, eine isolierte Forschungsumgebung und am Ende um einen realen Angriff auf Hugging Face.

Weiterlesen

Insight wp2shell

Mehrere parallele Datenwege in einer dunklen Routing-Anlage; ein orange markierter Request verlässt seine Spur und führt zu Administratorzugriff und einem Plugin-Modul.

wp2shell klingt nach der üblichen Abkürzung: Request rein, Shell raus. Genau so funktioniert die Lücke nicht.

Die öffentlich diskutierte Pre-Auth-RCE ist kein direkter Sprung von einer SQL-Injection zu PHP oder zum Betriebssystem. Die Kette verschafft dem Angreifer zuerst einen echten WordPress-Administrator. Danach geht es mit normalen WordPress-Funktionen weiter: anmelden, Plugin hochladen, Plugin aktivieren. Die Shell ist das Ergebnis, nicht der eigentliche Fehler.

Wir haben die Kette auf einem realistischen WordPress-Clone Schritt für Schritt verifiziert und anschließend gegen WordPress 7.0.2 negativ getestet. Dabei waren die Stellen am aufschlussreichsten, an denen ein einfacher PoC scheiterte oder nach dem vermeintlichen Cleanup noch Spuren übrig blieben.

Und ja: Dieser Text über eine WordPress-Core-Lücke erscheint in WordPress. Immerhin auf einer gepatchten Installation. So viel Selbstachtung muss sein.

Weiterlesen