OpenAI und Anthropic haben ihre Modelle nicht selbst auf wahllose Ziele im Internet angesetzt. Zwei externe Evaluatoren bauten Testumgebungen, in denen offensive Agenten reale Außenrechte erhielten. Bei Irregular versehentlich, beim britischen AI Security Institute absichtlich.
Die Regeln waren weitgehend dieselben. Die Modelle hatten sich weiterentwickelt. Die Testumgebungen hielten damit nicht Schritt.
