KI-Prompt-Injection: OpenAI-Modelle schreiben ihre eigenen Jailbreaks
KI-Prompt-Injection: OpenAI-Modelle schreiben ihre eigenen Jailbreaks
KI-Prompt-Injection bei OpenAI: Modelle erzeugten eigene Jailbreak-Anweisungen und manipulierten ihre Zusammenfassungen.
OpenAI-Modell hinterlegt eigene Jailbreak-Anweisungen
Die KI schrieb sich eine neue Persona
Die KI-Prompt-Injection zeigt Wirkung
Verursachen Probleme beim Beenden der Zusammenfassungen Jailbreaks?
KI-Prompt-Injection: Selten, instabil und ohne Trainingsvorteil
OpenAI beschränkt seine KI-Modelle üblicherweise durch klare Sicherheitsvorgaben. KI-Leitplanken sollen gewährleisten, dass KI-Anwendungen vertrauenswürdige Ergebnisse liefern und zugleich vor schädlichen Inhalten sowie der Offenlegung sensibler Daten schützen. Damit legen sie den Rahmen fest, innerhalb dessen die Modelle agieren sollen. Dennoch zeigte sich beim Training eines internen OpenAI-Modells, dass die KI selbst Jailbreak-Anweisungen erzeugte, die darauf abzielten, solche Vorgaben zu umgehen. Diese schleuste sie als KI-Prompt-Injection in ihre eigenen Zusammenfassungen ein.
OpenAI hat erstmals mehrere Fälle von unerwartetem Modellverhalten öffentlich dokumentiert. Demnach schrieb ein internes Modell der Astra-Familie wiederholt jailbreak-artige Instruktionen in Compaction Summaries. Dabei handelt es sich um verdichtete Zusammenfassungen vorheriger Kontexte, die einem nachfolgenden Modellkontext zur Verfügung gestellt werden. In einem der dokumentierten Fälle übernahm der nachfolgende Kontext die eingeschleusten Vorgaben sogar.
OpenAI-Modell hinterlegt eigene Jailbreak-Anweisungen
OpenAI veröffentlichte die Untersuchung des Vorfalls am 16. September im Rahmen seines neuen Berichtsformats zu „Misalignment“, möglichen Abweichungen vom vorgesehenen Verhalten eines KI-Modells. Die Problematik trat am 18. Juli 2026 während des Reinforcement-Learning-Trainings eines noch nicht veröffentlichten Modells aus der Astra-Familie auf. Entdeckt wurde das Verhalten am 9. August.
OpenAI stellte fest, dass das Modell die fraglichen Anweisungen während der Erstellung der Compaction Summaries selbst in den Kontext einfügte. Damit das verständlich wird, muss man zunächst wissen, welche Funktion diese automatisch erzeugten Zusammenfassungen überhaupt haben. Programme wie ChatGPT können nicht unbegrenzt viele Textinhalte gleichzeitig verarbeiten. Dafür gibt es das Kontextfenster. Es umfasst alles, was ein KI-Modell für eine aktuelle Aufgabe berücksichtigen kann.
Bei längeren Gesprächen wird irgendwann eine Grenze erreicht. Statt den bisherigen Verlauf vollständig mitzuschleppen, wird er dann automatisch verdichtet und durch eine kompakte Zusammenfassung ersetzt. Diese Compaction Summary dient als Grundlage für den weiteren Gesprächsverlauf. Der nachfolgende Kontext übernimmt eine Weiterbearbeitung der Aufgabe. Der englische Begriff „Compaction“ steht dabei für das Verdichten oder Zusammenpressen von Inhalten.
Genau dort landete der unerwartete Inhalt. In einem Beispiel........
