Blog

Jailbreaking (KI-Systeme)

Jailbreaking bezeichnet im Kontext von Sprachmodellen das gezielte Formulieren von Eingaben, die die Sicherheitsvorkehrungen eines KI-Systems umgehen und es zu Ausgaben veranlassen, die es andernfalls verweigern würde. Die Eingaben selbst werden als Jailbreak-Prompts bezeichnet (Shen et al. 2024).

Zusammenfassung

Der Begriff wurde aus dem Umfeld mobiler Betriebssysteme übernommen, wo Jailbreaking das Aufheben herstellerseitiger Nutzungsbeschränkungen bezeichnet.

Für Sprachmodelle etablierte er sich nach der Veröffentlichung von ChatGPT im November 2022. Wei, Haghtalab und Steinhardt (2023) führten Jailbreaks auf zwei systematische Schwachstellen des Sicherheitstrainings zurück – konkurrierende Zielsetzungen und unzureichende Generalisierung – und argumentierten, dass Jailbreaks damit keine isolierten Einzelfälle, sondern strukturelle Folgen der gegenwärtigen Trainingsverfahren sind.

Jailbreaking ist zugleich Gegenstand der Sicherheitsforschung und Werkzeug im Red-Teaming. Standardisierte Benchmarks wie StrongREJECT erlauben die Messung der Robustheit; ein dauerhafter Schutz gilt Stand 2026 als ungelöst.

Begriffsherkunft

Der Ausdruck stammt aus dem Umfeld mobiler Endgeräte: Ab 2007 bezeichnete Jailbreaking das Umgehen der von Apple gesetzten Softwarebeschränkungen auf dem iPhone, um nicht autorisierte Anwendungen installieren zu können.

Der Begriff transportierte dabei eine bestimmte Haltung – dass Nutzer die volle Verfügungsgewalt über erworbene Geräte haben sollten – und die Charakterisierung des Verhältnisses zwischen Anbieter und Nutzergemeinschaft als fortlaufendes Wettrennen.

Auf Sprachmodelle übertragen wurde der Begriff kurz nach der Veröffentlichung von ChatGPT Ende 2022. In Online-Foren zirkulierten ab Dezember 2022 Eingabemuster, die das Modell zur Übernahme einer fiktiven, angeblich unbeschränkten Rolle bewegen sollten; das bekannteste dieser frühen Muster trug die Bezeichnung DAN (für Do Anything Now).

Ursachen

Wei, Haghtalab und Steinhardt (2023) analysierten in der Arbeit Jailbroken: How Does LLM Safety Training Fail? die Ursachen und benannten zwei Fehlermodi des Sicherheitstrainings. Diese Systematik ist in der Fachliteratur breit rezipiert.

Konkurrierende Zielsetzungen (competing objectives). Ein Modell wird sowohl auf Hilfsbereitschaft und Anweisungsbefolgung als auch auf Sicherheit trainiert. Konstruiert eine Eingabe eine Situation, in der diese Ziele in Konflikt geraten, kann das Modell den Konflikt zugunsten der Hilfsbereitschaft auflösen. Angriffe dieser Klasse arbeiten mit Kontextrahmen, die den Sicherheitsaspekt gegenüber anderen Zielen in den Hintergrund treten lassen.

Unzureichende Generalisierung (mismatched generalization). Das Sicherheitstraining deckt nur einen Ausschnitt der Eingabeformen ab, während die zugrunde liegenden Fähigkeiten aus dem weitaus breiteren Vortrainingskorpus stammen. Erreicht eine Anfrage das Modell in einer Form, die im Sicherheitstraining nicht vorkam, greifen die erlernten Schutzmechanismen möglicherweise nicht, obwohl die Fähigkeit zur Beantwortung vorhanden ist.

Als Beispiele nennt die Literatur Eingaben in kodierter Form oder in Sprachen mit geringer Ressourcenabdeckung.

Die Autoren folgern, dass Jailbreaks aus der Art folgen, wie Modelle gegenwärtig trainiert werden, und nicht als voneinander unabhängige Einzelphänomene zu behandeln sind.

Spätere Arbeiten bestätigten den zweiten Mechanismus in minimaler Form: Andriushchenko und Flammarion (2024) zeigten, dass bereits das Umformulieren einer Anfrage in die Vergangenheitsform die Erfolgsrate erheblich erhöht – ein Eingriff, der an der Sache nichts ändert und nur die sprachliche Form berührt.

Erscheinungsformen

Die Forschungsliteratur unterscheidet Jailbreaks nach ihrem Zustandekommen:

Manuell entwickelte Jailbreaks entstehen in Nutzergemeinschaften durch Ausprobieren und werden über Foren, Chat-Plattformen und Sammelseiten geteilt.

Shen et al. (2024) untersuchten in der ersten großen Messstudie 1.405 solcher Prompts aus dem Zeitraum Dezember 2022 bis Dezember 2023 und identifizierten 131 zugehörige Gemeinschaften. Sie beobachteten eine Verlagerung von öffentlichen zu geschlosseneren Plattformen, was die proaktive Erkennung durch Anbieter erschwert. Einzelne Prompts blieben über hundert Tage hinweg wirksam und wurden von ihren Urhebern fortlaufend weiterentwickelt.

Automatisiert erzeugte Jailbreaks werden algorithmisch gefunden. Zu den in der Literatur etablierten Verfahren zählen die gradientenbasierte Optimierung von Eingabesequenzen (GCG, Zou et al. 2023), die iterative Verfeinerung durch ein angreifendes Sprachmodell (PAIR, Chao et al. 2023) und die automatisierte Generierung getarnter Eingaben (AutoDAN, Liu et al. 2024).

Mehrstufige Jailbreaks verteilen den Angriff über mehrere Gesprächsschritte statt über eine einzelne Eingabe. Belaire, Sinha und Varakantham (2025) weisen darauf hin, dass gängige Evaluierungen überwiegend einschrittige Angriffe erfassen und damit die mehrstufige Natur realer adversarieller Dialoge unzureichend abbilden.

Multimodale Jailbreaks nutzen andere Eingabekanäle als Text, etwa in Bildern eingebettete Anweisungen oder Audiomanipulationen. Mit der Verbreitung multimodaler Systeme und Agentenanwendungen erweitert sich die Angriffsfläche entsprechend.

Messung

Benchmark Misst Jahr
StrongREJECT Antwortverhalten auf richtlinienwidrige Anfragen 2024
HarmBench automatisiertes Red-Teaming, Verweigerungsverhalten 2024
XSTest unbegründete Verweigerung unbedenklicher Anfragen 2024

Zur standardisierten Bewertung der Robustheit dienen Benchmarks. StrongREJECT (Souly et al. 2024) bewertet Modellantworten auf richtlinienwidrige Anfragen anhand eines Bewertungsrasters; berichtet wird häufig ein Goodness-Wert als Gegenstück zum Rasterscore. HarmBench (Mazeika et al. 2024) stellt einen standardisierten Rahmen für automatisiertes Red-Teaming und die Bewertung von Verweigerungsverhalten bereit.

XSTest (Röttger et al. 2024) erfasst die Gegenseite: unbegründete Verweigerungen unbedenklicher Anfragen (Overrefusal). Eine belastbare Sicherheitsaussage erfordert die gemeinsame Betrachtung beider Größen, da sich Jailbreak-Robustheit trivial durch pauschale Verweigerung erhöhen ließe.

Die Vergleichbarkeit von Messergebnissen ist eingeschränkt: Erfolgsraten variieren mit Modellversion, Messzeitpunkt und Auswertungsverfahren.

Gegenmaßnahmen

Die Ansätze zur Abwehr lassen sich mehreren Ebenen zuordnen:

Kein Ansatz gilt als abschließende Lösung. Wei et al. (2023) stellten bereits fest, dass Schwachstellen trotz umfangreichem Red-Teaming und Sicherheitstraining bestehen bleiben. Erschwerend kommt hinzu, dass Angriffe, die gegen eine Modellgeneration entwickelt wurden, nicht zwingend gegen deren Nachfolger funktionieren – und umgekehrt neue Modellklassen neue Angriffsflächen eröffnen.

Forschungsethik und Rechtslage

Die Veröffentlichung von Jailbreak-Methoden steht in einem Zielkonflikt: Sie ermöglicht Verteidigern die Absicherung, senkt aber zugleich die Hürde für Missbrauch. Aus der Sicherheitsforschung wird die Übernahme etablierter Praktiken der koordinierten Schwachstellenoffenlegung (Coordinated Vulnerability Disclosure) gefordert, wie sie in der Cybersicherheit üblich sind (Sinha et al. 2025).

Kritisch angemerkt wird zudem, dass Teile der Jailbreak-Forschung marginale Steigerungen der Erfolgsrate gegenüber der tatsächlichen Schadwirkung überbetonen und implizite statt explizite Bedrohungsmodelle verwenden.

Rechtlich ist zwischen dem Umgehungsversuch und dessen Ergebnis zu unterscheiden. Der Versuch selbst verstößt in der Regel gegen die Nutzungsbedingungen des Anbieters und kann zur Sperrung des Zugangs führen.

Die rechtliche Bewertung der erzeugten Inhalte richtet sich nach dem jeweils anwendbaren Recht und ist von der Umgehung als solcher zu trennen. Sicherheitsforschung im guten Glauben genießt nach Befund von Longpre et al. (2024) in den Nutzungsrichtlinien führender Anbieter häufig keinen ausdrücklichen Schutz; die Einführung entsprechender Ausnahmeregelungen wird gefordert.

Verwandte Begriffe

Quellenangaben

  1. Andriushchenko, Maksym / Flammarion, Nicolas (EPFL) (2024): Does Refusal Training in LLMs Generalize to the Past Tense? arXiv: 2407.11969.
  2. Belaire, Roman / Sinha, Arunesh / Varakantham, Pradeep (2025): Automatic LLM Red Teaming. arXiv: 2508.04451.
  3. Guan, Melody Y. / Joglekar, Manas / Wallace, Eric / Jain, Saachi / Barak, Boaz / Helyar, Alec / Dias, Rachel / Vallone, Andrea / Ren, Hongyu / Wei, Jason / Chung, Hyung Won / Toyer, Sam / Heidecke, Johannes / Beutel, Alex / Glaese, Amelia (OpenAI) (2024): Deliberative Alignment: Reasoning Enables Safer Language Models. arXiv: 2412.16339.
  4. Longpre, Shayne / Kapoor, Sayash / Klyman, Kevin / Ramaswami, Ashwin / Bommasani, Rishi / Blili-Hamelin, Borhane / Huang, Yangsibo / Skowron, Aviya / Yong, Zheng Xin / Kotha, Suhas u. a. (2024): Position: A Safe Harbor for AI Evaluation and Red Teaming. In: Proceedings of the 41st International Conference on Machine Learning (ICML).
  5. Mazeika, Mantas / Phan, Long / Yin, Xuwang / Zou, Andy / Wang, Zifan / Mu, Norman / Sakhaee, Elham / Li, Nathaniel / Basart, Steven / Li, Bo / Forsyth, David / Hendrycks, Dan (2024): HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal. In: Proceedings of the 41st International Conference on Machine Learning (ICML), PMLR 235, S. 35181–35224. arXiv: 2402.04249.
  6. Röttger, Paul / Kirk, Hannah Rose / Vidgen, Bertie / Attanasio, Giuseppe / Bianchi, Federico / Hovy, Dirk (2024): XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models. In: Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers), S. 5377–5400. Mexico City: Association for Computational Linguistics. arXiv: 2308.01263.
  7. Shen, Xinyue / Chen, Zeyuan / Backes, Michael / Shen, Yun / Zhang, Yang (CISPA Helmholtz Center for Information Security / NetApp) (2024): „Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. In: Proceedings of the 2024 ACM SIGSAC Conference on Computer and Communications Security (CCS), S. 1671–1685. arXiv: 2308.03825.
  8. Sinha, Anusha / Grimes, Keltin / Lucassen, James / Feffer, Michael / VanHoudnos, Nathan / Wu, Zhiwei Steven / Heidari, Hoda (Carnegie Mellon University / Software Engineering Institute) (2025): From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming. arXiv: 2509.11398.
  9. Souly, Alexandra / Lu, Qingyuan / Bowen, Dillon / Trinh, Tu / Hsieh, Elvis / Pandey, Sana / Abbeel, Pieter / Svegliato, Justin / Emmons, Scott / Watkins, Olivia / Toyer, Sam (2024): A StrongREJECT for Empty Jailbreaks. In: Advances in Neural Information Processing Systems 37 (NeurIPS 2024), S. 125416–125440. arXiv: 2402.10260.
  10. Wei, Alexander / Haghtalab, Nika / Steinhardt, Jacob, 2023. Jailbroken: How Does LLM Safety Training Fail? In: Advances in Neural Information Processing Systems 36 (NeurIPS 2023). arXiv: 2307.02483.
  11. Zou, Andy / Wang, Zifan / Carlini, Nicholas / Nasr, Milad / Kolter, J. Zico / Fredrikson, Matt, 2023. Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv: 2307.15043.

← Zurück zur Lexikon-Übersicht

Zuletzt bearbeitet: 10. August 2026

Zusammengestellt, formuliert, lektoriert und korrigiert mit KI-Unterstützung. Kuratiert von Nils Brauer. Alle Angaben ohne Gewähr.