When ‘Competency’ in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers
Published in NeurIPS 2025 Reliable ML from Unreliable Data Workshop (non-archival), 2024
We propose a jailbreaking technique that encodes malicious queries with layered novel ciphers, exploiting LLMs ability to interpret complex instructions, increasing jailbreaking success rates from 40% to 78%.
