Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization Paper • 2605.04700 • Published May 6 • 1
MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration Paper • 2608.05909 • Published 26 days ago
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation Paper • 2502.07557 • Published Feb 11, 2025