Boosting Jailbreak Attack with Momentum
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yihao, Wei, Zeming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
por: Zhang, Yihao, et al.
Publicado: (2024)
por: Zhang, Yihao, et al.
Publicado: (2024)
Secure LLM Fine-Tuning via Safety-Aware Probing
por: Wu, Chengcan, et al.
Publicado: (2025)
por: Wu, Chengcan, et al.
Publicado: (2025)
Exploring the Robustness of In-Context Learning with Noisy Labels
por: Cheng, Chen, et al.
Publicado: (2024)
por: Cheng, Chen, et al.
Publicado: (2024)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
por: Zhang, Zhixin, et al.
Publicado: (2025)
por: Zhang, Zhixin, et al.
Publicado: (2025)
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
por: Wei, Zeming, et al.
Publicado: (2026)
por: Wei, Zeming, et al.
Publicado: (2026)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
por: Zhang, Yihao, et al.
Publicado: (2024)
por: Zhang, Yihao, et al.
Publicado: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Calibrated Adversarial Sampling: Multi-Armed Bandit-Guided Generalization Against Unforeseen Attacks
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024)
por: Mo, Yichuan, et al.
Publicado: (2024)
Identifying and Understanding Cross-Class Features in Adversarial Training
por: Wei, Zeming, et al.
Publicado: (2025)
por: Wei, Zeming, et al.
Publicado: (2025)
Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation
por: Wu, Chengcan, et al.
Publicado: (2025)
por: Wu, Chengcan, et al.
Publicado: (2025)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
por: Wei, Zeming, et al.
Publicado: (2023)
por: Wei, Zeming, et al.
Publicado: (2023)
MILE: A Mutation Testing Framework of In-Context Learning Systems
por: Wei, Zeming, et al.
Publicado: (2024)
por: Wei, Zeming, et al.
Publicado: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Approximate and Weighted Data Reconstruction Attack in Federated Learning
por: Song, Yongcun, et al.
Publicado: (2023)
por: Song, Yongcun, et al.
Publicado: (2023)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
por: Fang, Zhicheng, et al.
Publicado: (2026)
por: Fang, Zhicheng, et al.
Publicado: (2026)
On Model Protection in Federated Learning against Eavesdropping Attacks
por: Maity, Dipankar, et al.
Publicado: (2025)
por: Maity, Dipankar, et al.
Publicado: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
por: Luan, Xiaokun, et al.
Publicado: (2025)
por: Luan, Xiaokun, et al.
Publicado: (2025)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
por: Qian, Cheng, et al.
Publicado: (2024)
por: Qian, Cheng, et al.
Publicado: (2024)
A Queueing-Theoretic Framework for Dynamic Attack Surfaces: Data-Integrated Risk Analysis and Adaptive Defense
por: Yun, Jihyeon, et al.
Publicado: (2026)
por: Yun, Jihyeon, et al.
Publicado: (2026)
SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing
por: Sun, Jialong, et al.
Publicado: (2026)
por: Sun, Jialong, et al.
Publicado: (2026)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023)
por: Mehrotra, Anay, et al.
Publicado: (2023)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
por: Li, Xiao, et al.
Publicado: (2024)
por: Li, Xiao, et al.
Publicado: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Clip-and-Verify: Linear Constraint-Driven Domain Clipping for Accelerating Neural Network Verification
por: Zhou, Duo, et al.
Publicado: (2025)
por: Zhou, Duo, et al.
Publicado: (2025)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
por: Jiang, Weisen, et al.
Publicado: (2025)
por: Jiang, Weisen, et al.
Publicado: (2025)
RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
por: Wei, Zeming, et al.
Publicado: (2026)
por: Wei, Zeming, et al.
Publicado: (2026)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024)
por: Lin, Shi, et al.
Publicado: (2024)
Characterizing the Training Dynamics of Private Fine-tuning with Langevin diffusion
por: Ke, Shuqi, et al.
Publicado: (2024)
por: Ke, Shuqi, et al.
Publicado: (2024)
Correlated Noise Provably Beats Independent Noise for Differentially Private Learning
por: Choquette-Choo, Christopher A., et al.
Publicado: (2023)
por: Choquette-Choo, Christopher A., et al.
Publicado: (2023)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
Jailbreaking in the Haystack
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
Jailbreaking with Universal Multi-Prompts
por: Hsu, Yu-Ling, et al.
Publicado: (2025)
por: Hsu, Yu-Ling, et al.
Publicado: (2025)
Jailbreaking LLMs via Calibration
por: Lu, Yuxuan, et al.
Publicado: (2026)
por: Lu, Yuxuan, et al.
Publicado: (2026)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models
por: Wang, Kai, et al.
Publicado: (2025)
por: Wang, Kai, et al.
Publicado: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
por: Zhu, Sicheng, et al.
Publicado: (2024)
por: Zhu, Sicheng, et al.
Publicado: (2024)
Rethinking How to Evaluate Language Model Jailbreak
por: Cai, Hongyu, et al.
Publicado: (2024)
por: Cai, Hongyu, et al.
Publicado: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
por: Bethany, Emet, et al.
Publicado: (2024)
por: Bethany, Emet, et al.
Publicado: (2024)
Ejemplares similares
-
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
por: Zhang, Yihao, et al.
Publicado: (2024) -
Secure LLM Fine-Tuning via Safety-Aware Probing
por: Wu, Chengcan, et al.
Publicado: (2025) -
Exploring the Robustness of In-Context Learning with Noisy Labels
por: Cheng, Chen, et al.
Publicado: (2024) -
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
por: Zhang, Zhixin, et al.
Publicado: (2025) -
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
por: Wei, Zeming, et al.
Publicado: (2026)