Weak-to-Strong Jailbreaking on Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Xuandong, Yang, Xianjun, Pang, Tianyu, Du, Chao, Li, Lei, Wang, Yu-Xiang, Wang, William Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024)
di: Lu, Dong, et al.
Pubblicazione: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
A Practical Examination of AI-Generated Text Detectors for Large Language Models
di: Tufts, Brian, et al.
Pubblicazione: (2024)
di: Tufts, Brian, et al.
Pubblicazione: (2024)
Permute-and-Flip: An optimally stable and watermarkable decoder for LLMs
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
Efficiently Identifying Watermarked Segments in Mixed-Source Texts
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
Many-Turn Jailbreaking
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
Denial-of-Service Poisoning Attacks against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
Diversity Helps Jailbreak Large Language Models
di: Zhao, Weiliang, et al.
Pubblicazione: (2024)
di: Zhao, Weiliang, et al.
Pubblicazione: (2024)
Purifying Large Language Models by Ensembling a Small Language Model
di: Li, Tianlin, et al.
Pubblicazione: (2024)
di: Li, Tianlin, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Unveiling the Misuse Potential of Base Large Language Models via In-Context Learning
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
In-Context Watermarks for Large Language Models
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models
di: Li, Jiahui, et al.
Pubblicazione: (2024)
di: Li, Jiahui, et al.
Pubblicazione: (2024)
Scalable Token-Level Hallucination Detection in Large Language Models
di: Min, Rui, et al.
Pubblicazione: (2026)
di: Min, Rui, et al.
Pubblicazione: (2026)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
di: Yang, Fan
Pubblicazione: (2025)
di: Yang, Fan
Pubblicazione: (2025)
Your Large Language Model is Secretly a Fairness Proponent and You Should Prompt it Like One
di: Li, Tianlin, et al.
Pubblicazione: (2024)
di: Li, Tianlin, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
A Closer Look at Machine Unlearning for Large Language Models
di: Yuan, Xiaojian, et al.
Pubblicazione: (2024)
di: Yuan, Xiaojian, et al.
Pubblicazione: (2024)
Quokka: An Open-source Large Language Model ChatBot for Material Science
di: Yang, Xianjun, et al.
Pubblicazione: (2024)
di: Yang, Xianjun, et al.
Pubblicazione: (2024)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
di: Kang, Zhewei, et al.
Pubblicazione: (2025)
di: Kang, Zhewei, et al.
Pubblicazione: (2025)
MultiAgent Collaboration Attack: Investigating Adversarial Attacks in Large Language Model Collaborations via Debate
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2024)
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning
di: Zhang, Xinlu, et al.
Pubblicazione: (2024)
di: Zhang, Xinlu, et al.
Pubblicazione: (2024)
Lifelong Safety Alignment for Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Can Large Language Models Automatically Jailbreak GPT-4V?
di: Wu, Yuanwei, et al.
Pubblicazione: (2024)
di: Wu, Yuanwei, et al.
Pubblicazione: (2024)
Training Optimal Large Diffusion Language Models
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement
di: Xu, Wenda, et al.
Pubblicazione: (2024)
di: Xu, Wenda, et al.
Pubblicazione: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
Kongzi: A Historical Large Language Model with Fact Enhancement
di: Yang, Jiashu, et al.
Pubblicazione: (2025)
di: Yang, Jiashu, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models with Morality Attacks
di: Su, Ying, et al.
Pubblicazione: (2026)
di: Su, Ying, et al.
Pubblicazione: (2026)
Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
di: Zhu, Junda, et al.
Pubblicazione: (2025)
di: Zhu, Junda, et al.
Pubblicazione: (2025)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
Variational Reasoning for Language Models
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025) -
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024) -
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024) -
A Practical Examination of AI-Generated Text Detectors for Large Language Models
di: Tufts, Brian, et al.
Pubblicazione: (2024) -
Permute-and-Flip: An optimally stable and watermarkable decoder for LLMs
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)