Merging Improves Self-Critique Against Jailbreak Attacks
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Gallego, Victor |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement
par: Gallego, Víctor
Publié: (2025)
par: Gallego, Víctor
Publié: (2025)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
The Critique of Critique
par: Sun, Shichao, et autres
Publié: (2024)
par: Sun, Shichao, et autres
Publié: (2024)
Extrapolation Merging: Keep Improving With Extrapolation and Merging
par: Lin, Yiguan, et autres
Publié: (2025)
par: Lin, Yiguan, et autres
Publié: (2025)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024)
par: Zhou, Andy, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging
par: Chen, Zijun, et autres
Publié: (2025)
par: Chen, Zijun, et autres
Publié: (2025)
Efficient Safety Retrofitting Against Jailbreaking for LLMs
par: Garcia-Gasulla, Dario, et autres
Publié: (2025)
par: Garcia-Gasulla, Dario, et autres
Publié: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Jailbreaking to Jailbreak
par: Kritz, Jeremy, et autres
Publié: (2025)
par: Kritz, Jeremy, et autres
Publié: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
par: Ouyang, Yang, et autres
Publié: (2025)
par: Ouyang, Yang, et autres
Publié: (2025)
Beyond Output Critique: Self-Correction via Task Distillation
par: Rahmani, Hossein A., et autres
Publié: (2026)
par: Rahmani, Hossein A., et autres
Publié: (2026)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
par: Li, Xiaoxia, et autres
Publié: (2024)
par: Li, Xiaoxia, et autres
Publié: (2024)
Configurable Safety Tuning of Language Models with Synthetic Preference Data
par: Gallego, Victor
Publié: (2024)
par: Gallego, Victor
Publié: (2024)
Configurable Preference Tuning with Rubric-Guided Synthetic Data
par: Gallego, Víctor
Publié: (2025)
par: Gallego, Víctor
Publié: (2025)
Discovering Agentic Safety Specifications from 1-Bit Danger Signals
par: Gallego, Víctor
Publié: (2026)
par: Gallego, Víctor
Publié: (2026)
MetaSC: Test-Time Safety Specification Optimization for Language Models
par: Gallego, Víctor
Publié: (2025)
par: Gallego, Víctor
Publié: (2025)
AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks
par: Siska, Charlotte, et autres
Publié: (2025)
par: Siska, Charlotte, et autres
Publié: (2025)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
par: Wang, Jiecong, et autres
Publié: (2025)
par: Wang, Jiecong, et autres
Publié: (2025)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
par: Yung, Canaan, et autres
Publié: (2024)
par: Yung, Canaan, et autres
Publié: (2024)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026)
par: Chen, Hao-Yuan
Publié: (2026)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
par: Gou, Zhibin, et autres
Publié: (2023)
par: Gou, Zhibin, et autres
Publié: (2023)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs
par: Zhou, Yuhang, et autres
Publié: (2025)
par: Zhou, Yuhang, et autres
Publié: (2025)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
par: Chen, Kexin, et autres
Publié: (2024)
par: Chen, Kexin, et autres
Publié: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks
par: Takemoto, Kazuhiro
Publié: (2024)
par: Takemoto, Kazuhiro
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Documents similaires
-
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024) -
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024) -
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026) -
Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement
par: Gallego, Víctor
Publié: (2025) -
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)