Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Zhanhui, Liu, Jie, Dong, Zhichen, Liu, Jiaheng, Yang, Chao, Ouyang, Wanli, Qiao, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
von: Liu, Jie, et al.
Veröffentlicht: (2024)
von: Liu, Jie, et al.
Veröffentlicht: (2024)
Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey
von: Dong, Zhichen, et al.
Veröffentlicht: (2024)
von: Dong, Zhichen, et al.
Veröffentlicht: (2024)
Inference-Time Language Model Alignment via Integrated Value Guidance
von: Liu, Zhixuan, et al.
Veröffentlicht: (2024)
von: Liu, Zhixuan, et al.
Veröffentlicht: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024)
von: Bai, Ge, et al.
Veröffentlicht: (2024)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models
von: Zhou, Yi, et al.
Veröffentlicht: (2025)
von: Zhou, Yi, et al.
Veröffentlicht: (2025)
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems
von: Fukui, Hiroki
Veröffentlicht: (2026)
von: Fukui, Hiroki
Veröffentlicht: (2026)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
von: Li, Zherui, et al.
Veröffentlicht: (2025)
von: Li, Zherui, et al.
Veröffentlicht: (2025)
Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities
von: Liu, Zhichen, et al.
Veröffentlicht: (2026)
von: Liu, Zhichen, et al.
Veröffentlicht: (2026)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
von: Liu, Qin, et al.
Veröffentlicht: (2024)
von: Liu, Qin, et al.
Veröffentlicht: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
von: Wang, Zekun Moore, et al.
Veröffentlicht: (2023)
von: Wang, Zekun Moore, et al.
Veröffentlicht: (2023)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
von: Alssum, Lama, et al.
Veröffentlicht: (2025)
von: Alssum, Lama, et al.
Veröffentlicht: (2025)
When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
von: Sadanandan, Binesh, et al.
Veröffentlicht: (2026)
von: Sadanandan, Binesh, et al.
Veröffentlicht: (2026)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
von: Yang, Zonglin, et al.
Veröffentlicht: (2024)
von: Yang, Zonglin, et al.
Veröffentlicht: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
von: Lu, Yida, et al.
Veröffentlicht: (2025)
von: Lu, Yida, et al.
Veröffentlicht: (2025)
BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment
von: Zhang, Shaolei, et al.
Veröffentlicht: (2024)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2024)
Detecting Subtle Differences between Human and Model Languages Using Spectrum of Relative Likelihood
von: Xu, Yang, et al.
Veröffentlicht: (2024)
von: Xu, Yang, et al.
Veröffentlicht: (2024)
Progressively Label Enhancement for Large Language Model Alignment
von: Liu, Biao, et al.
Veröffentlicht: (2024)
von: Liu, Biao, et al.
Veröffentlicht: (2024)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
von: Zong, Xuanjun, et al.
Veröffentlicht: (2025)
von: Zong, Xuanjun, et al.
Veröffentlicht: (2025)
REEF: Representation Encoding Fingerprints for Large Language Models
von: Zhang, Jie, et al.
Veröffentlicht: (2024)
von: Zhang, Jie, et al.
Veröffentlicht: (2024)
Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
von: Qian, Chen, et al.
Veröffentlicht: (2024)
von: Qian, Chen, et al.
Veröffentlicht: (2024)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
von: Liu, Biao, et al.
Veröffentlicht: (2025)
von: Liu, Biao, et al.
Veröffentlicht: (2025)
Extensive Self-Contrast Enables Feedback-Free Language Model Alignment
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
FactAlign: Long-form Factuality Alignment of Large Language Models
von: Huang, Chao-Wei, et al.
Veröffentlicht: (2024)
von: Huang, Chao-Wei, et al.
Veröffentlicht: (2024)
Lifelong Safety Alignment for Language Models
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
dLLM: Simple Diffusion Language Modeling
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2026)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2026)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
von: Gu, Tianle, et al.
Veröffentlicht: (2024)
von: Gu, Tianle, et al.
Veröffentlicht: (2024)
ChemLLM: A Chemical Large Language Model
von: Zhang, Di, et al.
Veröffentlicht: (2024)
von: Zhang, Di, et al.
Veröffentlicht: (2024)
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
von: Zhang, Zhibo, et al.
Veröffentlicht: (2025)
von: Zhang, Zhibo, et al.
Veröffentlicht: (2025)
PopAlign: Diversifying Contrasting Patterns for a More Comprehensive Alignment
von: Wang, Zekun Moore, et al.
Veröffentlicht: (2024)
von: Wang, Zekun Moore, et al.
Veröffentlicht: (2024)
E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity
von: Li, Yun, et al.
Veröffentlicht: (2023)
von: Li, Yun, et al.
Veröffentlicht: (2023)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
von: Zhang, Jinchuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jinchuan, et al.
Veröffentlicht: (2025)
Semantic Gravity Wells: Why Negative Constraints Backfire
von: Rana, Shailesh
Veröffentlicht: (2026)
von: Rana, Shailesh
Veröffentlicht: (2026)
Ähnliche Einträge
-
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024) -
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
von: Liu, Jie, et al.
Veröffentlicht: (2024) -
Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey
von: Dong, Zhichen, et al.
Veröffentlicht: (2024) -
Inference-Time Language Model Alignment via Integrated Value Guidance
von: Liu, Zhixuan, et al.
Veröffentlicht: (2024) -
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024)