The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions
Fuente:
arXiv
Guardado en:
| Autores principales: | Pan, Wenbo, Liu, Zhichao, Chen, Qiguang, Zhou, Xiangyang, Yu, Haining, Jia, Xiaohua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
por: Pan, Wenbo, et al.
Publicado: (2025)
por: Pan, Wenbo, et al.
Publicado: (2025)
WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation
por: Liu, Zhichao, et al.
Publicado: (2026)
por: Liu, Zhichao, et al.
Publicado: (2026)
Surfacing Semantic Orthogonality Across Model Safety Benchmarks: A Multi-Dimensional Analysis
por: Bennion, Jonathan, et al.
Publicado: (2025)
por: Bennion, Jonathan, et al.
Publicado: (2025)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
por: Brito, Iago Alves, et al.
Publicado: (2026)
por: Brito, Iago Alves, et al.
Publicado: (2026)
Orthogonal Finetuning for Direct Preference Optimization
por: Yang, Chenxu, et al.
Publicado: (2024)
por: Yang, Chenxu, et al.
Publicado: (2024)
Safety Alignment via Constrained Knowledge Unlearning
por: Shi, Zesheng, et al.
Publicado: (2025)
por: Shi, Zesheng, et al.
Publicado: (2025)
DLPO: Towards a Robust, Efficient, and Generalizable Prompt Optimization Framework from a Deep-Learning Perspective
por: Peng, Dengyun, et al.
Publicado: (2025)
por: Peng, Dengyun, et al.
Publicado: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
COSMIC: Generalized Refusal Direction Identification in LLM Activations
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
por: Luo, Haozheng, et al.
Publicado: (2026)
por: Luo, Haozheng, et al.
Publicado: (2026)
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
por: Chen, Tiejin, et al.
Publicado: (2025)
por: Chen, Tiejin, et al.
Publicado: (2025)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
por: Zhou, Zhanhui, et al.
Publicado: (2024)
por: Zhou, Zhanhui, et al.
Publicado: (2024)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
por: Sun, Chenkai, et al.
Publicado: (2025)
por: Sun, Chenkai, et al.
Publicado: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
por: Yang, Junxiao, et al.
Publicado: (2026)
por: Yang, Junxiao, et al.
Publicado: (2026)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
por: Bu, Yuyan, et al.
Publicado: (2026)
por: Bu, Yuyan, et al.
Publicado: (2026)
Adaptive Stopping for Multi-Turn LLM Reasoning
por: Zhou, Xiaofan, et al.
Publicado: (2026)
por: Zhou, Xiaofan, et al.
Publicado: (2026)
Principled Data Selection for Alignment: The Hidden Risks of Difficult Examples
por: Gao, Chengqian, et al.
Publicado: (2025)
por: Gao, Chengqian, et al.
Publicado: (2025)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
por: Li, Mingjie, et al.
Publicado: (2026)
por: Li, Mingjie, et al.
Publicado: (2026)
The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations
por: Zhu, Yubo, et al.
Publicado: (2025)
por: Zhu, Yubo, et al.
Publicado: (2025)
What Matters For Safety Alignment?
por: Li, Xing, et al.
Publicado: (2026)
por: Li, Xing, et al.
Publicado: (2026)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans
por: Kwon, Deuksin, et al.
Publicado: (2025)
por: Kwon, Deuksin, et al.
Publicado: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
por: Wang, Yanbo, et al.
Publicado: (2026)
por: Wang, Yanbo, et al.
Publicado: (2026)
KunlunBaize: LLM with Multi-Scale Convolution and Multi-Token Prediction Under TransformerX Framework
por: Li, Cheng, et al.
Publicado: (2025)
por: Li, Cheng, et al.
Publicado: (2025)
Northeastern Uni at Multilingual Counterspeech Generation: Enhancing Counter Speech Generation with LLM Alignment through Direct Preference Optimization
por: Wadhwa, Sahil, et al.
Publicado: (2024)
por: Wadhwa, Sahil, et al.
Publicado: (2024)
Multi-dimensional Data Analysis and Applications Basing on LLM Agents and Knowledge Graph Interactions
por: Wang, Xi, et al.
Publicado: (2025)
por: Wang, Xi, et al.
Publicado: (2025)
Flames: Benchmarking Value Alignment of LLMs in Chinese
por: Huang, Kexin, et al.
Publicado: (2023)
por: Huang, Kexin, et al.
Publicado: (2023)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
por: Zhang, Jingyu, et al.
Publicado: (2024)
por: Zhang, Jingyu, et al.
Publicado: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
por: Cheng, Ruoxi, et al.
Publicado: (2025)
por: Cheng, Ruoxi, et al.
Publicado: (2025)
Multiple LLM Agents Debate for Equitable Cultural Alignment
por: Ki, Dayeon, et al.
Publicado: (2025)
por: Ki, Dayeon, et al.
Publicado: (2025)
CrowdSelect: Synthetic Instruction Data Selection with Multi-LLM Wisdom
por: Li, Yisen, et al.
Publicado: (2025)
por: Li, Yisen, et al.
Publicado: (2025)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
por: Qiu, Zeju, et al.
Publicado: (2025)
por: Qiu, Zeju, et al.
Publicado: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
por: Kim, Dongyoung, et al.
Publicado: (2024)
por: Kim, Dongyoung, et al.
Publicado: (2024)
SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
por: Hao, Haochang, et al.
Publicado: (2026)
por: Hao, Haochang, et al.
Publicado: (2026)
Course-Correction: Safety Alignment Using Synthetic Preferences
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
Cat-DPO: Category-Adaptive Safety Alignment
por: Yang, Tiankai, et al.
Publicado: (2026)
por: Yang, Tiankai, et al.
Publicado: (2026)
SafeWorld: Geo-Diverse Safety Alignment
por: Yin, Da, et al.
Publicado: (2024)
por: Yin, Da, et al.
Publicado: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
por: Alssum, Lama, et al.
Publicado: (2025)
por: Alssum, Lama, et al.
Publicado: (2025)
Ejemplares similares
-
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
por: Pan, Wenbo, et al.
Publicado: (2025) -
WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation
por: Liu, Zhichao, et al.
Publicado: (2026) -
Surfacing Semantic Orthogonality Across Model Safety Benchmarks: A Multi-Dimensional Analysis
por: Bennion, Jonathan, et al.
Publicado: (2025) -
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
por: Zhou, Zhenhong, et al.
Publicado: (2024) -
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
por: Brito, Iago Alves, et al.
Publicado: (2026)