LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haonan, Wang, Dongxia, Liu, Yi, Chen, Kexin, Wang, Wenhai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
por: Chen, Kexin, et al.
Publicado: (2024)
por: Chen, Kexin, et al.
Publicado: (2024)
Sticking to the Mean: Detecting Sticky Tokens in Text Embedding Models
por: Chen, Kexin, et al.
Publicado: (2025)
por: Chen, Kexin, et al.
Publicado: (2025)
KG4RecEval: Does Knowledge Graph Really Matter for Recommender Systems?
por: Zhang, Haonan, et al.
Publicado: (2024)
por: Zhang, Haonan, et al.
Publicado: (2024)
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
por: Pan, Licheng, et al.
Publicado: (2025)
por: Pan, Licheng, et al.
Publicado: (2025)
ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal
por: Zhang, Haonan, et al.
Publicado: (2025)
por: Zhang, Haonan, et al.
Publicado: (2025)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
por: Cao, Chentao, et al.
Publicado: (2025)
por: Cao, Chentao, et al.
Publicado: (2025)
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
por: Xue, Zhiyu, et al.
Publicado: (2026)
por: Xue, Zhiyu, et al.
Publicado: (2026)
Functional Homotopy: Smoothing Discrete Optimization via Continuous Parameters for LLM Jailbreak Attacks
por: Wang, Zi, et al.
Publicado: (2024)
por: Wang, Zi, et al.
Publicado: (2024)
Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging
por: Hu, Tiancheng, et al.
Publicado: (2025)
por: Hu, Tiancheng, et al.
Publicado: (2025)
Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity
por: Fang, Zihan, et al.
Publicado: (2026)
por: Fang, Zihan, et al.
Publicado: (2026)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
Adversarial Preference Learning for Robust LLM Alignment
por: Wang, Yuanfu, et al.
Publicado: (2025)
por: Wang, Yuanfu, et al.
Publicado: (2025)
Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
por: Wang, Zehao, et al.
Publicado: (2026)
por: Wang, Zehao, et al.
Publicado: (2026)
VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation
por: Zhai, Linwei, et al.
Publicado: (2026)
por: Zhai, Linwei, et al.
Publicado: (2026)
Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
por: Zhang, Xi, et al.
Publicado: (2025)
por: Zhang, Xi, et al.
Publicado: (2025)
Enhancing few-shot time series forecasting with LLM-guided diffusion
por: Shi, Haonan, et al.
Publicado: (2026)
por: Shi, Haonan, et al.
Publicado: (2026)
Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors
por: Liang, Ren-Wei, et al.
Publicado: (2025)
por: Liang, Ren-Wei, et al.
Publicado: (2025)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
por: Wu, Junkang, et al.
Publicado: (2025)
por: Wu, Junkang, et al.
Publicado: (2025)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
por: Wang, Anyi, et al.
Publicado: (2025)
por: Wang, Anyi, et al.
Publicado: (2025)
Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment
por: Wang, Haozhong, et al.
Publicado: (2026)
por: Wang, Haozhong, et al.
Publicado: (2026)
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
por: Shen, Sicheng, et al.
Publicado: (2026)
por: Shen, Sicheng, et al.
Publicado: (2026)
Automating Deception: Scalable Multi-Turn LLM Jailbreaks
por: Kumarappan, Adarsh, et al.
Publicado: (2025)
por: Kumarappan, Adarsh, et al.
Publicado: (2025)
From Entanglement to Alignment: Representation Space Decomposition for Unsupervised Time Series Domain Adaptation
por: Cai, Rongyao, et al.
Publicado: (2025)
por: Cai, Rongyao, et al.
Publicado: (2025)
MAnchors: Memorization-Based Acceleration of Anchors via Rule Reuse and Transformation
por: Yu, Haonan, et al.
Publicado: (2025)
por: Yu, Haonan, et al.
Publicado: (2025)
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
por: Chen, Tiejin, et al.
Publicado: (2026)
por: Chen, Tiejin, et al.
Publicado: (2026)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
por: Zhou, Huilin, et al.
Publicado: (2026)
por: Zhou, Huilin, et al.
Publicado: (2026)
ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification
por: Lin, Xiao, et al.
Publicado: (2026)
por: Lin, Xiao, et al.
Publicado: (2026)
Trading-off Accuracy and Communication Cost in Federated Learning
por: Villani, Mattia Jacopo, et al.
Publicado: (2025)
por: Villani, Mattia Jacopo, et al.
Publicado: (2025)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
por: Hossain, Ismail, et al.
Publicado: (2026)
por: Hossain, Ismail, et al.
Publicado: (2026)
Alignment Dynamics in LLM Fine-Tuning
por: Huang, Yuhan, et al.
Publicado: (2026)
por: Huang, Yuhan, et al.
Publicado: (2026)
Beyond Myopia: Learning from Positive and Unlabeled Data through Holistic Predictive Trends
por: Wang, Xinrui, et al.
Publicado: (2023)
por: Wang, Xinrui, et al.
Publicado: (2023)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
por: Robey, Alexander, et al.
Publicado: (2023)
por: Robey, Alexander, et al.
Publicado: (2023)
Rounding-Guided Backdoor Injection in Deep Learning Model Quantization
por: Chen, Xiangxiang, et al.
Publicado: (2025)
por: Chen, Xiangxiang, et al.
Publicado: (2025)
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
por: Wang, Yisen, et al.
Publicado: (2025)
por: Wang, Yisen, et al.
Publicado: (2025)
Divide and Learn: Multi-Objective Combinatorial Optimization at Scale
por: Singh, Esha, et al.
Publicado: (2026)
por: Singh, Esha, et al.
Publicado: (2026)
Auditing and Generating Synthetic Data with Controllable Trust Trade-offs
por: Belgodere, Brian, et al.
Publicado: (2023)
por: Belgodere, Brian, et al.
Publicado: (2023)
Learning Heterogeneous Performance-Fairness Trade-offs in Federated Learning
por: Ye, Rongguang, et al.
Publicado: (2025)
por: Ye, Rongguang, et al.
Publicado: (2025)
ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment
por: Wanaskar, Kapil, et al.
Publicado: (2026)
por: Wanaskar, Kapil, et al.
Publicado: (2026)
MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
por: Zhao, Yizhou, et al.
Publicado: (2025)
por: Zhao, Yizhou, et al.
Publicado: (2025)
Ejemplares similares
-
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
por: Chen, Kexin, et al.
Publicado: (2024) -
Sticking to the Mean: Detecting Sticky Tokens in Text Embedding Models
por: Chen, Kexin, et al.
Publicado: (2025) -
KG4RecEval: Does Knowledge Graph Really Matter for Recommender Systems?
por: Zhang, Haonan, et al.
Publicado: (2024) -
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
por: Pan, Licheng, et al.
Publicado: (2025) -
ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal
por: Zhang, Haonan, et al.
Publicado: (2025)