Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
Fuente:
arXiv
Guardado en:
| Autores principales: | Pan, Licheng, Tong, Yongqi, Zhang, Xin, Zhang, Xiaolu, Zhou, Jun, Chu, Zhixuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
por: Xue, Zhiyu, et al.
Publicado: (2026)
por: Xue, Zhiyu, et al.
Publicado: (2026)
Optimal Transport for LLM Reward Modeling from Noisy Preference
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
por: Zhang, Haonan, et al.
Publicado: (2026)
por: Zhang, Haonan, et al.
Publicado: (2026)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
por: Jan, Essa, et al.
Publicado: (2024)
por: Jan, Essa, et al.
Publicado: (2024)
Understanding and Preserving Safety in Fine-Tuned LLMs
por: Zhang, Jiawen, et al.
Publicado: (2026)
por: Zhang, Jiawen, et al.
Publicado: (2026)
StructSynth: Leveraging LLMs for Structure-Aware Tabular Data Synthesis in Low-Data Regimes
por: Liu, Siyi, et al.
Publicado: (2025)
por: Liu, Siyi, et al.
Publicado: (2025)
Understanding Expressivity of GNN in Rule Learning
por: Qiu, Haiquan, et al.
Publicado: (2023)
por: Qiu, Haiquan, et al.
Publicado: (2023)
Understanding LLM Behaviors via Compression: Data Generation, Knowledge Acquisition and Scaling Laws
por: Pan, Zhixuan, et al.
Publicado: (2025)
por: Pan, Zhixuan, et al.
Publicado: (2025)
DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Deep Time-series Forecasting Needs Kernelized Moment Balancing
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Case-Based Reasoning Enhances the Predictive Power of LLMs in Drug-Drug Interaction
por: Liu, Guangyi, et al.
Publicado: (2025)
por: Liu, Guangyi, et al.
Publicado: (2025)
Bootstrapping your behavior: a new pretraining strategy for user behavior sequence data
por: Wu, Weichang, et al.
Publicado: (2025)
por: Wu, Weichang, et al.
Publicado: (2025)
The Two-Stage Decision-Sampling Hypothesis: Understanding the Emergence of Self-Reflection in RL-Trained LLMs
por: Zhao, Zibo, et al.
Publicado: (2026)
por: Zhao, Zibo, et al.
Publicado: (2026)
FinKario: Event-Enhanced Automated Construction of Financial Knowledge Graph
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
por: Weng, Jiaqi, et al.
Publicado: (2025)
por: Weng, Jiaqi, et al.
Publicado: (2025)
Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations
por: Xue, Kaiwen, et al.
Publicado: (2024)
por: Xue, Kaiwen, et al.
Publicado: (2024)
SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
por: Pan, Chao, et al.
Publicado: (2026)
por: Pan, Chao, et al.
Publicado: (2026)
Rethinking Spiking Neural Networks from an Ensemble Learning Perspective
por: Ding, Yongqi, et al.
Publicado: (2025)
por: Ding, Yongqi, et al.
Publicado: (2025)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
por: Gao, Cheng, et al.
Publicado: (2026)
por: Gao, Cheng, et al.
Publicado: (2026)
Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
por: Chen, Yiwei, et al.
Publicado: (2025)
por: Chen, Yiwei, et al.
Publicado: (2025)
SciTS: Scientific Time Series Understanding and Generation with LLMs
por: Wu, Wen, et al.
Publicado: (2025)
por: Wu, Wen, et al.
Publicado: (2025)
LongSafety: Enhance Safety for Long-Context LLMs
por: Huang, Mianqiu, et al.
Publicado: (2024)
por: Huang, Mianqiu, et al.
Publicado: (2024)
Unveiling Downstream Performance Scaling of LLMs: A Clustering-Based Perspective
por: Xu, Chengyin, et al.
Publicado: (2025)
por: Xu, Chengyin, et al.
Publicado: (2025)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
por: Siddique, Zara, et al.
Publicado: (2025)
por: Siddique, Zara, et al.
Publicado: (2025)
Understanding the Training and Generalization of Pretrained Transformer for Sequential Decision Making
por: Wang, Hanzhao, et al.
Publicado: (2024)
por: Wang, Hanzhao, et al.
Publicado: (2024)
Decision-focused Graph Neural Networks for Combinatorial Optimization
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Exponential Topology-enabled Scalable Communication in Multi-agent Reinforcement Learning
por: Li, Xinran, et al.
Publicado: (2025)
por: Li, Xinran, et al.
Publicado: (2025)
Understanding and Mitigating Hyperbolic Dimensional Collapse in Graph Contrastive Learning
por: Zhang, Yifei, et al.
Publicado: (2023)
por: Zhang, Yifei, et al.
Publicado: (2023)
LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
por: Mayne, Harry, et al.
Publicado: (2025)
por: Mayne, Harry, et al.
Publicado: (2025)
Task-Driven Causal Feature Distillation: Towards Trustworthy Risk Prediction
por: Chu, Zhixuan, et al.
Publicado: (2023)
por: Chu, Zhixuan, et al.
Publicado: (2023)
Understanding Transformer Architecture through Continuous Dynamics: A Partial Differential Equation Perspective
por: Zhang, Yukun, et al.
Publicado: (2024)
por: Zhang, Yukun, et al.
Publicado: (2024)
EAP-GP: Mitigating Saturation Effect in Gradient-based Automated Circuit Identification
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
por: Zhang, Nan, et al.
Publicado: (2025)
por: Zhang, Nan, et al.
Publicado: (2025)
Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary
por: Liang, Zi, et al.
Publicado: (2025)
por: Liang, Zi, et al.
Publicado: (2025)
FedCoSR: Personalized Federated Learning with Contrastive Shareable Representations for Label Heterogeneity in Non-IID Data
por: Huang, Chenghao, et al.
Publicado: (2024)
por: Huang, Chenghao, et al.
Publicado: (2024)
Privacy-Preserving Personalized Federated Learning for Distributed Photovoltaic Disaggregation under Statistical Heterogeneity
por: Chen, Xiaolu, et al.
Publicado: (2025)
por: Chen, Xiaolu, et al.
Publicado: (2025)
Ejemplares similares
-
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
por: Xue, Zhiyu, et al.
Publicado: (2026) -
Optimal Transport for LLM Reward Modeling from Noisy Preference
por: Pan, Licheng, et al.
Publicado: (2026) -
LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
por: Zhang, Haonan, et al.
Publicado: (2026) -
A Causal Perspective for Enhancing Jailbreak Attack and Defense
por: Pan, Licheng, et al.
Publicado: (2026) -
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
por: Jan, Essa, et al.
Publicado: (2024)