Guardrails in Logit Space: Safety Token Regularization for LLM Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bach, Thong, Tran, Truyen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Continual Safety Alignment via Gradient-Based Sample Selection
par: Bach, Thong, et autres
Publié: (2026)
par: Bach, Thong, et autres
Publié: (2026)
Rethinking Deep Alignment Through The Lens Of Incomplete Learning
par: Bach, Thong, et autres
Publié: (2025)
par: Bach, Thong, et autres
Publié: (2025)
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
par: Bach, Thong, et autres
Publié: (2025)
par: Bach, Thong, et autres
Publié: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
par: Li, Yuxi, et autres
Publié: (2024)
par: Li, Yuxi, et autres
Publié: (2024)
The Implicit Bias of Logit Regularization
par: Beck, Alon, et autres
Publié: (2026)
par: Beck, Alon, et autres
Publié: (2026)
Eigenvectors of Experts are Training-free Non-collapsing Routers
par: Do, Giang, et autres
Publié: (2026)
par: Do, Giang, et autres
Publié: (2026)
Robust SDE Parameter Estimation Under Missing Time Information Setting
par: Van Tran, Long, et autres
Publié: (2026)
par: Van Tran, Long, et autres
Publié: (2026)
Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
par: Krishna, Kundan, et autres
Publié: (2025)
par: Krishna, Kundan, et autres
Publié: (2025)
On the Role of Discrete Representation in Sparse Mixture of Experts
par: Do, Giang, et autres
Publié: (2024)
par: Do, Giang, et autres
Publié: (2024)
Consistency Regularization for Domain Generalization with Logit Attribution Matching
par: Gao, Han, et autres
Publié: (2023)
par: Gao, Han, et autres
Publié: (2023)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
par: Hsiung, Lei, et autres
Publié: (2025)
par: Hsiung, Lei, et autres
Publié: (2025)
Learning Structural Causal Models from Ordering: Identifiable Flow Models
par: Le, Minh Khoa, et autres
Publié: (2024)
par: Le, Minh Khoa, et autres
Publié: (2024)
Test-Time Training Undermines Safety Guardrails
par: Antonelli, Simone, et autres
Publié: (2026)
par: Antonelli, Simone, et autres
Publié: (2026)
Bypassing Safety Guardrails in LLMs Using Humor
par: Cisneros-Velarde, Pedro
Publié: (2025)
par: Cisneros-Velarde, Pedro
Publié: (2025)
Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning
par: Wang, Guoli, et autres
Publié: (2026)
par: Wang, Guoli, et autres
Publié: (2026)
Tokenized Bandit for LLM Decoding and Alignment
par: Shin, Suho, et autres
Publié: (2025)
par: Shin, Suho, et autres
Publié: (2025)
Score-based Integrated Gradient for Root Cause Explanations of Outliers
par: Nguyen, Phuoc, et autres
Publié: (2026)
par: Nguyen, Phuoc, et autres
Publié: (2026)
MP-PINN: A Multi-Phase Physics-Informed Neural Network for Epidemic Forecasting
par: Nguyen, Thang, et autres
Publié: (2024)
par: Nguyen, Thang, et autres
Publié: (2024)
Sparse Partial Optimal Transport via Quadratic Regularization
par: Tran, Khang, et autres
Publié: (2025)
par: Tran, Khang, et autres
Publié: (2025)
Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers
par: Kezins, Nikita, et autres
Publié: (2026)
par: Kezins, Nikita, et autres
Publié: (2026)
Guided by Guardrails: Control Barrier Functions as Safety Instructors for Robotic Learning
par: Guerrier, Maeva, et autres
Publié: (2025)
par: Guerrier, Maeva, et autres
Publié: (2025)
Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation
par: Fu, Yu, et autres
Publié: (2026)
par: Fu, Yu, et autres
Publié: (2026)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
ALSA: Anchors in Logit Space for Out-of-Distribution Accuracy Estimation
par: Liu, Chenzhi, et autres
Publié: (2025)
par: Liu, Chenzhi, et autres
Publié: (2025)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
par: Cho, Dongkyu Derek, et autres
Publié: (2025)
par: Cho, Dongkyu Derek, et autres
Publié: (2025)
GRIT: Graph-Regularized Logit Refinement for Zero-shot Cell Type Annotation
par: Hu, Tianxiang, et autres
Publié: (2025)
par: Hu, Tianxiang, et autres
Publié: (2025)
From Logits to Latents: Contrastive Representation Shaping for LLM Unlearning
par: Tang, Haoran, et autres
Publié: (2026)
par: Tang, Haoran, et autres
Publié: (2026)
ChargeFlow: Flow-Matching Refinement of Charge-Conditioned Electron Densities
par: Nguyen, Tri Minh, et autres
Publié: (2026)
par: Nguyen, Tri Minh, et autres
Publié: (2026)
Enhancing Length Extrapolation in Sequential Models with Pointer-Augmented Neural Memory
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment
par: Rad, Melissa Kazemi, et autres
Publié: (2025)
par: Rad, Melissa Kazemi, et autres
Publié: (2025)
Alignment with Preference Optimization Is All You Need for LLM Safety
par: Alami, Reda, et autres
Publié: (2024)
par: Alami, Reda, et autres
Publié: (2024)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
par: Yeon, Jehyeok, et autres
Publié: (2025)
par: Yeon, Jehyeok, et autres
Publié: (2025)
CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer
par: Bansal, Lavish, et autres
Publié: (2025)
par: Bansal, Lavish, et autres
Publié: (2025)
Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization
par: Niu, Yifan, et autres
Publié: (2025)
par: Niu, Yifan, et autres
Publié: (2025)
Generalized Sobolev Transport for Probability Measures on a Graph
par: Le, Tam, et autres
Publié: (2024)
par: Le, Tam, et autres
Publié: (2024)
Optimal Transport for Measures with Noisy Tree Metric
par: Le, Tam, et autres
Publié: (2023)
par: Le, Tam, et autres
Publié: (2023)
Optimal Denoising in Score-Based Generative Models: The Role of Data Regularity
par: Beyler, Eliot, et autres
Publié: (2025)
par: Beyler, Eliot, et autres
Publié: (2025)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
par: Abdulkadir, Perry
Publié: (2025)
par: Abdulkadir, Perry
Publié: (2025)
Documents similaires
-
Continual Safety Alignment via Gradient-Based Sample Selection
par: Bach, Thong, et autres
Publié: (2026) -
Rethinking Deep Alignment Through The Lens Of Incomplete Learning
par: Bach, Thong, et autres
Publié: (2025) -
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
par: Bach, Thong, et autres
Publié: (2025) -
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
par: Li, Yuxi, et autres
Publié: (2024) -
The Implicit Bias of Logit Regularization
par: Beck, Alon, et autres
Publié: (2026)