Continual Safety Alignment via Gradient-Based Sample Selection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bach, Thong, Nguyen, Dung, Le, Thao Minh, Tran, Truyen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking Deep Alignment Through The Lens Of Incomplete Learning
par: Bach, Thong, et autres
Publié: (2025)
par: Bach, Thong, et autres
Publié: (2025)
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
par: Bach, Thong, et autres
Publié: (2025)
par: Bach, Thong, et autres
Publié: (2025)
Guardrails in Logit Space: Safety Token Regularization for LLM Alignment
par: Bach, Thong, et autres
Publié: (2026)
par: Bach, Thong, et autres
Publié: (2026)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
Revisiting the Dataset Bias Problem from a Statistical Perspective
par: Do, Kien, et autres
Publié: (2024)
par: Do, Kien, et autres
Publié: (2024)
MP-PINN: A Multi-Phase Physics-Informed Neural Network for Epidemic Forecasting
par: Nguyen, Thang, et autres
Publié: (2024)
par: Nguyen, Thang, et autres
Publié: (2024)
Enhancing Length Extrapolation in Sequential Models with Pointer-Augmented Neural Memory
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
Learning Structural Causal Models from Ordering: Identifiable Flow Models
par: Le, Minh Khoa, et autres
Publié: (2024)
par: Le, Minh Khoa, et autres
Publié: (2024)
Finding the Trigger: Causal Abductive Reasoning on Video Events
par: Le, Thao Minh, et autres
Publié: (2025)
par: Le, Thao Minh, et autres
Publié: (2025)
Score-based Integrated Gradient for Root Cause Explanations of Outliers
par: Nguyen, Phuoc, et autres
Publié: (2026)
par: Nguyen, Phuoc, et autres
Publié: (2026)
Eigenvectors of Experts are Training-free Non-collapsing Routers
par: Do, Giang, et autres
Publié: (2026)
par: Do, Giang, et autres
Publié: (2026)
Robust SDE Parameter Estimation Under Missing Time Information Setting
par: Van Tran, Long, et autres
Publié: (2026)
par: Van Tran, Long, et autres
Publié: (2026)
ChargeFlow: Flow-Matching Refinement of Charge-Conditioned Electron Densities
par: Nguyen, Tri Minh, et autres
Publié: (2026)
par: Nguyen, Tri Minh, et autres
Publié: (2026)
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
par: Tran, Tuyen, et autres
Publié: (2025)
par: Tran, Tuyen, et autres
Publié: (2025)
Optimizing Electric Vehicle Charging Station Placement Using Reinforcement Learning and Agent-Based Simulations
par: Nguyen, Minh-Duc, et autres
Publié: (2025)
par: Nguyen, Minh-Duc, et autres
Publié: (2025)
A Framework for Controllable Multi-objective Learning with Annealed Stein Variational Hypernetworks
par: Nguyen, Minh-Duc, et autres
Publié: (2025)
par: Nguyen, Minh-Duc, et autres
Publié: (2025)
Adaptive multi-gradient methods for quasiconvex vector optimization and applications to multi-task learning
par: Minh, Nguyen Anh, et autres
Publié: (2024)
par: Minh, Nguyen Anh, et autres
Publié: (2024)
Generalized Sobolev IPM for Graph-Based Measures
par: Le, Tam, et autres
Publié: (2025)
par: Le, Tam, et autres
Publié: (2025)
Generalized Sobolev Transport for Probability Measures on a Graph
par: Le, Tam, et autres
Publié: (2024)
par: Le, Tam, et autres
Publié: (2024)
Optimal Transport for Measures with Noisy Tree Metric
par: Le, Tam, et autres
Publié: (2023)
par: Le, Tam, et autres
Publié: (2023)
Computation and Communication Efficient Federated Unlearning via On-server Gradient Conflict Mitigation and Expression
par: Nguyen, Minh-Duong, et autres
Publié: (2026)
par: Nguyen, Minh-Duong, et autres
Publié: (2026)
Towards Agentic AI for Multimodal-Guided Video Object Segmentation
par: Tran, Tuyen, et autres
Publié: (2025)
par: Tran, Tuyen, et autres
Publié: (2025)
BSO: Safety Alignment Is Density Ratio Matching
par: Nguyen, Tien-Phat, et autres
Publié: (2026)
par: Nguyen, Tien-Phat, et autres
Publié: (2026)
Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Efficient Symmetry-Aware Materials Generation via Hierarchical Generative Flow Networks
par: Nguyen, Tri Minh, et autres
Publié: (2024)
par: Nguyen, Tri Minh, et autres
Publié: (2024)
On the Role of Discrete Representation in Sparse Mixture of Experts
par: Do, Giang, et autres
Publié: (2024)
par: Do, Giang, et autres
Publié: (2024)
BRIDGE: Budget-aware Reasoning via Intermediate Distillation with Guided Examples
par: Le, Xuan-An, et autres
Publié: (2025)
par: Le, Xuan-An, et autres
Publié: (2025)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
par: Sun, Guanglong, et autres
Publié: (2026)
par: Sun, Guanglong, et autres
Publié: (2026)
Class-Prototype Conditional Diffusion Model with Gradient Projection for Continual Learning
par: Doan, Khanh, et autres
Publié: (2023)
par: Doan, Khanh, et autres
Publié: (2023)
Sparse Partial Optimal Transport via Quadratic Regularization
par: Tran, Khang, et autres
Publié: (2025)
par: Tran, Khang, et autres
Publié: (2025)
Improving Generalization in Heterogeneous Federated Continual Learning via Spatio-Temporal Gradient Matching with Prototypical Coreset
par: Nguyen, Minh-Duong, et autres
Publié: (2025)
par: Nguyen, Minh-Duong, et autres
Publié: (2025)
Towards Layer-Wise Personalized Federated Learning: Adaptive Layer Disentanglement via Conflicting Gradients
par: Nguyen, Minh Duong, et autres
Publié: (2024)
par: Nguyen, Minh Duong, et autres
Publié: (2024)
Scalable Sobolev IPM for Probability Measures on a Graph
par: Le, Tam, et autres
Publié: (2025)
par: Le, Tam, et autres
Publié: (2025)
An Efficient Orlicz-Sobolev Approach for Transporting Unbalanced Measures on a Graph
par: Le, Tam, et autres
Publié: (2025)
par: Le, Tam, et autres
Publié: (2025)
Incorporating Surrogate Gradient Norm to Improve Offline Optimization Techniques
par: Dao, Manh Cuong, et autres
Publié: (2025)
par: Dao, Manh Cuong, et autres
Publié: (2025)
Rethinking Cross-Modal Fine-Tuning: Optimizing the Interaction Between Feature Alignment and Target Fitting
par: Tran, Trong Khiem, et autres
Publié: (2026)
par: Tran, Trong Khiem, et autres
Publié: (2026)
Spectral Text Fusion: A Frequency-Aware Approach to Multimodal Time-Series Forecasting
par: Nguyen, Huu Hiep, et autres
Publié: (2026)
par: Nguyen, Huu Hiep, et autres
Publié: (2026)
Unified Framework with Consistency across Modalities for Human Activity Recognition
par: Tran, Tuyen, et autres
Publié: (2024)
par: Tran, Tuyen, et autres
Publié: (2024)
ROOT: Rethinking Offline Optimization as Distributional Translation via Probabilistic Bridge
par: Dao, Manh Cuong, et autres
Publié: (2025)
par: Dao, Manh Cuong, et autres
Publié: (2025)
Enhancing Domain Adaptation through Prompt Gradient Alignment
par: Phan, Hoang, et autres
Publié: (2024)
par: Phan, Hoang, et autres
Publié: (2024)
Documents similaires
-
Rethinking Deep Alignment Through The Lens Of Incomplete Learning
par: Bach, Thong, et autres
Publié: (2025) -
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
par: Bach, Thong, et autres
Publié: (2025) -
Guardrails in Logit Space: Safety Token Regularization for LLM Alignment
par: Bach, Thong, et autres
Publié: (2026) -
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024) -
Revisiting the Dataset Bias Problem from a Statistical Perspective
par: Do, Kien, et autres
Publié: (2024)