Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yonghui, Tao, Wenjian, Liu, Jilong, Zhu, Xingyu, Fang, Junfeng, Huang, Weibiao, Wu, Le, Hong, Richang, Chua, Tat-Sent |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Controllable Value Alignment in Large Language Models through Neuron-Level Editing
by: Yang, Yonghui, et al.
Published: (2026)
by: Yang, Yonghui, et al.
Published: (2026)
CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
by: Liu, Jilong, et al.
Published: (2026)
by: Liu, Jilong, et al.
Published: (2026)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
by: Wang, Yihui, et al.
Published: (2026)
by: Wang, Yihui, et al.
Published: (2026)
Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering
by: Liu, Jilong, et al.
Published: (2025)
by: Liu, Jilong, et al.
Published: (2025)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
by: Wang, Zhaoxin, et al.
Published: (2026)
by: Wang, Zhaoxin, et al.
Published: (2026)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
by: Zhao, Weixiang, et al.
Published: (2024)
by: Zhao, Weixiang, et al.
Published: (2024)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
by: Zhu, Xingyu, et al.
Published: (2026)
by: Zhu, Xingyu, et al.
Published: (2026)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
by: Wang, Lin, et al.
Published: (2026)
by: Wang, Lin, et al.
Published: (2026)
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
by: Fang, Junfeng, et al.
Published: (2025)
by: Fang, Junfeng, et al.
Published: (2025)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
by: Zhu, Fengbin, et al.
Published: (2026)
by: Zhu, Fengbin, et al.
Published: (2026)
Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
by: Zhang, Xianhui, et al.
Published: (2026)
by: Zhang, Xianhui, et al.
Published: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
by: Fang, Junfeng, et al.
Published: (2025)
by: Fang, Junfeng, et al.
Published: (2025)
MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization
by: Fang, Zhenying, et al.
Published: (2025)
by: Fang, Zhenying, et al.
Published: (2025)
Invariance Matters: Empowering Social Recommendation via Graph Invariant Learning
by: Yang, Yonghui, et al.
Published: (2025)
by: Yang, Yonghui, et al.
Published: (2025)
Post-hoc Provider Fairness Adaptation via Hierarchical Exposure Alignment
by: Li, Jingzhi, et al.
Published: (2026)
by: Li, Jingzhi, et al.
Published: (2026)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
by: Zhu, Xingyu, et al.
Published: (2026)
by: Zhu, Xingyu, et al.
Published: (2026)
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
Graph Bottlenecked Social Recommendation
by: Yang, Yonghui, et al.
Published: (2024)
by: Yang, Yonghui, et al.
Published: (2024)
Less is More: Information Bottleneck Denoised Multimedia Recommendation
by: Yang, Yonghui, et al.
Published: (2025)
by: Yang, Yonghui, et al.
Published: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
by: Chu, Meng, et al.
Published: (2025)
by: Chu, Meng, et al.
Published: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
Hierarchical Semantic Alignment for Image Clustering
by: Zhu, Xingyu, et al.
Published: (2025)
by: Zhu, Xingyu, et al.
Published: (2025)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
by: Brito, Iago Alves, et al.
Published: (2026)
by: Brito, Iago Alves, et al.
Published: (2026)
Enhancing CLIP Robustness via Cross-Modality Alignment
by: Zhu, Xingyu, et al.
Published: (2025)
by: Zhu, Xingyu, et al.
Published: (2025)
Continual Safety Alignment via Gradient-Based Sample Selection
by: Bach, Thong, et al.
Published: (2026)
by: Bach, Thong, et al.
Published: (2026)
InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models
by: Zhou, Zhiyuan, et al.
Published: (2024)
by: Zhou, Zhiyuan, et al.
Published: (2024)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
by: Shi, Chuancheng, et al.
Published: (2026)
by: Shi, Chuancheng, et al.
Published: (2026)
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
by: Wang, Ruipeng, et al.
Published: (2026)
by: Wang, Ruipeng, et al.
Published: (2026)
Enhancing Spectral Graph Neural Networks with LLM-Predicted Homophily
by: Lu, Kangkang, et al.
Published: (2025)
by: Lu, Kangkang, et al.
Published: (2025)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
by: Zhang, Zhexin, et al.
Published: (2026)
by: Zhang, Zhexin, et al.
Published: (2026)
Dual-View Alignment Learning with Hierarchical-Prompt for Class-Imbalance Multi-Label Classification
by: Huang, Sheng, et al.
Published: (2025)
by: Huang, Sheng, et al.
Published: (2025)
Boundary Discretization and Reliable Classification Network for Temporal Action Detection
by: Fang, Zhenying, et al.
Published: (2023)
by: Fang, Zhenying, et al.
Published: (2023)
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
by: Shi, Enyi, et al.
Published: (2026)
by: Shi, Enyi, et al.
Published: (2026)
Integrate Temporal Graph Learning into LLM-based Temporal Knowledge Graph Model
by: Chang, He, et al.
Published: (2025)
by: Chang, He, et al.
Published: (2025)
Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments
by: Chen, Yuxin, et al.
Published: (2026)
by: Chen, Yuxin, et al.
Published: (2026)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
by: Zheng, Jingnan, et al.
Published: (2024)
by: Zheng, Jingnan, et al.
Published: (2024)
Geometry-driven impact of photosensor placement on S2-based XY reconstruction in a dual-phase argon TPC
by: Yin, Jilong, et al.
Published: (2026)
by: Yin, Jilong, et al.
Published: (2026)
Accelerating Sampling-Based Control via Learned Linear Koopman Dynamics
by: Hao, Wenjian, et al.
Published: (2026)
by: Hao, Wenjian, et al.
Published: (2026)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
by: Fang, Xiang, et al.
Published: (2026)
by: Fang, Xiang, et al.
Published: (2026)
Revisiting the Robust Alignment of Circuit Breakers
by: Schwinn, Leo, et al.
Published: (2024)
by: Schwinn, Leo, et al.
Published: (2024)
Similar Items
-
Controllable Value Alignment in Large Language Models through Neuron-Level Editing
by: Yang, Yonghui, et al.
Published: (2026) -
CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
by: Liu, Jilong, et al.
Published: (2026) -
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
by: Wang, Yihui, et al.
Published: (2026) -
Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering
by: Liu, Jilong, et al.
Published: (2025) -
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
by: Wang, Zhaoxin, et al.
Published: (2026)