SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zeng, Xinyi, Yang, Xue, Zhang, Jingyuan, Yan, Huanqian, Chen, Xiang, Wei, Kaiwen, Kang, Hankun, Tian, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
by: Zeng, Xiyu, et al.
Published: (2025)
by: Zeng, Xiyu, et al.
Published: (2025)
SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs
by: Ghosh, Shaona, et al.
Published: (2025)
by: Ghosh, Shaona, et al.
Published: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models
by: He, Shaokai, et al.
Published: (2026)
by: He, Shaokai, et al.
Published: (2026)
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
by: Kang, Hankun, et al.
Published: (2026)
by: Kang, Hankun, et al.
Published: (2026)
Boosting Jailbreak Transferability for Large Language Models
by: Liu, Hanqing, et al.
Published: (2024)
by: Liu, Hanqing, et al.
Published: (2024)
Automating Steering for Safe Multimodal Large Language Models
by: Wu, Lyucheng, et al.
Published: (2025)
by: Wu, Lyucheng, et al.
Published: (2025)
DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models
by: Zheng, Lifan, et al.
Published: (2026)
by: Zheng, Lifan, et al.
Published: (2026)
Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level
by: Zeng, Xinyi, et al.
Published: (2024)
by: Zeng, Xinyi, et al.
Published: (2024)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
by: Zhang, Yu, et al.
Published: (2025)
by: Zhang, Yu, et al.
Published: (2025)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
by: Yang, Jingyuan, et al.
Published: (2025)
by: Yang, Jingyuan, et al.
Published: (2025)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
by: Lu, Liming, et al.
Published: (2025)
by: Lu, Liming, et al.
Published: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
by: Shang, Yuying, et al.
Published: (2024)
by: Shang, Yuying, et al.
Published: (2024)
Speculative Decoding Reimagined for Multimodal Large Language Models
by: Lin, Luxi, et al.
Published: (2025)
by: Lin, Luxi, et al.
Published: (2025)
Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction
by: Wang, Shuoxin, et al.
Published: (2026)
by: Wang, Shuoxin, et al.
Published: (2026)
Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
by: Chen, Wei, et al.
Published: (2025)
by: Chen, Wei, et al.
Published: (2025)
Chain-of-Specificity: An Iteratively Refining Method for Eliciting Knowledge from Large Language Models
by: Wei, Kaiwen, et al.
Published: (2024)
by: Wei, Kaiwen, et al.
Published: (2024)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
by: Xue, Kaiwen, et al.
Published: (2026)
by: Xue, Kaiwen, et al.
Published: (2026)
Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors
by: Wang, Weixuan, et al.
Published: (2024)
by: Wang, Weixuan, et al.
Published: (2024)
Mechanistic Indicators of Steering Effectiveness in Large Language Models
by: Jafari, Mehdi, et al.
Published: (2026)
by: Jafari, Mehdi, et al.
Published: (2026)
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
by: Zhang, Biao, et al.
Published: (2025)
by: Zhang, Biao, et al.
Published: (2025)
Evaluating the Generation Capabilities of Large Chinese Language Models
by: Zeng, Hui, et al.
Published: (2023)
by: Zeng, Hui, et al.
Published: (2023)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
by: Cheng, Zifeng, et al.
Published: (2025)
by: Cheng, Zifeng, et al.
Published: (2025)
Decoding the Mechanisms of Pigment Reduction and Skin Rejuvenation Induced by Picosecond Laser: Insights From a Porcine Model
by: Hao Wang, et al.
Published: (2025)
by: Hao Wang, et al.
Published: (2025)
MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering
by: Ding, Chenlu, et al.
Published: (2025)
by: Ding, Chenlu, et al.
Published: (2025)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
by: Lin, Weilin, et al.
Published: (2025)
by: Lin, Weilin, et al.
Published: (2025)
On Speculative Decoding for Multimodal Large Language Models
by: Gagrani, Mukul, et al.
Published: (2024)
by: Gagrani, Mukul, et al.
Published: (2024)
OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models
by: Yan, Yuping, et al.
Published: (2025)
by: Yan, Yuping, et al.
Published: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
by: Wu, Sihao, et al.
Published: (2025)
by: Wu, Sihao, et al.
Published: (2025)
Semantic Alignment for Multimodal Large Language Models
by: Wu, Tao, et al.
Published: (2024)
by: Wu, Tao, et al.
Published: (2024)
Brain-to-Text Decoding with Context-Aware Neural Representations and Large Language Models
by: Li, Jingyuan, et al.
Published: (2024)
by: Li, Jingyuan, et al.
Published: (2024)
Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding
by: Yu, Runpeng, et al.
Published: (2025)
by: Yu, Runpeng, et al.
Published: (2025)
Decomposing and Steering Functional Metacognition in Large Language Models
by: Li, Yanshi, et al.
Published: (2026)
by: Li, Yanshi, et al.
Published: (2026)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
by: Chen, Beitao, et al.
Published: (2025)
by: Chen, Beitao, et al.
Published: (2025)
A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models
by: Fang, Tianmeng, et al.
Published: (2026)
by: Fang, Tianmeng, et al.
Published: (2026)
SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning
by: Chen, Junkai, et al.
Published: (2025)
by: Chen, Junkai, et al.
Published: (2025)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
by: Wang, Yixu, et al.
Published: (2025)
by: Wang, Yixu, et al.
Published: (2025)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
by: Deng, Huilin, et al.
Published: (2024)
by: Deng, Huilin, et al.
Published: (2024)
Similar Items
-
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
by: Zeng, Xiyu, et al.
Published: (2025) -
SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs
by: Ghosh, Shaona, et al.
Published: (2025) -
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
by: Li, Hao, et al.
Published: (2026) -
DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models
by: He, Shaokai, et al.
Published: (2026) -
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
by: Kang, Hankun, et al.
Published: (2026)