SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Hongbo, AprilPyone, MaungMaung, Echizen, Isao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Stability Analysis of ChatGPT-based Sentiment Analysis in AI Quality Assurance
by: Ouyang, Tinghui, et al.
Published: (2024)
by: Ouyang, Tinghui, et al.
Published: (2024)
Fine-Tuning Text-To-Image Diffusion Models for Class-Wise Spurious Feature Generation
by: MaungMaung, AprilPyone, et al.
Published: (2024)
by: MaungMaung, AprilPyone, et al.
Published: (2024)
EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics
by: Nguyen, Van-Loc, et al.
Published: (2026)
by: Nguyen, Van-Loc, et al.
Published: (2026)
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
by: Chengyu, Jia, et al.
Published: (2026)
by: Chengyu, Jia, et al.
Published: (2026)
Mitigating Backdoor Attacks using Activation-Guided Model Editing
by: Hsieh, Felix, et al.
Published: (2024)
by: Hsieh, Felix, et al.
Published: (2024)
Cross-Attention Watermarking of Large Language Models
by: Baldassini, Folco Bertini, et al.
Published: (2024)
by: Baldassini, Folco Bertini, et al.
Published: (2024)
Zero-Shot Warning Generation for Misinformative Multimodal Content
by: Delvecchio, Giovanni Pio, et al.
Published: (2025)
by: Delvecchio, Giovanni Pio, et al.
Published: (2025)
LLMD: A Large Language Model for Interpreting Longitudinal Medical Records
by: Porter, Robert, et al.
Published: (2024)
by: Porter, Robert, et al.
Published: (2024)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
by: Tian, Yuanhe, et al.
Published: (2025)
by: Tian, Yuanhe, et al.
Published: (2025)
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
by: Zhang, Kaituo, et al.
Published: (2026)
by: Zhang, Kaituo, et al.
Published: (2026)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
by: Shalabi, Fatma, et al.
Published: (2024)
by: Shalabi, Fatma, et al.
Published: (2024)
Image-Text Out-Of-Context Detection Using Synthetic Multimodal Misinformation
by: Shalabi, Fatma, et al.
Published: (2024)
by: Shalabi, Fatma, et al.
Published: (2024)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
by: Wang, Yian, et al.
Published: (2026)
by: Wang, Yian, et al.
Published: (2026)
Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?
by: Lin, Fei, et al.
Published: (2025)
by: Lin, Fei, et al.
Published: (2025)
Enhancing Robustness of LLM-Synthetic Text Detectors for Academic Writing: A Comprehensive Analysis
by: Dou, Zhicheng, et al.
Published: (2024)
by: Dou, Zhicheng, et al.
Published: (2024)
On the Role of Artificial Intelligence in Human-Machine Symbiosis
by: Chang, Ching-Chun, et al.
Published: (2026)
by: Chang, Ching-Chun, et al.
Published: (2026)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
by: Kazemi, Hamid, et al.
Published: (2026)
by: Kazemi, Hamid, et al.
Published: (2026)
DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion
by: Li, Yu, et al.
Published: (2024)
by: Li, Yu, et al.
Published: (2024)
SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
by: Torres-Fonseca, Josue, et al.
Published: (2026)
by: Torres-Fonseca, Josue, et al.
Published: (2026)
Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
by: Sun, Xin, et al.
Published: (2026)
by: Sun, Xin, et al.
Published: (2026)
Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models
by: Zhang, Han, et al.
Published: (2026)
by: Zhang, Han, et al.
Published: (2026)
On Adversarial Robustness and Out-of-Distribution Robustness of Large Language Models
by: Yang, April, et al.
Published: (2024)
by: Yang, April, et al.
Published: (2024)
Enhancing Safety of Large Language Models via Embedding Space Separation
by: Zhao, Xu, et al.
Published: (2026)
by: Zhao, Xu, et al.
Published: (2026)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
by: Hu, He, et al.
Published: (2025)
by: Hu, He, et al.
Published: (2025)
MLLM-CL: Continual Learning for Multimodal Large Language Models
by: Zhao, Hongbo, et al.
Published: (2025)
by: Zhao, Hongbo, et al.
Published: (2025)
Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships
by: Waseda, Futa, et al.
Published: (2024)
by: Waseda, Futa, et al.
Published: (2024)
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
by: Guo, Yuchen, et al.
Published: (2025)
by: Guo, Yuchen, et al.
Published: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
by: Lu, Yida, et al.
Published: (2025)
by: Lu, Yida, et al.
Published: (2025)
Unveiling Factual Recall Behaviors of Large Language Models through Knowledge Neurons
by: Wang, Yifei, et al.
Published: (2024)
by: Wang, Yifei, et al.
Published: (2024)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
by: Liu, Zheyuan, et al.
Published: (2026)
by: Liu, Zheyuan, et al.
Published: (2026)
Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models
by: Tuan, Yi-Lin, et al.
Published: (2024)
by: Tuan, Yi-Lin, et al.
Published: (2024)
Parameter-Efficient Detoxification with Contrastive Decoding
by: Niu, Tong, et al.
Published: (2024)
by: Niu, Tong, et al.
Published: (2024)
Multilingual and Explainable Text Detoxification with Parallel Corpora
by: Dementieva, Daryna, et al.
Published: (2024)
by: Dementieva, Daryna, et al.
Published: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
by: Wang, Wenxuan, et al.
Published: (2023)
by: Wang, Wenxuan, et al.
Published: (2023)
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
by: Ding, Yizhuo, et al.
Published: (2025)
by: Ding, Yizhuo, et al.
Published: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
by: Zhao, Yinzhi, et al.
Published: (2026)
by: Zhao, Yinzhi, et al.
Published: (2026)
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
by: Dementieva, Daryna, et al.
Published: (2024)
by: Dementieva, Daryna, et al.
Published: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
by: Wang, Yixu, et al.
Published: (2026)
by: Wang, Yixu, et al.
Published: (2026)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
by: Gu, Tianle, et al.
Published: (2024)
by: Gu, Tianle, et al.
Published: (2024)
Similar Items
-
Stability Analysis of ChatGPT-based Sentiment Analysis in AI Quality Assurance
by: Ouyang, Tinghui, et al.
Published: (2024) -
Fine-Tuning Text-To-Image Diffusion Models for Class-Wise Spurious Feature Generation
by: MaungMaung, AprilPyone, et al.
Published: (2024) -
EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics
by: Nguyen, Van-Loc, et al.
Published: (2026) -
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
by: Chengyu, Jia, et al.
Published: (2026) -
Mitigating Backdoor Attacks using Activation-Guided Model Editing
by: Hsieh, Felix, et al.
Published: (2024)