SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Zhaoxin, Liang, Jiaming, Zhu, Fengbin, Zhao, Weixiang, Fang, Junfeng, Ji, Jiayi, Wang, Handing, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Controllable Value Alignment in Large Language Models through Neuron-Level Editing
von: Yang, Yonghui, et al.
Veröffentlicht: (2026)
von: Yang, Yonghui, et al.
Veröffentlicht: (2026)
Multilingual Safety Alignment Via Sparse Weight Editing
von: Liang, Jiaming, et al.
Veröffentlicht: (2026)
von: Liang, Jiaming, et al.
Veröffentlicht: (2026)
Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
von: Zhang, Xianhui, et al.
Veröffentlicht: (2026)
von: Zhang, Xianhui, et al.
Veröffentlicht: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
Neuron-Level Sequential Editing for Large Language Models
von: Jiang, Houcheng, et al.
Veröffentlicht: (2024)
von: Jiang, Houcheng, et al.
Veröffentlicht: (2024)
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
von: Shi, Enyi, et al.
Veröffentlicht: (2026)
von: Shi, Enyi, et al.
Veröffentlicht: (2026)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
von: Zhao, Weixiang, et al.
Veröffentlicht: (2024)
von: Zhao, Weixiang, et al.
Veröffentlicht: (2024)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
von: Li, Moxin, et al.
Veröffentlicht: (2024)
von: Li, Moxin, et al.
Veröffentlicht: (2024)
DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation
von: Tan, Binhong, et al.
Veröffentlicht: (2026)
von: Tan, Binhong, et al.
Veröffentlicht: (2026)
Large Language Models Empowered Personalized Web Agents
von: Cai, Hongru, et al.
Veröffentlicht: (2024)
von: Cai, Hongru, et al.
Veröffentlicht: (2024)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
von: Wang, Lin, et al.
Veröffentlicht: (2026)
von: Wang, Lin, et al.
Veröffentlicht: (2026)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
von: Yi, Xin, et al.
Veröffentlicht: (2024)
von: Yi, Xin, et al.
Veröffentlicht: (2024)
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
von: Cui, Chenhang, et al.
Veröffentlicht: (2026)
von: Cui, Chenhang, et al.
Veröffentlicht: (2026)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
von: Li, Shaotian, et al.
Veröffentlicht: (2026)
von: Li, Shaotian, et al.
Veröffentlicht: (2026)
Training-Free Multimodal Large Language Model Orchestration
von: Xie, Tianyu, et al.
Veröffentlicht: (2025)
von: Xie, Tianyu, et al.
Veröffentlicht: (2025)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
von: Sheng, Leheng, et al.
Veröffentlicht: (2025)
von: Sheng, Leheng, et al.
Veröffentlicht: (2025)
IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation
von: Lin, Zijie, et al.
Veröffentlicht: (2025)
von: Lin, Zijie, et al.
Veröffentlicht: (2025)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
von: Wang, Hongbo, et al.
Veröffentlicht: (2025)
von: Wang, Hongbo, et al.
Veröffentlicht: (2025)
Towards Temporal-Aware Multi-Modal Retrieval Augmented Generation in Finance
von: Zhu, Fengbin, et al.
Veröffentlicht: (2025)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2025)
Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models
von: Wang, Zhaoxin, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoxin, et al.
Veröffentlicht: (2025)
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
von: Kazemi, Hamid, et al.
Veröffentlicht: (2026)
von: Kazemi, Hamid, et al.
Veröffentlicht: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
von: Zhu, Fengbin, et al.
Veröffentlicht: (2026)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2026)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
von: Liu, Jiangtao, et al.
Veröffentlicht: (2025)
von: Liu, Jiangtao, et al.
Veröffentlicht: (2025)
On Reasoning Strength Planning in Large Reasoning Models
von: Sheng, Leheng, et al.
Veröffentlicht: (2025)
von: Sheng, Leheng, et al.
Veröffentlicht: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
von: Fang, Xiang, et al.
Veröffentlicht: (2026)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
von: Zhao, Weixiang, et al.
Veröffentlicht: (2025)
von: Zhao, Weixiang, et al.
Veröffentlicht: (2025)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
von: Cui, Chenhang, et al.
Veröffentlicht: (2024)
von: Cui, Chenhang, et al.
Veröffentlicht: (2024)
Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector
von: Huang, Youcheng, et al.
Veröffentlicht: (2024)
von: Huang, Youcheng, et al.
Veröffentlicht: (2024)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
von: Wang, Yihui, et al.
Veröffentlicht: (2026)
von: Wang, Yihui, et al.
Veröffentlicht: (2026)
Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text Documents via Semantic-Oriented Hierarchical Graphs
von: Zhu, Fengbin, et al.
Veröffentlicht: (2023)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2023)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
Heterogeneous User Modeling for LLM-based Recommendation
von: Bao, Honghui, et al.
Veröffentlicht: (2025)
von: Bao, Honghui, et al.
Veröffentlicht: (2025)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
von: Shi, Chuancheng, et al.
Veröffentlicht: (2026)
von: Shi, Chuancheng, et al.
Veröffentlicht: (2026)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
von: Pan, Birong, et al.
Veröffentlicht: (2025)
von: Pan, Birong, et al.
Veröffentlicht: (2025)
Let's Focus on Neuron: Neuron-Level Supervised Fine-tuning for Large Language Model
von: Xu, Haoyun, et al.
Veröffentlicht: (2024)
von: Xu, Haoyun, et al.
Veröffentlicht: (2024)
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons Alignment
von: Huang, Chongxuan, et al.
Veröffentlicht: (2025)
von: Huang, Chongxuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Controllable Value Alignment in Large Language Models through Neuron-Level Editing
von: Yang, Yonghui, et al.
Veröffentlicht: (2026) -
Multilingual Safety Alignment Via Sparse Weight Editing
von: Liang, Jiaming, et al.
Veröffentlicht: (2026) -
Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
von: Zhang, Xianhui, et al.
Veröffentlicht: (2026) -
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
von: Fang, Junfeng, et al.
Veröffentlicht: (2025) -
Neuron-Level Sequential Editing for Large Language Models
von: Jiang, Houcheng, et al.
Veröffentlicht: (2024)