Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xianhui, Xie, Chengyu, Zhu, Linxia, Yang, Yonghui, Zhao, Weixiang, Cheng, Zifeng, Wang, Cong, Shen, Fei, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
par: Shi, Enyi, et autres
Publié: (2026)
par: Shi, Enyi, et autres
Publié: (2026)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
par: Wang, Zhaoxin, et autres
Publié: (2026)
par: Wang, Zhaoxin, et autres
Publié: (2026)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
par: Shi, Chuancheng, et autres
Publié: (2026)
par: Shi, Chuancheng, et autres
Publié: (2026)
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
par: Cui, Chenhang, et autres
Publié: (2026)
par: Cui, Chenhang, et autres
Publié: (2026)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
par: Wang, Lin, et autres
Publié: (2026)
par: Wang, Lin, et autres
Publié: (2026)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
par: Zhao, Weixiang, et autres
Publié: (2024)
par: Zhao, Weixiang, et autres
Publié: (2024)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
par: Shi, Enyi, et autres
Publié: (2026)
par: Shi, Enyi, et autres
Publié: (2026)
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
par: Fang, Junfeng, et autres
Publié: (2025)
par: Fang, Junfeng, et autres
Publié: (2025)
Towards Goal-oriented Intelligent Tutoring Systems in Online Education
par: Deng, Yang, et autres
Publié: (2023)
par: Deng, Yang, et autres
Publié: (2023)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities
par: Dou, Jingtong, et autres
Publié: (2026)
par: Dou, Jingtong, et autres
Publié: (2026)
Controllable Value Alignment in Large Language Models through Neuron-Level Editing
par: Yang, Yonghui, et autres
Publié: (2026)
par: Yang, Yonghui, et autres
Publié: (2026)
Universal Scene Graph Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer
par: Bansal, Lavish, et autres
Publié: (2025)
par: Bansal, Lavish, et autres
Publié: (2025)
CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer
par: Zhao, Yue, et autres
Publié: (2026)
par: Zhao, Yue, et autres
Publié: (2026)
Cross-Lingual Generalization and Compression: From Language-Specific to Shared Neurons
par: Riemenschneider, Frederick, et autres
Publié: (2025)
par: Riemenschneider, Frederick, et autres
Publié: (2025)
Language-specific Neurons Do Not Facilitate Cross-Lingual Transfer
par: Mondal, Soumen Kumar, et autres
Publié: (2025)
par: Mondal, Soumen Kumar, et autres
Publié: (2025)
Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text Documents via Semantic-Oriented Hierarchical Graphs
par: Zhu, Fengbin, et autres
Publié: (2023)
par: Zhu, Fengbin, et autres
Publié: (2023)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
par: Li, Shaotian, et autres
Publié: (2026)
par: Li, Shaotian, et autres
Publié: (2026)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
par: Yang, Yonghui, et autres
Publié: (2026)
par: Yang, Yonghui, et autres
Publié: (2026)
On Reasoning Strength Planning in Large Reasoning Models
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
par: Wang, Yihui, et autres
Publié: (2026)
par: Wang, Yihui, et autres
Publié: (2026)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
par: Chen, Yuxin, et autres
Publié: (2026)
par: Chen, Yuxin, et autres
Publié: (2026)
Ask-before-Plan: Proactive Language Agents for Real-World Planning
par: Zhang, Xuan, et autres
Publié: (2024)
par: Zhang, Xuan, et autres
Publié: (2024)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
par: Fang, Junfeng, et autres
Publié: (2025)
par: Fang, Junfeng, et autres
Publié: (2025)
Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
par: Shi, Chuancheng, et autres
Publié: (2025)
par: Shi, Chuancheng, et autres
Publié: (2025)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
par: Shen, Fei, et autres
Publié: (2025)
par: Shen, Fei, et autres
Publié: (2025)
XNLP: An Interactive Demonstration System for Universal Structured NLP
par: Fei, Hao, et autres
Publié: (2023)
par: Fei, Hao, et autres
Publié: (2023)
Transport and Merge: Cross-Architecture Merging for Large Language Models
par: Cui, Chenhang, et autres
Publié: (2026)
par: Cui, Chenhang, et autres
Publié: (2026)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
par: Xu, Shicheng, et autres
Publié: (2023)
par: Xu, Shicheng, et autres
Publié: (2023)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
par: Chu, Meng, et autres
Publié: (2025)
par: Chu, Meng, et autres
Publié: (2025)
Learning to Ask Critical Questions for Assisting Product Search
par: Li, Zixuan, et autres
Publié: (2024)
par: Li, Zixuan, et autres
Publié: (2024)
Uplift Modeling for Target User Attacks on Recommender Systems
par: Wang, Wenjie, et autres
Publié: (2024)
par: Wang, Wenjie, et autres
Publié: (2024)
CARL: Criticality-Aware Agentic Reinforcement Learning
par: Shen, Leyang, et autres
Publié: (2025)
par: Shen, Leyang, et autres
Publié: (2025)
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
par: Zheng, Jingnan, et autres
Publié: (2026)
par: Zheng, Jingnan, et autres
Publié: (2026)
NExT-GPT: Any-to-Any Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2023)
par: Wu, Shengqiong, et autres
Publié: (2023)
Documents similaires
-
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
par: Shi, Enyi, et autres
Publié: (2026) -
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
par: Wang, Zhaoxin, et autres
Publié: (2026) -
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
par: Shi, Chuancheng, et autres
Publié: (2026) -
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
par: Cui, Chenhang, et autres
Publié: (2026) -
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
par: Wang, Lin, et autres
Publié: (2026)