RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Jiacheng, Wang, Yuhui, Jiang, Tanqiu, Wang, Ting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GraphRAG under Fire
di: Liang, Jiacheng, et al.
Pubblicazione: (2025)
di: Liang, Jiacheng, et al.
Pubblicazione: (2025)
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
di: Liang, Jiacheng, et al.
Pubblicazione: (2025)
di: Liang, Jiacheng, et al.
Pubblicazione: (2025)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Self-Destructive Language Model
di: Wang, Yuhui, et al.
Pubblicazione: (2025)
di: Wang, Yuhui, et al.
Pubblicazione: (2025)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
di: Zhang, Yi, et al.
Pubblicazione: (2025)
di: Zhang, Yi, et al.
Pubblicazione: (2025)
Your Agent Can Defend Itself against Backdoor Attacks
di: Changjiang, Li, et al.
Pubblicazione: (2025)
di: Changjiang, Li, et al.
Pubblicazione: (2025)
PM-MOE: Mixture of Experts on Private Model Parameters for Personalized Federated Learning
di: Feng, Yu, et al.
Pubblicazione: (2025)
di: Feng, Yu, et al.
Pubblicazione: (2025)
MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification
di: Jiang, Weisen, et al.
Pubblicazione: (2026)
di: Jiang, Weisen, et al.
Pubblicazione: (2026)
Lifelong Safety Alignment for Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Routing-Aware Explanations for Mixture of Experts Graph Models in Malware Detection
di: Shokouhinejad, Hossein, et al.
Pubblicazione: (2026)
di: Shokouhinejad, Hossein, et al.
Pubblicazione: (2026)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Mixture of Robust Experts (MoRE):A Robust Denoising Method towards multiple perturbations
di: Cheng, Hao, et al.
Pubblicazione: (2021)
di: Cheng, Hao, et al.
Pubblicazione: (2021)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
di: Liu, Guozhi, et al.
Pubblicazione: (2025)
di: Liu, Guozhi, et al.
Pubblicazione: (2025)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
di: Cornacchia, Giandomenico, et al.
Pubblicazione: (2024)
di: Cornacchia, Giandomenico, et al.
Pubblicazione: (2024)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
di: Zaree, Pedram, et al.
Pubblicazione: (2025)
di: Zaree, Pedram, et al.
Pubblicazione: (2025)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
Investigating the Impact of Quantization on Adversarial Robustness
di: Li, Qun, et al.
Pubblicazione: (2024)
di: Li, Qun, et al.
Pubblicazione: (2024)
Stealing User Prompts from Mixture of Experts
di: Yona, Itay, et al.
Pubblicazione: (2024)
di: Yona, Itay, et al.
Pubblicazione: (2024)
SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification
di: Lai, Zhenglin, et al.
Pubblicazione: (2025)
di: Lai, Zhenglin, et al.
Pubblicazione: (2025)
BadMoE: Backdooring Mixture-of-Experts LLMs via Optimizing Routing Triggers and Infecting Dormant Experts
di: Wang, Qingyue, et al.
Pubblicazione: (2025)
di: Wang, Qingyue, et al.
Pubblicazione: (2025)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
di: Li, Jianwei, et al.
Pubblicazione: (2025)
di: Li, Jianwei, et al.
Pubblicazione: (2025)
Improved Algorithms for Differentially Private Language Model Alignment
di: Chen, Keyu, et al.
Pubblicazione: (2025)
di: Chen, Keyu, et al.
Pubblicazione: (2025)
Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
di: Yuan, Leitao, et al.
Pubblicazione: (2026)
di: Yuan, Leitao, et al.
Pubblicazione: (2026)
Understanding the Effects of Safety Unalignment on Large Language Models
di: Halloran, John T.
Pubblicazione: (2026)
di: Halloran, John T.
Pubblicazione: (2026)
History-Aware and Dynamic Client Contribution in Federated Learning
di: Ghosh, Bishwamittra, et al.
Pubblicazione: (2024)
di: Ghosh, Bishwamittra, et al.
Pubblicazione: (2024)
Research on Dynamic Data Flow Anomaly Detection based on Machine Learning
di: Wang, Liyang, et al.
Pubblicazione: (2024)
di: Wang, Liyang, et al.
Pubblicazione: (2024)
Differentially Private Preference Data Synthesis for Large Language Model Alignment
di: Gao, Fengyu, et al.
Pubblicazione: (2026)
di: Gao, Fengyu, et al.
Pubblicazione: (2026)
RAPID: Retrieval Augmented Training of Differentially Private Diffusion Models
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
Hijack Vertical Federated Learning Models As One Party
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
Structure-Aware Distributed Backdoor Attacks in Federated Learning
di: Jian, Wang, et al.
Pubblicazione: (2026)
di: Jian, Wang, et al.
Pubblicazione: (2026)
Mind the Gap: Mixtures of Gaussians in Approximate Differential Privacy
di: Liu, Huikang, et al.
Pubblicazione: (2026)
di: Liu, Huikang, et al.
Pubblicazione: (2026)
When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models
di: Wu, Jinman, et al.
Pubblicazione: (2026)
di: Wu, Jinman, et al.
Pubblicazione: (2026)
UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
di: Sun, Yuhao, et al.
Pubblicazione: (2025)
di: Sun, Yuhao, et al.
Pubblicazione: (2025)
MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security Exploits
di: Radosevich, Brandon, et al.
Pubblicazione: (2025)
di: Radosevich, Brandon, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GraphRAG under Fire
di: Liang, Jiacheng, et al.
Pubblicazione: (2025) -
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
di: Liang, Jiacheng, et al.
Pubblicazione: (2025) -
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026) -
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
di: Wang, Yuhui, et al.
Pubblicazione: (2026) -
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)