MESA: Improving MoE Safety Alignment via Decentralized Expertise
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yitong, Huang, Yao, Li, Teng, Duan, Ranjie, Zhang, Yichi, Ma, Xingjun, Xue, Hui, Wei, Xingxing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STAIR: Improving Safety Alignment with Introspective Reasoning
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
di: Duan, Ranjie, et al.
Pubblicazione: (2025)
di: Duan, Ranjie, et al.
Pubblicazione: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2026)
di: Wang, Yixu, et al.
Pubblicazione: (2026)
MH-MoE: Multi-Head Mixture-of-Experts
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
Training Report of TeleChat3-MoE
di: Liu, Xinzhang, et al.
Pubblicazione: (2025)
di: Liu, Xinzhang, et al.
Pubblicazione: (2025)
Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
Improving Adversarial Robust Fairness via Anti-Bias Soft Label Distillation
di: Zhao, Shiji, et al.
Pubblicazione: (2023)
di: Zhao, Shiji, et al.
Pubblicazione: (2023)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
di: Sun, Yitong, et al.
Pubblicazione: (2025)
di: Sun, Yitong, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
PMoL: Parameter Efficient MoE for Preference Mixing of LLM Alignment
di: Liu, Dongxu, et al.
Pubblicazione: (2024)
di: Liu, Dongxu, et al.
Pubblicazione: (2024)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
MoE-Sieve: Routing-Guided LoRA for Efficient MoE Fine-Tuning
di: Manzoni, Andrea
Pubblicazione: (2026)
di: Manzoni, Andrea
Pubblicazione: (2026)
GRIN: GRadient-INformed MoE
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
di: Liu, Zhenyu, et al.
Pubblicazione: (2025)
di: Liu, Zhenyu, et al.
Pubblicazione: (2025)
Steering MoE LLMs via Expert (De)Activation
di: Fayyaz, Mohsen, et al.
Pubblicazione: (2025)
di: Fayyaz, Mohsen, et al.
Pubblicazione: (2025)
STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning
di: Lee, Jaeseong, et al.
Pubblicazione: (2024)
di: Lee, Jaeseong, et al.
Pubblicazione: (2024)
Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
S2MoE: Robust Sparse Mixture of Experts via Stochastic Learning
di: Do, Giang, et al.
Pubblicazione: (2025)
di: Do, Giang, et al.
Pubblicazione: (2025)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
di: Li, Zichong, et al.
Pubblicazione: (2025)
di: Li, Zichong, et al.
Pubblicazione: (2025)
Sigma-MoE-Tiny Technical Report
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
di: Huang, Hejin, et al.
Pubblicazione: (2026)
di: Huang, Hejin, et al.
Pubblicazione: (2026)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
Leave It to the Experts: Detecting Knowledge Distillation via MoE Expert Signatures
di: Li, Pingzhi, et al.
Pubblicazione: (2025)
di: Li, Pingzhi, et al.
Pubblicazione: (2025)
Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models
di: Ding, Xuan, et al.
Pubblicazione: (2026)
di: Ding, Xuan, et al.
Pubblicazione: (2026)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
di: Dou, Shihan, et al.
Pubblicazione: (2023)
di: Dou, Shihan, et al.
Pubblicazione: (2023)
OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale
di: Shi, Jingze, et al.
Pubblicazione: (2026)
di: Shi, Jingze, et al.
Pubblicazione: (2026)
SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts
di: Muzio, Alexandre, et al.
Pubblicazione: (2024)
di: Muzio, Alexandre, et al.
Pubblicazione: (2024)
GMoE: Empowering LLMs Fine-Tuning via MoE Graph Collaboration
di: Bai, Ting, et al.
Pubblicazione: (2024)
di: Bai, Ting, et al.
Pubblicazione: (2024)
CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning
di: Tang, Jun-Tao, et al.
Pubblicazione: (2026)
di: Tang, Jun-Tao, et al.
Pubblicazione: (2026)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
STAIR: Improving Safety Alignment with Introspective Reasoning
di: Zhang, Yichi, et al.
Pubblicazione: (2025) -
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
di: Huang, Yao, et al.
Pubblicazione: (2025) -
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025) -
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
di: Duan, Ranjie, et al.
Pubblicazione: (2025) -
Towards Context-Invariant Safety Alignment for Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2026)