MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Xinfeng, Liu, Jiacheng, Hou, Xiaofeng, Tang, Peng, Zhang, Mingxuan, Wang, Wenfeng, Li, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoE-SpeQ: Speculative Quantized Decoding with Proactive Expert Prefetching and Offloading for Mixture-of-Experts
di: Wang, Wenfeng, et al.
Pubblicazione: (2025)
di: Wang, Wenfeng, et al.
Pubblicazione: (2025)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference
di: Tang, Peng, et al.
Pubblicazione: (2024)
di: Tang, Peng, et al.
Pubblicazione: (2024)
OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale
di: Shi, Jingze, et al.
Pubblicazione: (2026)
di: Shi, Jingze, et al.
Pubblicazione: (2026)
Steering MoE LLMs via Expert (De)Activation
di: Fayyaz, Mohsen, et al.
Pubblicazione: (2025)
di: Fayyaz, Mohsen, et al.
Pubblicazione: (2025)
Leave It to the Experts: Detecting Knowledge Distillation via MoE Expert Signatures
di: Li, Pingzhi, et al.
Pubblicazione: (2025)
di: Li, Pingzhi, et al.
Pubblicazione: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading
di: Xu, Cheng, et al.
Pubblicazione: (2026)
di: Xu, Cheng, et al.
Pubblicazione: (2026)
Advancing Expert Specialization for Better MoE
di: Guo, Hongcan, et al.
Pubblicazione: (2025)
di: Guo, Hongcan, et al.
Pubblicazione: (2025)
MH-MoE: Multi-Head Mixture-of-Experts
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
$\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts
di: Takashiro, Shota, et al.
Pubblicazione: (2026)
di: Takashiro, Shota, et al.
Pubblicazione: (2026)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
di: Li, Zichong, et al.
Pubblicazione: (2025)
di: Li, Zichong, et al.
Pubblicazione: (2025)
Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization
di: Fu, Zhongqian, et al.
Pubblicazione: (2025)
di: Fu, Zhongqian, et al.
Pubblicazione: (2025)
MoE-Sieve: Routing-Guided LoRA for Efficient MoE Fine-Tuning
di: Manzoni, Andrea
Pubblicazione: (2026)
di: Manzoni, Andrea
Pubblicazione: (2026)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
What Gets Activated: Uncovering Domain and Driver Experts in MoE Language Models
di: Hu, Guimin, et al.
Pubblicazione: (2026)
di: Hu, Guimin, et al.
Pubblicazione: (2026)
Expert Selections In MoE Models Reveal (Almost) As Much As Text
di: Nuriyev, Amir, et al.
Pubblicazione: (2026)
di: Nuriyev, Amir, et al.
Pubblicazione: (2026)
S2MoE: Robust Sparse Mixture of Experts via Stochastic Learning
di: Do, Giang, et al.
Pubblicazione: (2025)
di: Do, Giang, et al.
Pubblicazione: (2025)
Do Domain-specific Experts exist in MoE-based LLMs?
di: Do, Giang, et al.
Pubblicazione: (2026)
di: Do, Giang, et al.
Pubblicazione: (2026)
SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts
di: Muzio, Alexandre, et al.
Pubblicazione: (2024)
di: Muzio, Alexandre, et al.
Pubblicazione: (2024)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training
di: Zhu, Tong, et al.
Pubblicazione: (2024)
di: Zhu, Tong, et al.
Pubblicazione: (2024)
Harder Tasks Need More Experts: Dynamic Routing in MoE Models
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
Sigma-MoE-Tiny Technical Report
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration
di: Wei, Linye, et al.
Pubblicazione: (2026)
di: Wei, Linye, et al.
Pubblicazione: (2026)
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
di: Sun, Weigao, et al.
Pubblicazione: (2025)
di: Sun, Weigao, et al.
Pubblicazione: (2025)
GRIN: GRadient-INformed MoE
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems
di: Wawdhane, Sourish, et al.
Pubblicazione: (2026)
di: Wawdhane, Sourish, et al.
Pubblicazione: (2026)
MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
di: Feng, Yuchen, et al.
Pubblicazione: (2025)
di: Feng, Yuchen, et al.
Pubblicazione: (2025)
Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling
di: Jiang, Fan, et al.
Pubblicazione: (2026)
di: Jiang, Fan, et al.
Pubblicazione: (2026)
Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts
di: Kang, Junmo, et al.
Pubblicazione: (2024)
di: Kang, Junmo, et al.
Pubblicazione: (2024)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
di: Wei, Tianwen, et al.
Pubblicazione: (2024)
di: Wei, Tianwen, et al.
Pubblicazione: (2024)
Post-Trained MoE Can Skip Half Experts via Self-Distillation
di: Lv, Xingtai, et al.
Pubblicazione: (2026)
di: Lv, Xingtai, et al.
Pubblicazione: (2026)
GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
di: Deng, Jianing, et al.
Pubblicazione: (2026)
di: Deng, Jianing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MoE-SpeQ: Speculative Quantized Decoding with Proactive Expert Prefetching and Offloading for Mixture-of-Experts
di: Wang, Wenfeng, et al.
Pubblicazione: (2025) -
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025) -
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
di: Gu, Naibin, et al.
Pubblicazione: (2025) -
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024) -
HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference
di: Tang, Peng, et al.
Pubblicazione: (2024)