EvoESAP: Non-Uniform Expert Pruning for Sparse MoE
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zongfang, Tang, Shengkun, Sun, Boyang, Shen, Zhiqiang, Yuan, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AIMER: Calibration-Free Task-Agnostic MoE Pruning
por: Liu, Zongfang, et al.
Publicado: (2026)
por: Liu, Zongfang, et al.
Publicado: (2026)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
por: Tang, Shengkun, et al.
Publicado: (2026)
por: Tang, Shengkun, et al.
Publicado: (2026)
MoE Pathfinder: Trajectory-driven Expert Pruning
por: Yang, Xican, et al.
Publicado: (2025)
por: Yang, Xican, et al.
Publicado: (2025)
Diff-ES: Stage-wise Structural Diffusion Pruning via Evolutionary Search
por: Liu, Zongfang, et al.
Publicado: (2026)
por: Liu, Zongfang, et al.
Publicado: (2026)
SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts
por: Muzio, Alexandre, et al.
Publicado: (2024)
por: Muzio, Alexandre, et al.
Publicado: (2024)
MoE-DisCo:Low Economy Cost Training Mixture-of-Experts Models
por: Ye, Xin, et al.
Publicado: (2026)
por: Ye, Xin, et al.
Publicado: (2026)
FLEX-MoE: Federated Mixture-of-Experts with Load-balanced Expert Assignment for Edge Computing
por: Zhang, Boyang, et al.
Publicado: (2025)
por: Zhang, Boyang, et al.
Publicado: (2025)
MoNE: Replacing Redundant Experts with Lightweight Novices for Structured Pruning of MoE
por: Zhang, Geng, et al.
Publicado: (2025)
por: Zhang, Geng, et al.
Publicado: (2025)
MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
por: Guo, Bowei, et al.
Publicado: (2025)
por: Guo, Bowei, et al.
Publicado: (2025)
$μ$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts
por: Koike-Akino, Toshiaki, et al.
Publicado: (2025)
por: Koike-Akino, Toshiaki, et al.
Publicado: (2025)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
por: Tang, Shengkun, et al.
Publicado: (2025)
por: Tang, Shengkun, et al.
Publicado: (2025)
Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts
por: Liu, Xu, et al.
Publicado: (2024)
por: Liu, Xu, et al.
Publicado: (2024)
Sink-Aware Pruning for Diffusion Language Models
por: Myrzakhan, Aidar, et al.
Publicado: (2026)
por: Myrzakhan, Aidar, et al.
Publicado: (2026)
Synergistic Intra- and Cross-Layer Regularization Losses for MoE Expert Specialization
por: Hu, Rizhen, et al.
Publicado: (2026)
por: Hu, Rizhen, et al.
Publicado: (2026)
Retraining-Free Merging of Sparse MoE via Hierarchical Clustering
por: Chen, I-Chun, et al.
Publicado: (2024)
por: Chen, I-Chun, et al.
Publicado: (2024)
Expert Divergence Learning for MoE-based Language Models
por: Li, Jiaang, et al.
Publicado: (2026)
por: Li, Jiaang, et al.
Publicado: (2026)
Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning
por: Li, Weihang, et al.
Publicado: (2026)
por: Li, Weihang, et al.
Publicado: (2026)
Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning
por: Cao, Mingyu, et al.
Publicado: (2024)
por: Cao, Mingyu, et al.
Publicado: (2024)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
por: Xia, Xinfeng, et al.
Publicado: (2025)
por: Xia, Xinfeng, et al.
Publicado: (2025)
MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition
por: Yang, Cheng, et al.
Publicado: (2024)
por: Yang, Cheng, et al.
Publicado: (2024)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
por: Jin, Peng, et al.
Publicado: (2024)
por: Jin, Peng, et al.
Publicado: (2024)
STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning
por: Lee, Jaeseong, et al.
Publicado: (2024)
por: Lee, Jaeseong, et al.
Publicado: (2024)
REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
por: Lasby, Mike, et al.
Publicado: (2025)
por: Lasby, Mike, et al.
Publicado: (2025)
Horseshoe Mixtures-of-Experts (HS-MoE)
por: Polson, Nick, et al.
Publicado: (2026)
por: Polson, Nick, et al.
Publicado: (2026)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
por: Xie, Yanyue, et al.
Publicado: (2024)
por: Xie, Yanyue, et al.
Publicado: (2024)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
por: Xue, Leyang, et al.
Publicado: (2024)
por: Xue, Leyang, et al.
Publicado: (2024)
FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving
por: Liu, Qingxiu, et al.
Publicado: (2026)
por: Liu, Qingxiu, et al.
Publicado: (2026)
MoE Lens -- An Expert Is All You Need
por: Chaudhari, Marmik, et al.
Publicado: (2026)
por: Chaudhari, Marmik, et al.
Publicado: (2026)
MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
por: Chen, Xiaodong, et al.
Publicado: (2025)
por: Chen, Xiaodong, et al.
Publicado: (2025)
SD-MoE: Spectral Decomposition for Effective Expert Specialization
por: Huang, Ruijun, et al.
Publicado: (2026)
por: Huang, Ruijun, et al.
Publicado: (2026)
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
por: Zhong, Shuzhang, et al.
Publicado: (2024)
por: Zhong, Shuzhang, et al.
Publicado: (2024)
$\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts
por: Takashiro, Shota, et al.
Publicado: (2026)
por: Takashiro, Shota, et al.
Publicado: (2026)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
por: Ma, Songkai, et al.
Publicado: (2025)
por: Ma, Songkai, et al.
Publicado: (2025)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
por: Ma, Haiyue, et al.
Publicado: (2025)
por: Ma, Haiyue, et al.
Publicado: (2025)
$\texttt{MoE-RBench}$: Towards Building Reliable Language Models with Sparse Mixture-of-Experts
por: Chen, Guanjie, et al.
Publicado: (2024)
por: Chen, Guanjie, et al.
Publicado: (2024)
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
por: Miao, Ruijie, et al.
Publicado: (2025)
por: Miao, Ruijie, et al.
Publicado: (2025)
MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
por: Jiang, Yinsicheng, et al.
Publicado: (2025)
por: Jiang, Yinsicheng, et al.
Publicado: (2025)
MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
por: Jiang, Yinsicheng, et al.
Publicado: (2024)
por: Jiang, Yinsicheng, et al.
Publicado: (2024)
DA-MoE: Towards Dynamic Expert Allocation for Mixture-of-Experts Models
por: Aghdam, Maryam Akhavan, et al.
Publicado: (2024)
por: Aghdam, Maryam Akhavan, et al.
Publicado: (2024)
MoE-Spec: Expert Budgeting for Efficient Speculative Decoding
por: McDanel, Bradley, et al.
Publicado: (2026)
por: McDanel, Bradley, et al.
Publicado: (2026)
Ejemplares similares
-
AIMER: Calibration-Free Task-Agnostic MoE Pruning
por: Liu, Zongfang, et al.
Publicado: (2026) -
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
por: Tang, Shengkun, et al.
Publicado: (2026) -
MoE Pathfinder: Trajectory-driven Expert Pruning
por: Yang, Xican, et al.
Publicado: (2025) -
Diff-ES: Stage-wise Structural Diffusion Pruning via Evolutionary Search
por: Liu, Zongfang, et al.
Publicado: (2026) -
SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts
por: Muzio, Alexandre, et al.
Publicado: (2024)