Salvato in:
| Autori principali: | Zhang, Zeliang, Ghosh, Nikhil, Liu, Jiani, Yu, Bin, Liu, Xiaodong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.06542 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning
di: Cao, Mingyu, et al.
Pubblicazione: (2024)
di: Cao, Mingyu, et al.
Pubblicazione: (2024)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning
di: Lee, Jaeseong, et al.
Pubblicazione: (2024)
di: Lee, Jaeseong, et al.
Pubblicazione: (2024)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
Why Instruction-Based Unlearning Fails in Diffusion Models?
di: Zhang, Zeliang, et al.
Pubblicazione: (2026)
di: Zhang, Zeliang, et al.
Pubblicazione: (2026)
$μ$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2025)
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2025)
Polysemantic Experts, Monosemantic Paths: Routing as Control in MoEs
di: Ye, Charles, et al.
Pubblicazione: (2026)
di: Ye, Charles, et al.
Pubblicazione: (2026)
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
Continual Pre-training of MoEs: How robust is your router?
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)
Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
di: Tang, Shengkun, et al.
Pubblicazione: (2026)
di: Tang, Shengkun, et al.
Pubblicazione: (2026)
GRIN: GRadient-INformed MoE
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
di: Deng, Jianing, et al.
Pubblicazione: (2026)
di: Deng, Jianing, et al.
Pubblicazione: (2026)
S2MoE: Robust Sparse Mixture of Experts via Stochastic Learning
di: Do, Giang, et al.
Pubblicazione: (2025)
di: Do, Giang, et al.
Pubblicazione: (2025)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
Training Report of TeleChat3-MoE
di: Liu, Xinzhang, et al.
Pubblicazione: (2025)
di: Liu, Xinzhang, et al.
Pubblicazione: (2025)
$\texttt{MoE-RBench}$: Towards Building Reliable Language Models with Sparse Mixture-of-Experts
di: Chen, Guanjie, et al.
Pubblicazione: (2024)
di: Chen, Guanjie, et al.
Pubblicazione: (2024)
When Does Sparse MoE Help in Vision? The Role of Backbone Compute Leverage in Sparse Routing
di: Sun, Libo, et al.
Pubblicazione: (2026)
di: Sun, Libo, et al.
Pubblicazione: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
di: Zibakhsh, Soheil, et al.
Pubblicazione: (2025)
di: Zibakhsh, Soheil, et al.
Pubblicazione: (2025)
SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts
di: Muzio, Alexandre, et al.
Pubblicazione: (2024)
di: Muzio, Alexandre, et al.
Pubblicazione: (2024)
PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models
di: Hayou, Soufiane, et al.
Pubblicazione: (2025)
di: Hayou, Soufiane, et al.
Pubblicazione: (2025)
Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
di: Huang, Hejin, et al.
Pubblicazione: (2026)
di: Huang, Hejin, et al.
Pubblicazione: (2026)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
di: Liu, Zhenyu, et al.
Pubblicazione: (2025)
di: Liu, Zhenyu, et al.
Pubblicazione: (2025)
OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale
di: Shi, Jingze, et al.
Pubblicazione: (2026)
di: Shi, Jingze, et al.
Pubblicazione: (2026)
Octavius: Mitigating Task Interference in MLLMs via LoRA-MoE
di: Chen, Zeren, et al.
Pubblicazione: (2023)
di: Chen, Zeren, et al.
Pubblicazione: (2023)
The Impact of Initialization on LoRA Finetuning Dynamics
di: Hayou, Soufiane, et al.
Pubblicazione: (2024)
di: Hayou, Soufiane, et al.
Pubblicazione: (2024)
LoRA+: Efficient Low Rank Adaptation of Large Models
di: Hayou, Soufiane, et al.
Pubblicazione: (2024)
di: Hayou, Soufiane, et al.
Pubblicazione: (2024)
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
di: Liu, Xiangyue, et al.
Pubblicazione: (2026)
di: Liu, Xiangyue, et al.
Pubblicazione: (2026)
Training Large Reasoning Models Efficiently via Progressive Thought Encoding
di: Zhang, Zeliang, et al.
Pubblicazione: (2026)
di: Zhang, Zeliang, et al.
Pubblicazione: (2026)
Ada-K Routing: Boosting the Efficiency of MoE-based LLMs
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation
di: Singh, Navan Preet, et al.
Pubblicazione: (2026)
di: Singh, Navan Preet, et al.
Pubblicazione: (2026)
MoE-DiffuSeq: Enhancing Long-Document Diffusion Models with Sparse Attention and Mixture of Experts
di: Christoforos, Alexandros, et al.
Pubblicazione: (2025)
di: Christoforos, Alexandros, et al.
Pubblicazione: (2025)
MoE-Sieve: Routing-Guided LoRA for Efficient MoE Fine-Tuning
di: Manzoni, Andrea
Pubblicazione: (2026)
di: Manzoni, Andrea
Pubblicazione: (2026)
Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
Sigma-MoE-Tiny Technical Report
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
di: Zhang, Zeliang, et al.
Pubblicazione: (2024) -
Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning
di: Cao, Mingyu, et al.
Pubblicazione: (2024) -
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025) -
STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning
di: Lee, Jaeseong, et al.
Pubblicazione: (2024) -
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)