MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Zongle, Zhu, Lei, Zhan, Zongyuan, Hu, Ting, Mao, Weikai, Yu, Xianzhi, Liu, Yongpan, Zhang, Tianyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoESD: Mixture of Experts Stable Diffusion to Mitigate Gender Bias
di: Wang, Guorun, et al.
Pubblicazione: (2024)
di: Wang, Guorun, et al.
Pubblicazione: (2024)
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
MoE-Spec: Expert Budgeting for Efficient Speculative Decoding
di: McDanel, Bradley, et al.
Pubblicazione: (2026)
di: McDanel, Bradley, et al.
Pubblicazione: (2026)
Scope: A Scalable Merged Pipeline Framework for Multi-Chip-Module NN Accelerators
di: Huang, Zongle, et al.
Pubblicazione: (2026)
di: Huang, Zongle, et al.
Pubblicazione: (2026)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
di: Pan, Lehan, et al.
Pubblicazione: (2026)
di: Pan, Lehan, et al.
Pubblicazione: (2026)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
Accelerating Distributed MoE Training and Inference with Lina
di: Li, Jiamin, et al.
Pubblicazione: (2022)
di: Li, Jiamin, et al.
Pubblicazione: (2022)
MoE-SpeQ: Speculative Quantized Decoding with Proactive Expert Prefetching and Offloading for Mixture-of-Experts
di: Wang, Wenfeng, et al.
Pubblicazione: (2025)
di: Wang, Wenfeng, et al.
Pubblicazione: (2025)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
di: Xue, Leyang, et al.
Pubblicazione: (2024)
di: Xue, Leyang, et al.
Pubblicazione: (2024)
Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
di: Guo, Wentao, et al.
Pubblicazione: (2025)
di: Guo, Wentao, et al.
Pubblicazione: (2025)
FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge
di: Hu, Gang, et al.
Pubblicazione: (2025)
di: Hu, Gang, et al.
Pubblicazione: (2025)
MoE-Gen: High-Throughput MoE Inference on a Single GPU with Module-Based Batching
di: Xu, Tairan, et al.
Pubblicazione: (2025)
di: Xu, Tairan, et al.
Pubblicazione: (2025)
Sigma-MoE-Tiny Technical Report
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
Samoyeds: Accelerating MoE Models with Structured Sparsity Leveraging Sparse Tensor Cores
di: Wu, Chenpeng, et al.
Pubblicazione: (2025)
di: Wu, Chenpeng, et al.
Pubblicazione: (2025)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
Nucleus-Image: Sparse MoE for Image Generation
di: Akiti, Chandan, et al.
Pubblicazione: (2026)
di: Akiti, Chandan, et al.
Pubblicazione: (2026)
Sparse Checkpointing for Fast and Reliable MoE Training
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
di: Kong, Lingshun, et al.
Pubblicazione: (2026)
di: Kong, Lingshun, et al.
Pubblicazione: (2026)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
di: Zheng, Kening, et al.
Pubblicazione: (2026)
di: Zheng, Kening, et al.
Pubblicazione: (2026)
Accelerating MoE Model Inference with Expert Sharding
di: Balmau, Oana, et al.
Pubblicazione: (2025)
di: Balmau, Oana, et al.
Pubblicazione: (2025)
Grouter: Decoupling Routing from Representation for Accelerated MoE Training
di: Xu, Yuqi, et al.
Pubblicazione: (2026)
di: Xu, Yuqi, et al.
Pubblicazione: (2026)
Revisiting MoE and Dense Speed-Accuracy Comparisons for LLM Training
di: Du, Xianzhi, et al.
Pubblicazione: (2024)
di: Du, Xianzhi, et al.
Pubblicazione: (2024)
Accelerate Speculative Decoding with Sparse Computation in Verification
di: Wang, Jikai, et al.
Pubblicazione: (2025)
di: Wang, Jikai, et al.
Pubblicazione: (2025)
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
di: Nie, Xiaonan, et al.
Pubblicazione: (2024)
di: Nie, Xiaonan, et al.
Pubblicazione: (2024)
MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving
di: Su, Zhaoyuan, et al.
Pubblicazione: (2026)
di: Su, Zhaoyuan, et al.
Pubblicazione: (2026)
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
di: Hannah, Lauren. A, et al.
Pubblicazione: (2025)
di: Hannah, Lauren. A, et al.
Pubblicazione: (2025)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization
di: Fu, Zhongqian, et al.
Pubblicazione: (2025)
di: Fu, Zhongqian, et al.
Pubblicazione: (2025)
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
MoE-Loco: Mixture of Experts for Multitask Locomotion
di: Huang, Runhan, et al.
Pubblicazione: (2025)
di: Huang, Runhan, et al.
Pubblicazione: (2025)
BIG-MoE: Bypass Isolated Gating MoE for Generalized Multimodal Face Anti-Spoofing
di: Ma, Yingjie, et al.
Pubblicazione: (2024)
di: Ma, Yingjie, et al.
Pubblicazione: (2024)
MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2025)
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2025)
MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2024)
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoESD: Mixture of Experts Stable Diffusion to Mitigate Gender Bias
di: Wang, Guorun, et al.
Pubblicazione: (2024) -
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
di: Chen, Liangkun, et al.
Pubblicazione: (2025) -
MoE-Spec: Expert Budgeting for Efficient Speculative Decoding
di: McDanel, Bradley, et al.
Pubblicazione: (2026) -
Scope: A Scalable Merged Pipeline Framework for Multi-Chip-Module NN Accelerators
di: Huang, Zongle, et al.
Pubblicazione: (2026) -
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)