Advancing MoE Efficiency: A Collaboration-Constrained Routing (C2R) Strategy for Better Expert Parallelism Design
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Mohan, Li, Pingzhi, Peng, Jie, Qiu, Mufan, Chen, Tianlong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
par: Luo, Shuqing, et autres
Publié: (2024)
par: Luo, Shuqing, et autres
Publié: (2024)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
par: Luo, Shuqing, et autres
Publié: (2025)
par: Luo, Shuqing, et autres
Publié: (2025)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
par: Han, Yu, et autres
Publié: (2025)
par: Han, Yu, et autres
Publié: (2025)
Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference
par: Sun, Xun, et autres
Publié: (2026)
par: Sun, Xun, et autres
Publié: (2026)
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
par: Zheng, Size, et autres
Publié: (2026)
par: Zheng, Size, et autres
Publié: (2026)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
par: Wang, Liujianfu, et autres
Publié: (2025)
par: Wang, Liujianfu, et autres
Publié: (2025)
Stable-MoE: Lyapunov-based Token Routing for Distributed Mixture-of-Experts Training over Edge Networks
par: Shi, Long, et autres
Publié: (2025)
par: Shi, Long, et autres
Publié: (2025)
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference
par: Luo, Jiajun, et autres
Publié: (2024)
par: Luo, Jiajun, et autres
Publié: (2024)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
par: Qian, Yulei, et autres
Publié: (2024)
par: Qian, Yulei, et autres
Publié: (2024)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
par: Zhang, Zhexiang, et autres
Publié: (2025)
par: Zhang, Zhexiang, et autres
Publié: (2025)
EC2MoE: Adaptive End-Cloud Pipeline Collaboration Enabling Scalable Mixture-of-Experts Inference
par: Yang, Zheming, et autres
Publié: (2025)
par: Yang, Zheming, et autres
Publié: (2025)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
par: Pan, Xinglin, et autres
Publié: (2025)
par: Pan, Xinglin, et autres
Publié: (2025)
MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
Parallel Collaborative ADMM Privacy Computing and Adaptive GPU Acceleration for Distributed Edge Networks
par: Xia, Mengchun, et autres
Publié: (2026)
par: Xia, Mengchun, et autres
Publié: (2026)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
par: Wu, Tian, et autres
Publié: (2025)
par: Wu, Tian, et autres
Publié: (2025)
MoE Parallel Folding: Heterogeneous Parallelism Mappings for Efficient Large-Scale MoE Model Training with Megatron Core
par: Liu, Dennis, et autres
Publié: (2025)
par: Liu, Dennis, et autres
Publié: (2025)
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
par: Nie, Xiaonan, et autres
Publié: (2024)
par: Nie, Xiaonan, et autres
Publié: (2024)
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
par: Chen, Liangkun, et autres
Publié: (2025)
par: Chen, Liangkun, et autres
Publié: (2025)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
par: Zhang, Yuning, et autres
Publié: (2025)
par: Zhang, Yuning, et autres
Publié: (2025)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)
par: Huang, En-Ming, et autres
Publié: (2025)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
par: Ma, Songkai, et autres
Publié: (2025)
par: Ma, Songkai, et autres
Publié: (2025)
Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm
par: Zhou, Bowen, et autres
Publié: (2026)
par: Zhou, Bowen, et autres
Publié: (2026)
D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving
par: Wang, Haodong, et autres
Publié: (2025)
par: Wang, Haodong, et autres
Publié: (2025)
MoE-SpeQ: Speculative Quantized Decoding with Proactive Expert Prefetching and Offloading for Mixture-of-Experts
par: Wang, Wenfeng, et autres
Publié: (2025)
par: Wang, Wenfeng, et autres
Publié: (2025)
HarMoEny: Efficient Multi-GPU Inference of MoE Models
par: Doucet, Zachary, et autres
Publié: (2025)
par: Doucet, Zachary, et autres
Publié: (2025)
Accelerating Distributed MoE Training and Inference with Lina
par: Li, Jiamin, et autres
Publié: (2022)
par: Li, Jiamin, et autres
Publié: (2022)
Sparse Checkpointing for Fast and Reliable MoE Training
par: Gandhi, Swapnil, et autres
Publié: (2024)
par: Gandhi, Swapnil, et autres
Publié: (2024)
HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference
par: Tang, Peng, et autres
Publié: (2024)
par: Tang, Peng, et autres
Publié: (2024)
MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
par: Tang, Xinru, et autres
Publié: (2025)
par: Tang, Xinru, et autres
Publié: (2025)
Fine-grained MoE Load Balancing with Linear Programming
par: Zhao, Chenqi, et autres
Publié: (2025)
par: Zhao, Chenqi, et autres
Publié: (2025)
Multi-Layer Scheduling for MoE-Based LLM Reasoning
par: Sun, Yifan, et autres
Publié: (2026)
par: Sun, Yifan, et autres
Publié: (2026)
LAER-MoE: Load-Adaptive Expert Re-layout for Efficient Mixture-of-Experts Training
par: Liu, Xinyi, et autres
Publié: (2026)
par: Liu, Xinyi, et autres
Publié: (2026)
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
par: Lin, Wenxiang, et autres
Publié: (2025)
par: Lin, Wenxiang, et autres
Publié: (2025)
ReviveMoE: Fast Recovery for Hardware Failures in Large-Scale MoE LLM Inference Deployments
par: Li, Haley, et autres
Publié: (2026)
par: Li, Haley, et autres
Publié: (2026)
ReaLB: Real-Time Load Balancing for Multimodal MoE Inference
par: Wang, Yingping, et autres
Publié: (2026)
par: Wang, Yingping, et autres
Publié: (2026)
MemFine: Memory-Aware Fine-Grained Scheduling for MoE Training
par: Zhao, Lu, et autres
Publié: (2025)
par: Zhao, Lu, et autres
Publié: (2025)
eMoE: Task-aware Memory Efficient Mixture-of-Experts-Based (MoE) Model Inference
par: Tairin, Suraiya, et autres
Publié: (2025)
par: Tairin, Suraiya, et autres
Publié: (2025)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
par: Yu, Yanpeng, et autres
Publié: (2025)
par: Yu, Yanpeng, et autres
Publié: (2025)
Documents similaires
-
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
par: Luo, Shuqing, et autres
Publié: (2024) -
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
par: Luo, Shuqing, et autres
Publié: (2025) -
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
par: Han, Yu, et autres
Publié: (2025) -
Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference
par: Sun, Xun, et autres
Publié: (2026) -
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
par: Zheng, Size, et autres
Publié: (2026)