LAER-MoE: Load-Adaptive Expert Re-layout for Efficient Mixture-of-Experts Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xinyi, Wang, Yujie, Fu, Fangcheng, Xiao, Xuefeng, Li, Huixia, Li, Jiashi, Cui, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
di: Luo, Shuqing, et al.
Pubblicazione: (2024)
di: Luo, Shuqing, et al.
Pubblicazione: (2024)
FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism
di: Wang, Yujie, et al.
Pubblicazione: (2024)
di: Wang, Yujie, et al.
Pubblicazione: (2024)
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
di: Nie, Xiaonan, et al.
Pubblicazione: (2024)
di: Nie, Xiaonan, et al.
Pubblicazione: (2024)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
MegaScale-MoE: Large-Scale Communication-Efficient Training of Mixture-of-Experts Models in Production
di: Jin, Chao, et al.
Pubblicazione: (2025)
di: Jin, Chao, et al.
Pubblicazione: (2025)
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
di: Zheng, Size, et al.
Pubblicazione: (2026)
di: Zheng, Size, et al.
Pubblicazione: (2026)
Stable-MoE: Lyapunov-based Token Routing for Distributed Mixture-of-Experts Training over Edge Networks
di: Shi, Long, et al.
Pubblicazione: (2025)
di: Shi, Long, et al.
Pubblicazione: (2025)
EC2MoE: Adaptive End-Cloud Pipeline Collaboration Enabling Scalable Mixture-of-Experts Inference
di: Yang, Zheming, et al.
Pubblicazione: (2025)
di: Yang, Zheming, et al.
Pubblicazione: (2025)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
MoE-SpeQ: Speculative Quantized Decoding with Proactive Expert Prefetching and Offloading for Mixture-of-Experts
di: Wang, Wenfeng, et al.
Pubblicazione: (2025)
di: Wang, Wenfeng, et al.
Pubblicazione: (2025)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
di: Zhang, Zhexiang, et al.
Pubblicazione: (2025)
di: Zhang, Zhexiang, et al.
Pubblicazione: (2025)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
di: Shen, Zixu, et al.
Pubblicazione: (2025)
di: Shen, Zixu, et al.
Pubblicazione: (2025)
MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2025)
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2025)
MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2024)
di: Jiang, Yinsicheng, et al.
Pubblicazione: (2024)
HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference
di: Lin, Haoran, et al.
Pubblicazione: (2025)
di: Lin, Haoran, et al.
Pubblicazione: (2025)
SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models
di: Du, Zhixu, et al.
Pubblicazione: (2023)
di: Du, Zhixu, et al.
Pubblicazione: (2023)
eMoE: Task-aware Memory Efficient Mixture-of-Experts-Based (MoE) Model Inference
di: Tairin, Suraiya, et al.
Pubblicazione: (2025)
di: Tairin, Suraiya, et al.
Pubblicazione: (2025)
ElasticMoE: An Efficient Auto Scaling Method for Mixture-of-Experts Models
di: Singh, Gursimran, et al.
Pubblicazione: (2025)
di: Singh, Gursimran, et al.
Pubblicazione: (2025)
Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving
di: Liu, Ziming, et al.
Pubblicazione: (2025)
di: Liu, Ziming, et al.
Pubblicazione: (2025)
X-MoE: Enabling Scalable Training for Emerging Mixture-of-Experts Architectures on HPC Platforms
di: Yuan, Yueming, et al.
Pubblicazione: (2025)
di: Yuan, Yueming, et al.
Pubblicazione: (2025)
FlowMoE: A Scalable Pipeline Scheduling Framework for Distributed Mixture-of-Experts Training
di: Gao, Yunqi, et al.
Pubblicazione: (2025)
di: Gao, Yunqi, et al.
Pubblicazione: (2025)
Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference
di: Sun, Xun, et al.
Pubblicazione: (2026)
di: Sun, Xun, et al.
Pubblicazione: (2026)
Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models
di: Wang, Wei, et al.
Pubblicazione: (2024)
di: Wang, Wei, et al.
Pubblicazione: (2024)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
di: Zhang, Yuning, et al.
Pubblicazione: (2025)
di: Zhang, Yuning, et al.
Pubblicazione: (2025)
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
di: Wu, Yongji, et al.
Pubblicazione: (2025)
di: Wu, Yongji, et al.
Pubblicazione: (2025)
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
di: Luo, Shuqing, et al.
Pubblicazione: (2025)
di: Luo, Shuqing, et al.
Pubblicazione: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
di: Wu, Tian, et al.
Pubblicazione: (2025)
di: Wu, Tian, et al.
Pubblicazione: (2025)
DualSparse-MoE: Coordinating Tensor/Neuron-Level Sparsity with Expert Partition and Reconstruction
di: Cai, Weilin, et al.
Pubblicazione: (2025)
di: Cai, Weilin, et al.
Pubblicazione: (2025)
Galvatron: An Automatic Distributed System for Efficient Foundation Model Training
di: Liu, Xinyi, et al.
Pubblicazione: (2025)
di: Liu, Xinyi, et al.
Pubblicazione: (2025)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
MoC-System: Efficient Fault Tolerance for Sparse Mixture-of-Experts Model Training
di: Cai, Weilin, et al.
Pubblicazione: (2024)
di: Cai, Weilin, et al.
Pubblicazione: (2024)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
di: Ma, Songkai, et al.
Pubblicazione: (2025)
di: Ma, Songkai, et al.
Pubblicazione: (2025)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
di: Yu, Yanpeng, et al.
Pubblicazione: (2025)
di: Yu, Yanpeng, et al.
Pubblicazione: (2025)
RailS: Load Balancing for All-to-All Communication in Distributed Mixture-of-Experts Training
di: Xu, Heng, et al.
Pubblicazione: (2025)
di: Xu, Heng, et al.
Pubblicazione: (2025)
MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services
di: Yu, Dianhai, et al.
Pubblicazione: (2022)
di: Yu, Dianhai, et al.
Pubblicazione: (2022)
ReaLB: Real-Time Load Balancing for Multimodal MoE Inference
di: Wang, Yingping, et al.
Pubblicazione: (2026)
di: Wang, Yingping, et al.
Pubblicazione: (2026)
Toward Cost-Efficient Serving of Mixture-of-Experts with Asynchrony
di: Wang, Shaoyu, et al.
Pubblicazione: (2025)
di: Wang, Shaoyu, et al.
Pubblicazione: (2025)
Accelerating Distributed MoE Training and Inference with Lina
di: Li, Jiamin, et al.
Pubblicazione: (2022)
di: Li, Jiamin, et al.
Pubblicazione: (2022)
Unleashing Efficient Asynchronous RL Post-Training via Staleness-Constrained Rollout Coordination
di: Li, Haoyang, et al.
Pubblicazione: (2026)
di: Li, Haoyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
di: Luo, Shuqing, et al.
Pubblicazione: (2024) -
FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism
di: Wang, Yujie, et al.
Pubblicazione: (2024) -
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
di: Nie, Xiaonan, et al.
Pubblicazione: (2024) -
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
di: Wang, Liujianfu, et al.
Pubblicazione: (2025) -
MegaScale-MoE: Large-Scale Communication-Efficient Training of Mixture-of-Experts Models in Production
di: Jin, Chao, et al.
Pubblicazione: (2025)