Salvato in:
| Autori principali: | Yu, Enda, Dong, Dezun, Zhang, Zhaoning, Bai, Zhe, Yang, Weiling, Wang, Haojie, Li, Dongsheng, Wu, Yongwei, Liao, Xiangke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2509.23638 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
di: Yu, Enda, et al.
Pubblicazione: (2024)
di: Yu, Enda, et al.
Pubblicazione: (2024)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
di: Liu, Baihui, et al.
Pubblicazione: (2026)
di: Liu, Baihui, et al.
Pubblicazione: (2026)
Demystifying ARM SME to Optimize General Matrix Multiplications
di: Deng, Chencheng, et al.
Pubblicazione: (2025)
di: Deng, Chencheng, et al.
Pubblicazione: (2025)
Multi-Layer Scheduling for MoE-Based LLM Reasoning
di: Sun, Yifan, et al.
Pubblicazione: (2026)
di: Sun, Yifan, et al.
Pubblicazione: (2026)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill
di: Lee, Gunjun, et al.
Pubblicazione: (2025)
di: Lee, Gunjun, et al.
Pubblicazione: (2025)
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
di: Wu, Qi, et al.
Pubblicazione: (2026)
di: Wu, Qi, et al.
Pubblicazione: (2026)
Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling
di: Ma, Songchen, et al.
Pubblicazione: (2026)
di: Ma, Songchen, et al.
Pubblicazione: (2026)
MoE-Gen: High-Throughput MoE Inference on a Single GPU with Module-Based Batching
di: Xu, Tairan, et al.
Pubblicazione: (2025)
di: Xu, Tairan, et al.
Pubblicazione: (2025)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference
di: Vankov, Daniil, et al.
Pubblicazione: (2026)
di: Vankov, Daniil, et al.
Pubblicazione: (2026)
Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection
di: Gupta, Vima, et al.
Pubblicazione: (2024)
di: Gupta, Vima, et al.
Pubblicazione: (2024)
Static Batching of Irregular Workloads on GPUs: Framework and Application to Efficient MoE Model Inference
di: Li, Yinghan, et al.
Pubblicazione: (2025)
di: Li, Yinghan, et al.
Pubblicazione: (2025)
Synergistic Intra- and Cross-Layer Regularization Losses for MoE Expert Specialization
di: Hu, Rizhen, et al.
Pubblicazione: (2026)
di: Hu, Rizhen, et al.
Pubblicazione: (2026)
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
di: Zhong, Shuzhang, et al.
Pubblicazione: (2025)
di: Zhong, Shuzhang, et al.
Pubblicazione: (2025)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
di: Shen, Zixu, et al.
Pubblicazione: (2025)
di: Shen, Zixu, et al.
Pubblicazione: (2025)
Semantic Parallelism: Redefining Efficient MoE Inference via Model-Data Co-Scheduling
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
Priority-Aware Preemptive Scheduling for Mixed-Priority Workloads in MoE Inference
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving
di: Wang, Haodong, et al.
Pubblicazione: (2025)
di: Wang, Haodong, et al.
Pubblicazione: (2025)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
di: Xue, Leyang, et al.
Pubblicazione: (2024)
di: Xue, Leyang, et al.
Pubblicazione: (2024)
DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference
di: Zhang, Yujie, et al.
Pubblicazione: (2024)
di: Zhang, Yujie, et al.
Pubblicazione: (2024)
HarMoEny: Efficient Multi-GPU Inference of MoE Models
di: Doucet, Zachary, et al.
Pubblicazione: (2025)
di: Doucet, Zachary, et al.
Pubblicazione: (2025)
SERE: Similarity-based Expert Re-routing for Efficient Batch Decoding in MoE Models
di: Wu, Juntong, et al.
Pubblicazione: (2026)
di: Wu, Juntong, et al.
Pubblicazione: (2026)
Strategic Joining and Optimal Pricing in a Single‐Server Batch Arrival Queue With Different Information of Batch Size
di: Kaili Li, et al.
Pubblicazione: (2025)
di: Kaili Li, et al.
Pubblicazione: (2025)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
di: Cao, Shiyi, et al.
Pubblicazione: (2024)
di: Cao, Shiyi, et al.
Pubblicazione: (2024)
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
di: Fan, Xiao, et al.
Pubblicazione: (2025)
di: Fan, Xiao, et al.
Pubblicazione: (2025)
Fast MoE Inference via Predictive Prefetching and Expert Replication
di: Jyothish, Ankit, et al.
Pubblicazione: (2026)
di: Jyothish, Ankit, et al.
Pubblicazione: (2026)
Till the Layers Collapse: Compressing a Deep Neural Network through the Lenses of Batch Normalization Layers
di: Liao, Zhu, et al.
Pubblicazione: (2024)
di: Liao, Zhu, et al.
Pubblicazione: (2024)
Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning
di: Cao, Mingyu, et al.
Pubblicazione: (2024)
di: Cao, Mingyu, et al.
Pubblicazione: (2024)
Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference
di: Sun, Xun, et al.
Pubblicazione: (2026)
di: Sun, Xun, et al.
Pubblicazione: (2026)
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
Multi-Plane HyperX: A Low-Latency and Cost-Effective Network for Large-Scale AI and HPC Systems
di: Wang, Ziyu, et al.
Pubblicazione: (2026)
di: Wang, Ziyu, et al.
Pubblicazione: (2026)
ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling
di: Yang, Yuchen, et al.
Pubblicazione: (2026)
di: Yang, Yuchen, et al.
Pubblicazione: (2026)
SecMoE: Communication-Efficient Secure MoE Inference via Select-Then-Compute
di: Shen, Bowen, et al.
Pubblicazione: (2026)
di: Shen, Bowen, et al.
Pubblicazione: (2026)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
di: Ma, Songkai, et al.
Pubblicazione: (2025)
di: Ma, Songkai, et al.
Pubblicazione: (2025)
Telemetry-Based Server Selection in the Quantum Internet via Cross-Layer Runtime Estimation
di: Nagai, Masaki, et al.
Pubblicazione: (2026)
di: Nagai, Masaki, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
di: Yu, Enda, et al.
Pubblicazione: (2024) -
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
di: Liu, Baihui, et al.
Pubblicazione: (2026) -
Demystifying ARM SME to Optimize General Matrix Multiplications
di: Deng, Chencheng, et al.
Pubblicazione: (2025) -
Multi-Layer Scheduling for MoE-Based LLM Reasoning
di: Sun, Yifan, et al.
Pubblicazione: (2026) -
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)