PROBE: Co-Balancing Computation and Communication in MoE Inference via Real-Time Predictive Prefetching
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Qianchao, Ye, Xucheng, Liu, Yuliang, Ouyang, Haodong, Song, Chengru |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
par: Chen, Liangkun, et autres
Publié: (2025)
par: Chen, Liangkun, et autres
Publié: (2025)
ReaLB: Real-Time Load Balancing for Multimodal MoE Inference
par: Wang, Yingping, et autres
Publié: (2026)
par: Wang, Yingping, et autres
Publié: (2026)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
par: Zhang, Yuning, et autres
Publié: (2025)
par: Zhang, Yuning, et autres
Publié: (2025)
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
par: Nie, Xiaonan, et autres
Publié: (2024)
par: Nie, Xiaonan, et autres
Publié: (2024)
Fine-grained MoE Load Balancing with Linear Programming
par: Zhao, Chenqi, et autres
Publié: (2025)
par: Zhao, Chenqi, et autres
Publié: (2025)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
par: Han, Yu, et autres
Publié: (2025)
par: Han, Yu, et autres
Publié: (2025)
Accelerating Distributed MoE Training and Inference with Lina
par: Li, Jiamin, et autres
Publié: (2022)
par: Li, Jiamin, et autres
Publié: (2022)
D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving
par: Wang, Haodong, et autres
Publié: (2025)
par: Wang, Haodong, et autres
Publié: (2025)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
par: Wang, Liujianfu, et autres
Publié: (2025)
par: Wang, Liujianfu, et autres
Publié: (2025)
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference
par: Luo, Jiajun, et autres
Publié: (2024)
par: Luo, Jiajun, et autres
Publié: (2024)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
par: Zhang, Zhexiang, et autres
Publié: (2025)
par: Zhang, Zhexiang, et autres
Publié: (2025)
HarMoEny: Efficient Multi-GPU Inference of MoE Models
par: Doucet, Zachary, et autres
Publié: (2025)
par: Doucet, Zachary, et autres
Publié: (2025)
MoE-SpeQ: Speculative Quantized Decoding with Proactive Expert Prefetching and Offloading for Mixture-of-Experts
par: Wang, Wenfeng, et autres
Publié: (2025)
par: Wang, Wenfeng, et autres
Publié: (2025)
BrownoutServe: SLO-Aware Inference Serving under Bursty Workloads for MoE-based LLMs
par: Hu, Jianmin, et autres
Publié: (2025)
par: Hu, Jianmin, et autres
Publié: (2025)
Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference
par: Sun, Xun, et autres
Publié: (2026)
par: Sun, Xun, et autres
Publié: (2026)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
par: Qian, Yulei, et autres
Publié: (2024)
par: Qian, Yulei, et autres
Publié: (2024)
MoEless: Efficient MoE LLM Serving via Serverless Computing
par: Yu, Hanfei, et autres
Publié: (2026)
par: Yu, Hanfei, et autres
Publié: (2026)
FEPLB: Exploiting Copy Engines for Nearly Free MoE Load Balancing in Distributed Training
par: Qi, Shuyao, et autres
Publié: (2026)
par: Qi, Shuyao, et autres
Publié: (2026)
ReviveMoE: Fast Recovery for Hardware Failures in Large-Scale MoE LLM Inference Deployments
par: Li, Haley, et autres
Publié: (2026)
par: Li, Haley, et autres
Publié: (2026)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
par: Wu, Tian, et autres
Publié: (2025)
par: Wu, Tian, et autres
Publié: (2025)
Remoe: Towards Efficient and Low-Cost MoE Inference in Serverless Computing
par: Liu, Wentao, et autres
Publié: (2025)
par: Liu, Wentao, et autres
Publié: (2025)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
par: Ma, Songkai, et autres
Publié: (2025)
par: Ma, Songkai, et autres
Publié: (2025)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)
par: Huang, En-Ming, et autres
Publié: (2025)
MoE-Gen: High-Throughput MoE Inference on a Single GPU with Module-Based Batching
par: Xu, Tairan, et autres
Publié: (2025)
par: Xu, Tairan, et autres
Publié: (2025)
DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference
par: Zhang, Yujie, et autres
Publié: (2024)
par: Zhang, Yujie, et autres
Publié: (2024)
DALI: A Workload-Aware Offloading Framework for Efficient MoE Inference on Local PCs
par: Zhu, Zeyu, et autres
Publié: (2026)
par: Zhu, Zeyu, et autres
Publié: (2026)
Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
par: Luo, Shuqing, et autres
Publié: (2025)
par: Luo, Shuqing, et autres
Publié: (2025)
Relay Buffer Independent Communication over Pooled HBM for Efficient MoE Inference on Ascend
par: Hu, Tianlun, et autres
Publié: (2026)
par: Hu, Tianlun, et autres
Publié: (2026)
EC2MoE: Adaptive End-Cloud Pipeline Collaboration Enabling Scalable Mixture-of-Experts Inference
par: Yang, Zheming, et autres
Publié: (2025)
par: Yang, Zheming, et autres
Publié: (2025)
Sparse Checkpointing for Fast and Reliable MoE Training
par: Gandhi, Swapnil, et autres
Publié: (2024)
par: Gandhi, Swapnil, et autres
Publié: (2024)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
par: Wu, Qi, et autres
Publié: (2026)
par: Wu, Qi, et autres
Publié: (2026)
Making MoE-based LLM Inference Resilient with Tarragon
par: Zhang, Songyu, et autres
Publié: (2026)
par: Zhang, Songyu, et autres
Publié: (2026)
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
par: Chen, Chang, et autres
Publié: (2025)
par: Chen, Chang, et autres
Publié: (2025)
When MoE Meets Blockchain: A Trustworthy Distributed Framework of Large Models
par: Zhu, Weihao, et autres
Publié: (2025)
par: Zhu, Weihao, et autres
Publié: (2025)
Multi-Layer Scheduling for MoE-Based LLM Reasoning
par: Sun, Yifan, et autres
Publié: (2026)
par: Sun, Yifan, et autres
Publié: (2026)
DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism
par: Zeng, Zhichen, et autres
Publié: (2026)
par: Zeng, Zhichen, et autres
Publié: (2026)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
par: Zhou, Zhuoshan, et autres
Publié: (2026)
par: Zhou, Zhuoshan, et autres
Publié: (2026)
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference
par: Meng, Han, et autres
Publié: (2026)
par: Meng, Han, et autres
Publié: (2026)
MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm
par: Zhou, Bowen, et autres
Publié: (2026)
par: Zhou, Bowen, et autres
Publié: (2026)
Documents similaires
-
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
par: Chen, Liangkun, et autres
Publié: (2025) -
ReaLB: Real-Time Load Balancing for Multimodal MoE Inference
par: Wang, Yingping, et autres
Publié: (2026) -
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
par: Zhang, Yuning, et autres
Publié: (2025) -
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
par: Nie, Xiaonan, et autres
Publié: (2024) -
Fine-grained MoE Load Balancing with Linear Programming
par: Zhao, Chenqi, et autres
Publié: (2025)