Accelerating MoE Model Inference with Expert Sharding
Fuente:
arXiv
Salvato in:
| Autori principali: | Balmau, Oana, Kermarrec, Anne-Marie, Pires, Rafael, Santo, André Loureiro Espírito, de Vos, Martijn, Vujasinovic, Milos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HarMoEny: Efficient Multi-GPU Inference of MoE Models
di: Doucet, Zachary, et al.
Pubblicazione: (2025)
di: Doucet, Zachary, et al.
Pubblicazione: (2025)
Decentralized Learning Made Easy with DecentralizePy
di: Dhasade, Akash, et al.
Pubblicazione: (2023)
di: Dhasade, Akash, et al.
Pubblicazione: (2023)
Get More for Less in Decentralized Learning Systems
di: Dhasade, Akash, et al.
Pubblicazione: (2023)
di: Dhasade, Akash, et al.
Pubblicazione: (2023)
PeerSwap: A Peer-Sampler with Randomness Guarantees
di: Guerraoui, Rachid, et al.
Pubblicazione: (2024)
di: Guerraoui, Rachid, et al.
Pubblicazione: (2024)
Harnessing Increased Client Participation with Cohort-Parallel Federated Learning
di: Dhasade, Akash, et al.
Pubblicazione: (2024)
di: Dhasade, Akash, et al.
Pubblicazione: (2024)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
di: Wu, Tian, et al.
Pubblicazione: (2025)
di: Wu, Tian, et al.
Pubblicazione: (2025)
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
di: Chen, Liangkun, et al.
Pubblicazione: (2025)
Boosting Asynchronous Decentralized Learning with Model Fragmentation
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
Accelerating Distributed MoE Training and Inference with Lina
di: Li, Jiamin, et al.
Pubblicazione: (2022)
di: Li, Jiamin, et al.
Pubblicazione: (2022)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
di: Zhang, Zhexiang, et al.
Pubblicazione: (2025)
di: Zhang, Zhexiang, et al.
Pubblicazione: (2025)
Practical Federated Learning without a Server
di: Dhasade, Akash, et al.
Pubblicazione: (2025)
di: Dhasade, Akash, et al.
Pubblicazione: (2025)
Decentralized Learning Made Practical with Client Sampling
di: de Vos, Martijn, et al.
Pubblicazione: (2023)
di: de Vos, Martijn, et al.
Pubblicazione: (2023)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
MinatoLoader: Accelerating Machine Learning Training Through Efficient Data Preprocessing
di: Nouaji, Rahma, et al.
Pubblicazione: (2025)
di: Nouaji, Rahma, et al.
Pubblicazione: (2025)
Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference
di: Sun, Xun, et al.
Pubblicazione: (2026)
di: Sun, Xun, et al.
Pubblicazione: (2026)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
di: Ma, Songkai, et al.
Pubblicazione: (2025)
di: Ma, Songkai, et al.
Pubblicazione: (2025)
Fair Decentralized Learning
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
Energy-Aware Decentralized Learning with Intermittent Model Training
di: Dhasade, Akash, et al.
Pubblicazione: (2024)
di: Dhasade, Akash, et al.
Pubblicazione: (2024)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
di: Luo, Shuqing, et al.
Pubblicazione: (2025)
di: Luo, Shuqing, et al.
Pubblicazione: (2025)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
A Pragmatic Approach to Learned Indexing in RocksDB: Targeted Optimizations with Minimal System Modification
di: Vashisth, Shubham, et al.
Pubblicazione: (2026)
di: Vashisth, Shubham, et al.
Pubblicazione: (2026)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
di: Zhang, Yuning, et al.
Pubblicazione: (2025)
di: Zhang, Yuning, et al.
Pubblicazione: (2025)
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
EC2MoE: Adaptive End-Cloud Pipeline Collaboration Enabling Scalable Mixture-of-Experts Inference
di: Yang, Zheming, et al.
Pubblicazione: (2025)
di: Yang, Zheming, et al.
Pubblicazione: (2025)
Efficient Federated Search for Retrieval-Augmented Generation using Lightweight Routing
di: Dhasade, Akash, et al.
Pubblicazione: (2025)
di: Dhasade, Akash, et al.
Pubblicazione: (2025)
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
di: Luo, Shuqing, et al.
Pubblicazione: (2024)
di: Luo, Shuqing, et al.
Pubblicazione: (2024)
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference
di: Luo, Jiajun, et al.
Pubblicazione: (2024)
di: Luo, Jiajun, et al.
Pubblicazione: (2024)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
eMoE: Task-aware Memory Efficient Mixture-of-Experts-Based (MoE) Model Inference
di: Tairin, Suraiya, et al.
Pubblicazione: (2025)
di: Tairin, Suraiya, et al.
Pubblicazione: (2025)
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
di: Zheng, Size, et al.
Pubblicazione: (2026)
di: Zheng, Size, et al.
Pubblicazione: (2026)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
di: Shen, Zixu, et al.
Pubblicazione: (2025)
di: Shen, Zixu, et al.
Pubblicazione: (2025)
HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference
di: Tang, Peng, et al.
Pubblicazione: (2024)
di: Tang, Peng, et al.
Pubblicazione: (2024)
LSH-MoE: Communication-efficient MoE Training via Locality-Sensitive Hashing
di: Nie, Xiaonan, et al.
Pubblicazione: (2024)
di: Nie, Xiaonan, et al.
Pubblicazione: (2024)
ReaLB: Real-Time Load Balancing for Multimodal MoE Inference
di: Wang, Yingping, et al.
Pubblicazione: (2026)
di: Wang, Yingping, et al.
Pubblicazione: (2026)
ReviveMoE: Fast Recovery for Hardware Failures in Large-Scale MoE LLM Inference Deployments
di: Li, Haley, et al.
Pubblicazione: (2026)
di: Li, Haley, et al.
Pubblicazione: (2026)
Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving
di: Liu, Ziming, et al.
Pubblicazione: (2025)
di: Liu, Ziming, et al.
Pubblicazione: (2025)
Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection
di: Gupta, Vima, et al.
Pubblicazione: (2024)
di: Gupta, Vima, et al.
Pubblicazione: (2024)
Noiseless Privacy-Preserving Decentralized Learning
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
MoE-Gen: High-Throughput MoE Inference on a Single GPU with Module-Based Batching
di: Xu, Tairan, et al.
Pubblicazione: (2025)
di: Xu, Tairan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HarMoEny: Efficient Multi-GPU Inference of MoE Models
di: Doucet, Zachary, et al.
Pubblicazione: (2025) -
Decentralized Learning Made Easy with DecentralizePy
di: Dhasade, Akash, et al.
Pubblicazione: (2023) -
Get More for Less in Decentralized Learning Systems
di: Dhasade, Akash, et al.
Pubblicazione: (2023) -
PeerSwap: A Peer-Sampler with Randomness Guarantees
di: Guerraoui, Rachid, et al.
Pubblicazione: (2024) -
Harnessing Increased Client Participation with Cohort-Parallel Federated Learning
di: Dhasade, Akash, et al.
Pubblicazione: (2024)