CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Son, Muyoung, Chen, Yi, Yoo, Seungjae, Choi, Soongyu, Kim, Joo-Young |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
par: Pan, Yudong, et autres
Publié: (2026)
par: Pan, Yudong, et autres
Publié: (2026)
MoE-Gen: High-Throughput MoE Inference on a Single GPU with Module-Based Batching
par: Xu, Tairan, et autres
Publié: (2025)
par: Xu, Tairan, et autres
Publié: (2025)
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
par: Cao, Shiyi, et autres
Publié: (2024)
par: Cao, Shiyi, et autres
Publié: (2024)
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2025)
par: Zhong, Shuzhang, et autres
Publié: (2025)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)
par: Huang, En-Ming, et autres
Publié: (2025)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
par: Qian, Yulei, et autres
Publié: (2024)
par: Qian, Yulei, et autres
Publié: (2024)
SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
par: Choi, Yuseon, et autres
Publié: (2025)
par: Choi, Yuseon, et autres
Publié: (2025)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
par: Wang, Liujianfu, et autres
Publié: (2025)
par: Wang, Liujianfu, et autres
Publié: (2025)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
par: Xia, Xinfeng, et autres
Publié: (2025)
par: Xia, Xinfeng, et autres
Publié: (2025)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
par: Ma, Songkai, et autres
Publié: (2025)
par: Ma, Songkai, et autres
Publié: (2025)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
par: Xue, Leyang, et autres
Publié: (2024)
par: Xue, Leyang, et autres
Publié: (2024)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
Accelerating MoE Model Inference with Expert Sharding
par: Balmau, Oana, et autres
Publié: (2025)
par: Balmau, Oana, et autres
Publié: (2025)
HarMoEny: Efficient Multi-GPU Inference of MoE Models
par: Doucet, Zachary, et autres
Publié: (2025)
par: Doucet, Zachary, et autres
Publié: (2025)
GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems
par: Wawdhane, Sourish, et autres
Publié: (2026)
par: Wawdhane, Sourish, et autres
Publié: (2026)
FloE: On-the-Fly MoE Inference on Memory-constrained GPU
par: Zhou, Yuxin, et autres
Publié: (2025)
par: Zhou, Yuxin, et autres
Publié: (2025)
CoMoE: Collaborative Optimization of Expert Aggregation and Offloading for MoE-based LLMs at Edge
par: Li, Muqing, et autres
Publié: (2025)
par: Li, Muqing, et autres
Publié: (2025)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
par: Zhang, Zhexiang, et autres
Publié: (2025)
par: Zhang, Zhexiang, et autres
Publié: (2025)
SP-MoE: Speculative Decoding and Prefetching for Accelerating MoE-based Model Inference
par: Chen, Liangkun, et autres
Publié: (2025)
par: Chen, Liangkun, et autres
Publié: (2025)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
par: Ma, Haiyue, et autres
Publié: (2025)
par: Ma, Haiyue, et autres
Publié: (2025)
MoE-Lens: Towards the Hardware Limit of High-Throughput MoE LLM Serving Under Resource Constraints
par: Yuan, Yichao, et autres
Publié: (2025)
par: Yuan, Yichao, et autres
Publié: (2025)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
par: Hwang, Ranggi, et autres
Publié: (2023)
par: Hwang, Ranggi, et autres
Publié: (2023)
Advancing Expert Specialization for Better MoE
par: Guo, Hongcan, et autres
Publié: (2025)
par: Guo, Hongcan, et autres
Publié: (2025)
Horseshoe Mixtures-of-Experts (HS-MoE)
par: Polson, Nick, et autres
Publié: (2026)
par: Polson, Nick, et autres
Publié: (2026)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
par: Han, Yu, et autres
Publié: (2025)
par: Han, Yu, et autres
Publié: (2025)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
par: Li, Zichong, et autres
Publié: (2025)
par: Li, Zichong, et autres
Publié: (2025)
MoE-DisCo:Low Economy Cost Training Mixture-of-Experts Models
par: Ye, Xin, et autres
Publié: (2026)
par: Ye, Xin, et autres
Publié: (2026)
Fast MoE Inference via Predictive Prefetching and Expert Replication
par: Jyothish, Ankit, et autres
Publié: (2026)
par: Jyothish, Ankit, et autres
Publié: (2026)
XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference
par: Vankov, Daniil, et autres
Publié: (2026)
par: Vankov, Daniil, et autres
Publié: (2026)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving
par: Su, Zhaoyuan, et autres
Publié: (2026)
par: Su, Zhaoyuan, et autres
Publié: (2026)
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
par: Hannah, Lauren. A, et autres
Publié: (2025)
par: Hannah, Lauren. A, et autres
Publié: (2025)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
par: Zhou, Zhuoshan, et autres
Publié: (2026)
par: Zhou, Zhuoshan, et autres
Publié: (2026)
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2024)
par: Zhong, Shuzhang, et autres
Publié: (2024)
MoE-GS: Mixture of Experts for Dynamic Gaussian Splatting
par: Jin, In-Hwan, et autres
Publié: (2025)
par: Jin, In-Hwan, et autres
Publié: (2025)
Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection
par: Gupta, Vima, et autres
Publié: (2024)
par: Gupta, Vima, et autres
Publié: (2024)
ECG-MoE: Mixture-of-Expert Electrocardiogram Foundation Model
par: Xu, Yuhao, et autres
Publié: (2026)
par: Xu, Yuhao, et autres
Publié: (2026)
MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
par: Chen, Xiaodong, et autres
Publié: (2025)
par: Chen, Xiaodong, et autres
Publié: (2025)
OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale
par: Shi, Jingze, et autres
Publié: (2026)
par: Shi, Jingze, et autres
Publié: (2026)
$\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts
par: Takashiro, Shota, et autres
Publié: (2026)
par: Takashiro, Shota, et autres
Publié: (2026)
Documents similaires
-
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
par: Pan, Yudong, et autres
Publié: (2026) -
MoE-Gen: High-Throughput MoE Inference on a Single GPU with Module-Based Batching
par: Xu, Tairan, et autres
Publié: (2025) -
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
par: Cao, Shiyi, et autres
Publié: (2024) -
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2025) -
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)