Salvato in:
| Autori principali: | Li, Bo, Wu, Chuan, Zhu, shaolin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.05225 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
di: Liu, Baihui, et al.
Pubblicazione: (2026)
di: Liu, Baihui, et al.
Pubblicazione: (2026)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
di: Wu, Haoze, et al.
Pubblicazione: (2024)
di: Wu, Haoze, et al.
Pubblicazione: (2024)
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
di: Cao, Shiyi, et al.
Pubblicazione: (2024)
di: Cao, Shiyi, et al.
Pubblicazione: (2024)
FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge
di: Hu, Gang, et al.
Pubblicazione: (2025)
di: Hu, Gang, et al.
Pubblicazione: (2025)
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
di: Hannah, Lauren. A, et al.
Pubblicazione: (2025)
di: Hannah, Lauren. A, et al.
Pubblicazione: (2025)
Hierarchical LoRA MoE for Efficient CTR Model Scaling
di: Zeng, Zhichen, et al.
Pubblicazione: (2025)
di: Zeng, Zhichen, et al.
Pubblicazione: (2025)
Flex-MoE: Modeling Arbitrary Modality Combination via the Flexible Mixture-of-Experts
di: Yun, Sukwon, et al.
Pubblicazione: (2024)
di: Yun, Sukwon, et al.
Pubblicazione: (2024)
Collaborative Compression for Large-Scale MoE Deployment on Edge
di: Chen, Yixiao, et al.
Pubblicazione: (2025)
di: Chen, Yixiao, et al.
Pubblicazione: (2025)
Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
PWC-MoE: Privacy-Aware Wireless Collaborative Mixture of Experts
di: Su, Yang, et al.
Pubblicazione: (2025)
di: Su, Yang, et al.
Pubblicazione: (2025)
SERE: Similarity-based Expert Re-routing for Efficient Batch Decoding in MoE Models
di: Wu, Juntong, et al.
Pubblicazione: (2026)
di: Wu, Juntong, et al.
Pubblicazione: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
di: Zibakhsh, Soheil, et al.
Pubblicazione: (2025)
di: Zibakhsh, Soheil, et al.
Pubblicazione: (2025)
MoE$^2$: Optimizing Collaborative Inference for Edge Large Language Models
di: Jin, Lyudong, et al.
Pubblicazione: (2025)
di: Jin, Lyudong, et al.
Pubblicazione: (2025)
Input Domain Aware MoE: Decoupling Routing Decisions from Task Optimization in Mixture of Experts
di: Hua, Yongxiang, et al.
Pubblicazione: (2025)
di: Hua, Yongxiang, et al.
Pubblicazione: (2025)
Expert Divergence Learning for MoE-based Language Models
di: Li, Jiaang, et al.
Pubblicazione: (2026)
di: Li, Jiaang, et al.
Pubblicazione: (2026)
Accelerating MoE Model Inference with Expert Sharding
di: Balmau, Oana, et al.
Pubblicazione: (2025)
di: Balmau, Oana, et al.
Pubblicazione: (2025)
Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts
di: Shi, Xiaoming, et al.
Pubblicazione: (2024)
di: Shi, Xiaoming, et al.
Pubblicazione: (2024)
BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization
di: Zhao, Jiayu, et al.
Pubblicazione: (2026)
di: Zhao, Jiayu, et al.
Pubblicazione: (2026)
MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
di: Huang, Zongle, et al.
Pubblicazione: (2025)
di: Huang, Zongle, et al.
Pubblicazione: (2025)
Semantic Parallelism: Redefining Efficient MoE Inference via Model-Data Co-Scheduling
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
di: Ma, Wenhan, et al.
Pubblicazione: (2025)
di: Ma, Wenhan, et al.
Pubblicazione: (2025)
Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
di: Xu, Zukang, et al.
Pubblicazione: (2026)
di: Xu, Zukang, et al.
Pubblicazione: (2026)
DOT-MoE: Differentiable Optimal Transport for MoEfication
di: Bamba, Udbhav, et al.
Pubblicazione: (2026)
di: Bamba, Udbhav, et al.
Pubblicazione: (2026)
MoE-Health: A Mixture of Experts Framework for Robust Multimodal Healthcare Prediction
di: Wang, Xiaoyang, et al.
Pubblicazione: (2025)
di: Wang, Xiaoyang, et al.
Pubblicazione: (2025)
GRIN: GRadient-INformed MoE
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
di: Liu, Liyuan, et al.
Pubblicazione: (2024)
Is Retraining-Free Enough? The Necessity of Router Calibration for Efficient MoE Compression
di: Hyeon, Sieun, et al.
Pubblicazione: (2026)
di: Hyeon, Sieun, et al.
Pubblicazione: (2026)
STAMImputer: Spatio-Temporal Attention MoE for Traffic Data Imputation
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
Rethinking Gating Mechanism in Sparse MoE: Handling Arbitrary Modality Inputs with Confidence-Guided Gate
di: Zheng, Liangwei Nathan, et al.
Pubblicazione: (2025)
di: Zheng, Liangwei Nathan, et al.
Pubblicazione: (2025)
Practical FP4 Training for Large-Scale MoE Models on Hopper GPUs
di: Zhang, Wuyue, et al.
Pubblicazione: (2026)
di: Zhang, Wuyue, et al.
Pubblicazione: (2026)
Adaptive Normalization Mamba with Multi Scale Trend Decomposition and Patch MoE Encoding
di: Jeon, MinCheol
Pubblicazione: (2025)
di: Jeon, MinCheol
Pubblicazione: (2025)
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
di: Guo, Wentao, et al.
Pubblicazione: (2025)
di: Guo, Wentao, et al.
Pubblicazione: (2025)
MoEless: Efficient MoE LLM Serving via Serverless Computing
di: Yu, Hanfei, et al.
Pubblicazione: (2026)
di: Yu, Hanfei, et al.
Pubblicazione: (2026)
Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE
di: Zeng, Anxiang, et al.
Pubblicazione: (2025)
di: Zeng, Anxiang, et al.
Pubblicazione: (2025)
XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference
di: Vankov, Daniil, et al.
Pubblicazione: (2026)
di: Vankov, Daniil, et al.
Pubblicazione: (2026)
MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design
di: Duanmu, Haojie, et al.
Pubblicazione: (2025)
di: Duanmu, Haojie, et al.
Pubblicazione: (2025)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
di: Chen, Yuanteng, et al.
Pubblicazione: (2025)
di: Chen, Yuanteng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026) -
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
di: Liu, Baihui, et al.
Pubblicazione: (2026) -
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
di: Jin, Peng, et al.
Pubblicazione: (2024) -
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
di: Wu, Haoze, et al.
Pubblicazione: (2024) -
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
di: Cao, Shiyi, et al.
Pubblicazione: (2024)