Faster, Smaller, and Smarter: Task-Aware Expert Merging for Online MoE Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Ziyi, Liu, Xutong, Zhou, Ruiting, Dai, Xiangxiang, Lui, John C. S. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
par: Zhang, Zeyu, et autres
Publié: (2026)
par: Zhang, Zeyu, et autres
Publié: (2026)
A Unified Online-Offline Framework for Co-Branding Campaign Recommendations
par: Dai, Xiangxiang, et autres
Publié: (2025)
par: Dai, Xiangxiang, et autres
Publié: (2025)
HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
par: Han, Ziyi, et autres
Publié: (2025)
par: Han, Ziyi, et autres
Publié: (2025)
Cost-Effective Online Multi-LLM Selection with Versatile Reward Models
par: Dai, Xiangxiang, et autres
Publié: (2024)
par: Dai, Xiangxiang, et autres
Publié: (2024)
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
par: Miao, Ruijie, et autres
Publié: (2025)
par: Miao, Ruijie, et autres
Publié: (2025)
XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference
par: Vankov, Daniil, et autres
Publié: (2026)
par: Vankov, Daniil, et autres
Publié: (2026)
Combinatorial Logistic Bandits
par: Liu, Xutong, et autres
Publié: (2024)
par: Liu, Xutong, et autres
Publié: (2024)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
par: Xue, Leyang, et autres
Publié: (2024)
par: Xue, Leyang, et autres
Publié: (2024)
Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging
par: Li, Lujun, et autres
Publié: (2025)
par: Li, Lujun, et autres
Publié: (2025)
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
par: Liu, Baihui, et autres
Publié: (2026)
par: Liu, Baihui, et autres
Publié: (2026)
Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation
par: Liu, Xutong, et autres
Publié: (2025)
par: Liu, Xutong, et autres
Publié: (2025)
Input Domain Aware MoE: Decoupling Routing Decisions from Task Optimization in Mixture of Experts
par: Hua, Yongxiang, et autres
Publié: (2025)
par: Hua, Yongxiang, et autres
Publié: (2025)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
par: Ma, Songkai, et autres
Publié: (2025)
par: Ma, Songkai, et autres
Publié: (2025)
Demystifying Online Clustering of Bandits: Enhanced Exploration Under Stochastic and Smoothed Adversarial Contexts
par: Li, Zhuohua, et autres
Publié: (2025)
par: Li, Zhuohua, et autres
Publié: (2025)
Fast MoE Inference via Predictive Prefetching and Expert Replication
par: Jyothish, Ankit, et autres
Publié: (2026)
par: Jyothish, Ankit, et autres
Publié: (2026)
eMoE: Task-aware Memory Efficient Mixture-of-Experts-Based (MoE) Model Inference
par: Tairin, Suraiya, et autres
Publié: (2025)
par: Tairin, Suraiya, et autres
Publié: (2025)
Accelerating MoE Model Inference with Expert Sharding
par: Balmau, Oana, et autres
Publié: (2025)
par: Balmau, Oana, et autres
Publié: (2025)
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
par: Zhong, Shuzhang, et autres
Publié: (2024)
par: Zhong, Shuzhang, et autres
Publié: (2024)
Offline Learning for Combinatorial Multi-armed Bandits
par: Liu, Xutong, et autres
Publié: (2025)
par: Liu, Xutong, et autres
Publié: (2025)
Online Multi-LLM Selection via Contextual Bandits under Unstructured Context Evolution
par: Poon, Manhin, et autres
Publié: (2025)
par: Poon, Manhin, et autres
Publié: (2025)
CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution
par: Son, Muyoung, et autres
Publié: (2026)
par: Son, Muyoung, et autres
Publié: (2026)
FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving
par: Liu, Qingxiu, et autres
Publié: (2026)
par: Liu, Qingxiu, et autres
Publié: (2026)
Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection
par: Gupta, Vima, et autres
Publié: (2024)
par: Gupta, Vima, et autres
Publié: (2024)
Horseshoe Mixtures-of-Experts (HS-MoE)
par: Polson, Nick, et autres
Publié: (2026)
par: Polson, Nick, et autres
Publié: (2026)
Ban&Pick: Ehancing Performance and Efficiency of MoE-LLMs via Smarter Routing
par: Chen, Yuanteng, et autres
Publié: (2025)
par: Chen, Yuanteng, et autres
Publié: (2025)
DyMoE: Dynamic Expert Orchestration with Mixed-Precision Quantization for Efficient MoE Inference on Edge
par: Huang, Yuegui, et autres
Publié: (2026)
par: Huang, Yuegui, et autres
Publié: (2026)
PWC-MoE: Privacy-Aware Wireless Collaborative Mixture of Experts
par: Su, Yang, et autres
Publié: (2025)
par: Su, Yang, et autres
Publié: (2025)
Retraining-Free Merging of Sparse MoE via Hierarchical Clustering
par: Chen, I-Chun, et autres
Publié: (2024)
par: Chen, I-Chun, et autres
Publié: (2024)
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
MoNE: Replacing Redundant Experts with Lightweight Novices for Structured Pruning of MoE
par: Zhang, Geng, et autres
Publié: (2025)
par: Zhang, Geng, et autres
Publié: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
Harder Tasks Need More Experts: Dynamic Routing in MoE Models
par: Huang, Quzhe, et autres
Publié: (2024)
par: Huang, Quzhe, et autres
Publié: (2024)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
par: Chen, Yuanteng, et autres
Publié: (2025)
par: Chen, Yuanteng, et autres
Publié: (2025)
MoE Lens -- An Expert Is All You Need
par: Chaudhari, Marmik, et autres
Publié: (2026)
par: Chaudhari, Marmik, et autres
Publié: (2026)
MoE Pathfinder: Trajectory-driven Expert Pruning
par: Yang, Xican, et autres
Publié: (2025)
par: Yang, Xican, et autres
Publié: (2025)
MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
par: Chen, Xiaodong, et autres
Publié: (2025)
par: Chen, Xiaodong, et autres
Publié: (2025)
$\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts
par: Takashiro, Shota, et autres
Publié: (2026)
par: Takashiro, Shota, et autres
Publié: (2026)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
par: Ma, Haiyue, et autres
Publié: (2025)
par: Ma, Haiyue, et autres
Publié: (2025)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
par: Xia, Xinfeng, et autres
Publié: (2025)
par: Xia, Xinfeng, et autres
Publié: (2025)
Documents similaires
-
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
par: Zhang, Zeyu, et autres
Publié: (2026) -
A Unified Online-Offline Framework for Co-Branding Campaign Recommendations
par: Dai, Xiangxiang, et autres
Publié: (2025) -
HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
par: Han, Ziyi, et autres
Publié: (2025) -
Cost-Effective Online Multi-LLM Selection with Versatile Reward Models
par: Dai, Xiangxiang, et autres
Publié: (2024) -
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
par: Miao, Ruijie, et autres
Publié: (2025)