Faster, Smaller, and Smarter: Task-Aware Expert Merging for Online MoE Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Ziyi, Liu, Xutong, Zhou, Ruiting, Dai, Xiangxiang, Lui, John C. S. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
di: Zhang, Zeyu, et al.
Pubblicazione: (2026)
di: Zhang, Zeyu, et al.
Pubblicazione: (2026)
A Unified Online-Offline Framework for Co-Branding Campaign Recommendations
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025)
HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
di: Han, Ziyi, et al.
Pubblicazione: (2025)
di: Han, Ziyi, et al.
Pubblicazione: (2025)
Cost-Effective Online Multi-LLM Selection with Versatile Reward Models
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
di: Miao, Ruijie, et al.
Pubblicazione: (2025)
di: Miao, Ruijie, et al.
Pubblicazione: (2025)
XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference
di: Vankov, Daniil, et al.
Pubblicazione: (2026)
di: Vankov, Daniil, et al.
Pubblicazione: (2026)
Combinatorial Logistic Bandits
di: Liu, Xutong, et al.
Pubblicazione: (2024)
di: Liu, Xutong, et al.
Pubblicazione: (2024)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
di: Xue, Leyang, et al.
Pubblicazione: (2024)
di: Xue, Leyang, et al.
Pubblicazione: (2024)
Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging
di: Li, Lujun, et al.
Pubblicazione: (2025)
di: Li, Lujun, et al.
Pubblicazione: (2025)
Faster MoE LLM Inference for Extremely Large Models
di: Yang, Haoqi, et al.
Pubblicazione: (2025)
di: Yang, Haoqi, et al.
Pubblicazione: (2025)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
di: Liu, Baihui, et al.
Pubblicazione: (2026)
di: Liu, Baihui, et al.
Pubblicazione: (2026)
Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation
di: Liu, Xutong, et al.
Pubblicazione: (2025)
di: Liu, Xutong, et al.
Pubblicazione: (2025)
Input Domain Aware MoE: Decoupling Routing Decisions from Task Optimization in Mixture of Experts
di: Hua, Yongxiang, et al.
Pubblicazione: (2025)
di: Hua, Yongxiang, et al.
Pubblicazione: (2025)
MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?
di: Ma, Songkai, et al.
Pubblicazione: (2025)
di: Ma, Songkai, et al.
Pubblicazione: (2025)
Demystifying Online Clustering of Bandits: Enhanced Exploration Under Stochastic and Smoothed Adversarial Contexts
di: Li, Zhuohua, et al.
Pubblicazione: (2025)
di: Li, Zhuohua, et al.
Pubblicazione: (2025)
Fast MoE Inference via Predictive Prefetching and Expert Replication
di: Jyothish, Ankit, et al.
Pubblicazione: (2026)
di: Jyothish, Ankit, et al.
Pubblicazione: (2026)
eMoE: Task-aware Memory Efficient Mixture-of-Experts-Based (MoE) Model Inference
di: Tairin, Suraiya, et al.
Pubblicazione: (2025)
di: Tairin, Suraiya, et al.
Pubblicazione: (2025)
Accelerating MoE Model Inference with Expert Sharding
di: Balmau, Oana, et al.
Pubblicazione: (2025)
di: Balmau, Oana, et al.
Pubblicazione: (2025)
Offline Learning for Combinatorial Multi-armed Bandits
di: Liu, Xutong, et al.
Pubblicazione: (2025)
di: Liu, Xutong, et al.
Pubblicazione: (2025)
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
di: Zhong, Shuzhang, et al.
Pubblicazione: (2024)
di: Zhong, Shuzhang, et al.
Pubblicazione: (2024)
Online Multi-LLM Selection via Contextual Bandits under Unstructured Context Evolution
di: Poon, Manhin, et al.
Pubblicazione: (2025)
di: Poon, Manhin, et al.
Pubblicazione: (2025)
CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution
di: Son, Muyoung, et al.
Pubblicazione: (2026)
di: Son, Muyoung, et al.
Pubblicazione: (2026)
FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving
di: Liu, Qingxiu, et al.
Pubblicazione: (2026)
di: Liu, Qingxiu, et al.
Pubblicazione: (2026)
Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection
di: Gupta, Vima, et al.
Pubblicazione: (2024)
di: Gupta, Vima, et al.
Pubblicazione: (2024)
Horseshoe Mixtures-of-Experts (HS-MoE)
di: Polson, Nick, et al.
Pubblicazione: (2026)
di: Polson, Nick, et al.
Pubblicazione: (2026)
Ban&Pick: Ehancing Performance and Efficiency of MoE-LLMs via Smarter Routing
di: Chen, Yuanteng, et al.
Pubblicazione: (2025)
di: Chen, Yuanteng, et al.
Pubblicazione: (2025)
DyMoE: Dynamic Expert Orchestration with Mixed-Precision Quantization for Efficient MoE Inference on Edge
di: Huang, Yuegui, et al.
Pubblicazione: (2026)
di: Huang, Yuegui, et al.
Pubblicazione: (2026)
PWC-MoE: Privacy-Aware Wireless Collaborative Mixture of Experts
di: Su, Yang, et al.
Pubblicazione: (2025)
di: Su, Yang, et al.
Pubblicazione: (2025)
Retraining-Free Merging of Sparse MoE via Hierarchical Clustering
di: Chen, I-Chun, et al.
Pubblicazione: (2024)
di: Chen, I-Chun, et al.
Pubblicazione: (2024)
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
MoNE: Replacing Redundant Experts with Lightweight Novices for Structured Pruning of MoE
di: Zhang, Geng, et al.
Pubblicazione: (2025)
di: Zhang, Geng, et al.
Pubblicazione: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
Harder Tasks Need More Experts: Dynamic Routing in MoE Models
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
di: Chen, Yuanteng, et al.
Pubblicazione: (2025)
di: Chen, Yuanteng, et al.
Pubblicazione: (2025)
MoE Lens -- An Expert Is All You Need
di: Chaudhari, Marmik, et al.
Pubblicazione: (2026)
di: Chaudhari, Marmik, et al.
Pubblicazione: (2026)
MoE Pathfinder: Trajectory-driven Expert Pruning
di: Yang, Xican, et al.
Pubblicazione: (2025)
di: Yang, Xican, et al.
Pubblicazione: (2025)
MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
di: Chen, Xiaodong, et al.
Pubblicazione: (2025)
di: Chen, Xiaodong, et al.
Pubblicazione: (2025)
$\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts
di: Takashiro, Shota, et al.
Pubblicazione: (2026)
di: Takashiro, Shota, et al.
Pubblicazione: (2026)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
di: Ma, Haiyue, et al.
Pubblicazione: (2025)
di: Ma, Haiyue, et al.
Pubblicazione: (2025)
MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
di: Xia, Xinfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
di: Zhang, Zeyu, et al.
Pubblicazione: (2026) -
A Unified Online-Offline Framework for Co-Branding Campaign Recommendations
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025) -
HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
di: Han, Ziyi, et al.
Pubblicazione: (2025) -
Cost-Effective Online Multi-LLM Selection with Versatile Reward Models
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024) -
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
di: Miao, Ruijie, et al.
Pubblicazione: (2025)