Fate: Fast Edge Inference of Mixture-of-Experts Models via Cross-Layer Gate
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Zhiyuan, Hong, Zicong, Huang, Yuegui, Lyu, Yufeng, Chen, Wuhui, Yu, Yue, Yu, Fan, Zheng, Zibin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025)
DyMoE: Dynamic Expert Orchestration with Mixed-Precision Quantization for Efficient MoE Inference on Edge
di: Huang, Yuegui, et al.
Pubblicazione: (2026)
di: Huang, Yuegui, et al.
Pubblicazione: (2026)
Krul: Efficient State Restoration for Multi-turn Conversations with Dynamic Cross-layer KV Sharing
di: Wen, Junyi, et al.
Pubblicazione: (2025)
di: Wen, Junyi, et al.
Pubblicazione: (2025)
Training and Serving System of Foundation Models: A Comprehensive Survey
di: Zhou, Jiahang, et al.
Pubblicazione: (2024)
di: Zhou, Jiahang, et al.
Pubblicazione: (2024)
GriDB: Scaling Blockchain Database via Sharding and Off-Chain Cross-Shard Mechanism
di: Hong, Zicong, et al.
Pubblicazione: (2024)
di: Hong, Zicong, et al.
Pubblicazione: (2024)
DiEP: Adaptive Mixture-of-Experts Compression through Differentiable Expert Pruning
di: Bai, Sikai, et al.
Pubblicazione: (2025)
di: Bai, Sikai, et al.
Pubblicazione: (2025)
Mixture-of-Experts for Distributed Edge Computing with Channel-Aware Gating Function
di: Song, Qiuchen, et al.
Pubblicazione: (2025)
di: Song, Qiuchen, et al.
Pubblicazione: (2025)
SlimCaching: Edge Caching of Mixture-of-Experts for Distributed Inference
di: Chen, Qian, et al.
Pubblicazione: (2025)
di: Chen, Qian, et al.
Pubblicazione: (2025)
Exploiting Inter-Layer Expert Affinity for Accelerating Mixture-of-Experts Model Inference
di: Yao, Jinghan, et al.
Pubblicazione: (2024)
di: Yao, Jinghan, et al.
Pubblicazione: (2024)
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
di: Kamahori, Keisuke, et al.
Pubblicazione: (2024)
di: Kamahori, Keisuke, et al.
Pubblicazione: (2024)
Fast Model Selection and Stable Optimization for Softmax-Gated Multinomial-Logistic Mixture of Experts Models
di: Tran, TrungKhang, et al.
Pubblicazione: (2026)
di: Tran, TrungKhang, et al.
Pubblicazione: (2026)
GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models
di: Zheng, Chen, et al.
Pubblicazione: (2025)
di: Zheng, Chen, et al.
Pubblicazione: (2025)
On Bayesian Softmax-Gated Mixture-of-Experts Models
di: Bariletto, Nicola, et al.
Pubblicazione: (2026)
di: Bariletto, Nicola, et al.
Pubblicazione: (2026)
Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-Experts
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
Optimal Expert Selection for Distributed Mixture-of-Experts at the Wireless Edge
di: Qin, Shengling, et al.
Pubblicazione: (2025)
di: Qin, Shengling, et al.
Pubblicazione: (2025)
UniPool: A Globally Shared Expert Pool for Mixture-of-Experts
di: Huang, Minbin, et al.
Pubblicazione: (2026)
di: Huang, Minbin, et al.
Pubblicazione: (2026)
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
di: Yan, Jiaming, et al.
Pubblicazione: (2025)
di: Yan, Jiaming, et al.
Pubblicazione: (2025)
GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs
di: Wu, Lichao, et al.
Pubblicazione: (2025)
di: Wu, Lichao, et al.
Pubblicazione: (2025)
CryptoMoE: Privacy-Preserving and Scalable Mixture of Experts Inference via Balanced Expert Routing
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
Robust Experts: the Effect of Adversarial Training on CNNs with Sparse Mixture-of-Experts Layers
di: Pavlitska, Svetlana, et al.
Pubblicazione: (2025)
di: Pavlitska, Svetlana, et al.
Pubblicazione: (2025)
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
di: Xu, Yu, et al.
Pubblicazione: (2026)
di: Xu, Yu, et al.
Pubblicazione: (2026)
Convergence Rates for Softmax Gating Mixture of Experts
di: Nguyen, Huy, et al.
Pubblicazione: (2025)
di: Nguyen, Huy, et al.
Pubblicazione: (2025)
Gaussian Process-Gated Hierarchical Mixtures of Experts
di: Liu, Yuhao, et al.
Pubblicazione: (2023)
di: Liu, Yuhao, et al.
Pubblicazione: (2023)
PreMoE: Proactive Inference for Efficient Mixture-of-Experts
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
BigMac: A Communication-Efficient Mixture-of-Experts Model Structure for Fast Training and Inference
di: Jin, Zewen, et al.
Pubblicazione: (2025)
di: Jin, Zewen, et al.
Pubblicazione: (2025)
Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling
di: Jiang, Fan, et al.
Pubblicazione: (2026)
di: Jiang, Fan, et al.
Pubblicazione: (2026)
Mixture-of-Experts Diffusion Models for Adaptive Massive MIMO Channel Estimation via Variational Bayesian Inference
di: Jiang, Zhuorui, et al.
Pubblicazione: (2026)
di: Jiang, Zhuorui, et al.
Pubblicazione: (2026)
Speculating Experts Accelerates Inference for Mixture-of-Experts
di: Madan, Vivan, et al.
Pubblicazione: (2026)
di: Madan, Vivan, et al.
Pubblicazione: (2026)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
di: Qian, Chen, et al.
Pubblicazione: (2026)
di: Qian, Chen, et al.
Pubblicazione: (2026)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
MC#: Mixture Compressor for Mixture-of-Experts Large Models
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
On Expert Estimation in Hierarchical Mixture of Experts: Beyond Softmax Gating Functions
di: Nguyen, Huy, et al.
Pubblicazione: (2024)
di: Nguyen, Huy, et al.
Pubblicazione: (2024)
M$^4$oE: A Foundation Model for Medical Multimodal Image Segmentation with Mixture of Experts
di: Jiang, Yufeng, et al.
Pubblicazione: (2024)
di: Jiang, Yufeng, et al.
Pubblicazione: (2024)
Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs
di: Liu, Enshu, et al.
Pubblicazione: (2024)
di: Liu, Enshu, et al.
Pubblicazione: (2024)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
Federated Mixture-of-Expert for Non-Overlapped Cross-Domain Sequential Recommendation
di: Liu, Yu, et al.
Pubblicazione: (2025)
di: Liu, Yu, et al.
Pubblicazione: (2025)
Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
On Least Square Estimation in Softmax Gating Mixture of Experts
di: Nguyen, Huy, et al.
Pubblicazione: (2024)
di: Nguyen, Huy, et al.
Pubblicazione: (2024)
The Osteoblastic Microenvironment Determines the Fate of Breast Cancer Cells Disseminated in the Bone Marrow
di: Hong‐Li Wang, et al.
Pubblicazione: (2026)
di: Hong‐Li Wang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025) -
DyMoE: Dynamic Expert Orchestration with Mixed-Precision Quantization for Efficient MoE Inference on Edge
di: Huang, Yuegui, et al.
Pubblicazione: (2026) -
Krul: Efficient State Restoration for Multi-turn Conversations with Dynamic Cross-layer KV Sharing
di: Wen, Junyi, et al.
Pubblicazione: (2025) -
Training and Serving System of Foundation Models: A Comprehensive Survey
di: Zhou, Jiahang, et al.
Pubblicazione: (2024) -
GriDB: Scaling Blockchain Database via Sharding and Off-Chain Cross-Shard Mechanism
di: Hong, Zicong, et al.
Pubblicazione: (2024)