RaMP: Runtime-Aware Megakernel Polymorphism for Mixture-of-Experts
Fuente:
arXiv
Guardado en:
| Autores principales: | Sharma, Vyom, Datta, Debajyoti |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Optimal Transport Aggregation for Distributed Mixture-of-Experts
por: Chamroukhi, Faïcel, et al.
Publicado: (2023)
por: Chamroukhi, Faïcel, et al.
Publicado: (2023)
Utility-Driven Speculative Decoding for Mixture-of-Experts
por: Saxena, Anish, et al.
Publicado: (2025)
por: Saxena, Anish, et al.
Publicado: (2025)
Exploiting Inter-Layer Expert Affinity for Accelerating Mixture-of-Experts Model Inference
por: Yao, Jinghan, et al.
Publicado: (2024)
por: Yao, Jinghan, et al.
Publicado: (2024)
A Survey on Inference Optimization Techniques for Mixture of Experts Models
por: Liu, Jiacheng, et al.
Publicado: (2024)
por: Liu, Jiacheng, et al.
Publicado: (2024)
Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts
por: Zhang, Shulai, et al.
Publicado: (2025)
por: Zhang, Shulai, et al.
Publicado: (2025)
Mixture of Experts with Mixture of Precisions for Tuning Quality of Service
por: Imani, HamidReza, et al.
Publicado: (2024)
por: Imani, HamidReza, et al.
Publicado: (2024)
From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing
por: Shahout, Rana, et al.
Publicado: (2025)
por: Shahout, Rana, et al.
Publicado: (2025)
Scalable Pretraining of Large Mixture of Experts Language Models on Aurora Super Computer
por: Vooturi, Dharma Teja, et al.
Publicado: (2026)
por: Vooturi, Dharma Teja, et al.
Publicado: (2026)
Mosaic: Data-Free Knowledge Distillation via Mixture-of-Experts for Heterogeneous Distributed Environments
por: Liu, Junming, et al.
Publicado: (2025)
por: Liu, Junming, et al.
Publicado: (2025)
QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration
por: Imani, HamidReza, et al.
Publicado: (2025)
por: Imani, HamidReza, et al.
Publicado: (2025)
BlackMamba: Mixture of Experts for State-Space Models
por: Anthony, Quentin, et al.
Publicado: (2024)
por: Anthony, Quentin, et al.
Publicado: (2024)
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
por: Hankendi, Can, et al.
Publicado: (2026)
por: Hankendi, Can, et al.
Publicado: (2026)
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
por: Sun, Weigao, et al.
Publicado: (2025)
por: Sun, Weigao, et al.
Publicado: (2025)
Adaptive Approach to Enhance Machine Learning Scheduling Algorithms During Runtime Using Reinforcement Learning in Metascheduling Applications
por: Alshaer, Samer, et al.
Publicado: (2025)
por: Alshaer, Samer, et al.
Publicado: (2025)
FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models
por: Jiang, Juyong, et al.
Publicado: (2026)
por: Jiang, Juyong, et al.
Publicado: (2026)
OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models
por: Xue, Fuzhao, et al.
Publicado: (2024)
por: Xue, Fuzhao, et al.
Publicado: (2024)
TrainMover: An Interruption-Resilient Runtime for ML Training
por: Lao, ChonLam, et al.
Publicado: (2024)
por: Lao, ChonLam, et al.
Publicado: (2024)
A Comparative Study of OpenMP Scheduling Algorithm Selection Strategies
por: Korndörfer, Jonas H. Müller, et al.
Publicado: (2025)
por: Korndörfer, Jonas H. Müller, et al.
Publicado: (2025)
CRAFT: Fine-Grained Cost-Aware Expert Replication For Efficient Mixture-of-Experts Serving
por: Zhao, Adrian, et al.
Publicado: (2026)
por: Zhao, Adrian, et al.
Publicado: (2026)
HybridEP: Scaling Expert Parallelism to Cross-Datacenter Scenario via Hybrid Expert/Data Transmission
por: Yang, Weihao, et al.
Publicado: (2025)
por: Yang, Weihao, et al.
Publicado: (2025)
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
por: Kamahori, Keisuke, et al.
Publicado: (2024)
por: Kamahori, Keisuke, et al.
Publicado: (2024)
WDMoE: Wireless Distributed Mixture of Experts for Large Language Models
por: Xue, Nan, et al.
Publicado: (2024)
por: Xue, Nan, et al.
Publicado: (2024)
Accelerating MoE Model Inference with Expert Sharding
por: Balmau, Oana, et al.
Publicado: (2025)
por: Balmau, Oana, et al.
Publicado: (2025)
Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel
por: Jin, Hongyi, et al.
Publicado: (2026)
por: Jin, Hongyi, et al.
Publicado: (2026)
MoSKA: Mixture of Shared KV Attention for Efficient Long-Sequence LLM Inference
por: Rhee, Myunghyun, et al.
Publicado: (2025)
por: Rhee, Myunghyun, et al.
Publicado: (2025)
Scattered Mixture-of-Experts Implementation
por: Tan, Shawn, et al.
Publicado: (2024)
por: Tan, Shawn, et al.
Publicado: (2024)
Uncertainty-Aware Explainable Federated Learning
por: Zhang, Yanci, et al.
Publicado: (2025)
por: Zhang, Yanci, et al.
Publicado: (2025)
Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading
por: Yu, Hanfei, et al.
Publicado: (2025)
por: Yu, Hanfei, et al.
Publicado: (2025)
CurvFed: Curvature-Aligned Federated Learning for Fairness without Demographics
por: Sharma, Harshit, et al.
Publicado: (2024)
por: Sharma, Harshit, et al.
Publicado: (2024)
Topology-Aware Knowledge Propagation in Decentralized Learning
por: Sakarvadia, Mansi, et al.
Publicado: (2025)
por: Sakarvadia, Mansi, et al.
Publicado: (2025)
CA-AFP: Cluster-Aware Adaptive Federated Pruning
por: Jha, Om Govind, et al.
Publicado: (2026)
por: Jha, Om Govind, et al.
Publicado: (2026)
FedMoE-DA: Federated Mixture of Experts via Domain Aware Fine-grained Aggregation
por: Zhan, Ziwei, et al.
Publicado: (2024)
por: Zhan, Ziwei, et al.
Publicado: (2024)
Fairness-Aware Job Scheduling for Multi-Job Federated Learning
por: Shi, Yuxin, et al.
Publicado: (2024)
por: Shi, Yuxin, et al.
Publicado: (2024)
FedDAG: Clustered Federated Learning via Global Data and Gradient Integration for Heterogeneous Environments
por: Pramanik, Anik, et al.
Publicado: (2026)
por: Pramanik, Anik, et al.
Publicado: (2026)
TRAIL: Trust-Aware Client Scheduling for Semi-Decentralized Federated Learning
por: Hu, Gangqiang, et al.
Publicado: (2024)
por: Hu, Gangqiang, et al.
Publicado: (2024)
SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
por: Shen, Yuanzhe, et al.
Publicado: (2025)
por: Shen, Yuanzhe, et al.
Publicado: (2025)
Context-Aware Inference via Performance Forecasting in Decentralized Learning Networks
por: Pfeffer, Joel, et al.
Publicado: (2025)
por: Pfeffer, Joel, et al.
Publicado: (2025)
MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism
por: Zhu, Ruidong, et al.
Publicado: (2025)
por: Zhu, Ruidong, et al.
Publicado: (2025)
Heterogeneity-Aware Resource Allocation and Topology Design for Hierarchical Federated Edge Learning
por: Gao, Zhidong, et al.
Publicado: (2024)
por: Gao, Zhidong, et al.
Publicado: (2024)
SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips
por: Yu, Jiahuan, et al.
Publicado: (2026)
por: Yu, Jiahuan, et al.
Publicado: (2026)
Ejemplares similares
-
Optimal Transport Aggregation for Distributed Mixture-of-Experts
por: Chamroukhi, Faïcel, et al.
Publicado: (2023) -
Utility-Driven Speculative Decoding for Mixture-of-Experts
por: Saxena, Anish, et al.
Publicado: (2025) -
Exploiting Inter-Layer Expert Affinity for Accelerating Mixture-of-Experts Model Inference
por: Yao, Jinghan, et al.
Publicado: (2024) -
A Survey on Inference Optimization Techniques for Mixture of Experts Models
por: Liu, Jiacheng, et al.
Publicado: (2024) -
Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts
por: Zhang, Shulai, et al.
Publicado: (2025)