DOT-MoE: Differentiable Optimal Transport for MoEfication
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bamba, Udbhav, Chavan, Arnav, Thakur, Aryamaan, Teig, Steve, Gupta, Deepak |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations
par: Chavan, Arnav, et autres
Publié: (2026)
par: Chavan, Arnav, et autres
Publié: (2026)
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
par: Hannah, Lauren. A, et autres
Publié: (2025)
par: Hannah, Lauren. A, et autres
Publié: (2025)
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
par: Wu, Haoze, et autres
Publié: (2024)
par: Wu, Haoze, et autres
Publié: (2024)
Beyond Uniform Scaling: Exploring Depth Heterogeneity in Neural Architectures
par: T, Akash Guna R., et autres
Publié: (2024)
par: T, Akash Guna R., et autres
Publié: (2024)
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
par: Guo, Wentao, et autres
Publié: (2025)
par: Guo, Wentao, et autres
Publié: (2025)
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
par: Xu, Zukang, et autres
Publié: (2026)
par: Xu, Zukang, et autres
Publié: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
par: Zibakhsh, Soheil, et autres
Publié: (2025)
par: Zibakhsh, Soheil, et autres
Publié: (2025)
MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
par: Huang, Zongle, et autres
Publié: (2025)
par: Huang, Zongle, et autres
Publié: (2025)
MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design
par: Duanmu, Haojie, et autres
Publié: (2025)
par: Duanmu, Haojie, et autres
Publié: (2025)
Faster and Lighter LLMs: A Survey on Current Challenges and Way Forward
par: Chavan, Arnav, et autres
Publié: (2024)
par: Chavan, Arnav, et autres
Publié: (2024)
GRIN: GRadient-INformed MoE
par: Liu, Liyuan, et autres
Publié: (2024)
par: Liu, Liyuan, et autres
Publié: (2024)
MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs
par: Cao, Shiyi, et autres
Publié: (2024)
par: Cao, Shiyi, et autres
Publié: (2024)
Exploiting the Experts: Unauthorized Compression in MoE-LLMs
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
par: Neogi, Pinaki Prasad Guha, et autres
Publié: (2025)
(GG) MoE vs. MLP on Tabular Data
par: Chernov, Andrei
Publié: (2025)
par: Chernov, Andrei
Publié: (2025)
MoEITS: A Green AI approach for simplifying MoE-LLMs
par: Balderas, Luis, et autres
Publié: (2026)
par: Balderas, Luis, et autres
Publié: (2026)
FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge
par: Hu, Gang, et autres
Publié: (2025)
par: Hu, Gang, et autres
Publié: (2025)
BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization
par: Zhao, Jiayu, et autres
Publié: (2026)
par: Zhao, Jiayu, et autres
Publié: (2026)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
par: Li, Shuhuai, et autres
Publié: (2026)
par: Li, Shuhuai, et autres
Publié: (2026)
SD-MoE: Spectral Decomposition for Effective Expert Specialization
par: Huang, Ruijun, et autres
Publié: (2026)
par: Huang, Ruijun, et autres
Publié: (2026)
SDG-MoE: Signed Debate Graph Mixture-of-Experts
par: Kulibaba, Stepan, et autres
Publié: (2026)
par: Kulibaba, Stepan, et autres
Publié: (2026)
Expert Divergence Learning for MoE-based Language Models
par: Li, Jiaang, et autres
Publié: (2026)
par: Li, Jiaang, et autres
Publié: (2026)
Mixture of Experts (MoE): A Big Data Perspective
par: Gan, Wensheng, et autres
Publié: (2025)
par: Gan, Wensheng, et autres
Publié: (2025)
Collaborative Compression for Large-Scale MoE Deployment on Edge
par: Chen, Yixiao, et autres
Publié: (2025)
par: Chen, Yixiao, et autres
Publié: (2025)
Optimal Scaling Laws for Efficiency Gains in a Theoretical Transformer-Augmented Sectional MoE Framework
par: Sane, Soham
Publié: (2025)
par: Sane, Soham
Publié: (2025)
TT-LoRA MoE: Unifying Parameter-Efficient Fine-Tuning and Sparse Mixture-of-Experts
par: Kunwar, Pradip, et autres
Publié: (2025)
par: Kunwar, Pradip, et autres
Publié: (2025)
LocMoE: A Low-Overhead MoE for Large Language Model Training
par: Li, Jing, et autres
Publié: (2024)
par: Li, Jing, et autres
Publié: (2024)
Improving MoE Compute Efficiency by Composing Weight and Data Sparsity
par: Kilian, Maciej, et autres
Publié: (2026)
par: Kilian, Maciej, et autres
Publié: (2026)
Grouter: Decoupling Routing from Representation for Accelerated MoE Training
par: Xu, Yuqi, et autres
Publié: (2026)
par: Xu, Yuqi, et autres
Publié: (2026)
Awakening Dormant Experts:Counterfactual Routing to Mitigate MoE Hallucinations
par: Hu, Wentao, et autres
Publié: (2026)
par: Hu, Wentao, et autres
Publié: (2026)
PWC-MoE: Privacy-Aware Wireless Collaborative Mixture of Experts
par: Su, Yang, et autres
Publié: (2025)
par: Su, Yang, et autres
Publié: (2025)
Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling
par: Liao, Ning, et autres
Publié: (2025)
par: Liao, Ning, et autres
Publié: (2025)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
STAMImputer: Spatio-Temporal Attention MoE for Traffic Data Imputation
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
The Empirical Impact of Reducing Symmetries on the Performance of Deep Ensembles and MoE
par: Chernov, Andrei, et autres
Publié: (2025)
par: Chernov, Andrei, et autres
Publié: (2025)
Revisiting MoE and Dense Speed-Accuracy Comparisons for LLM Training
par: Du, Xianzhi, et autres
Publié: (2024)
par: Du, Xianzhi, et autres
Publié: (2024)
Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis
par: Pei, Zehua, et autres
Publié: (2025)
par: Pei, Zehua, et autres
Publié: (2025)
Towards an empirical understanding of MoE design choices
par: Fan, Dongyang, et autres
Publié: (2024)
par: Fan, Dongyang, et autres
Publié: (2024)
Spectral Manifold Regularization for Stable and Modular Routing in Deep MoE Architectures
par: Delibasoglu, Ibrahim
Publié: (2026)
par: Delibasoglu, Ibrahim
Publié: (2026)
MP-MoE: Matrix Profile-Guided Mixture of Experts for Precipitation Forecasting
par: Tran, Huyen Ngoc, et autres
Publié: (2026)
par: Tran, Huyen Ngoc, et autres
Publié: (2026)
MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Documents similaires
-
S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations
par: Chavan, Arnav, et autres
Publié: (2026) -
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
par: Hannah, Lauren. A, et autres
Publié: (2025) -
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
par: Wu, Haoze, et autres
Publié: (2024) -
Beyond Uniform Scaling: Exploring Depth Heterogeneity in Neural Architectures
par: T, Akash Guna R., et autres
Publié: (2024) -
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
par: Guo, Wentao, et autres
Publié: (2025)