MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Su, Zhenpeng, Lin, Zijia, Bai, Xue, Wu, Xing, Xiong, Yizhe, Lian, Haoran, Ma, Guangyuan, Chen, Hui, Ding, Guiguang, Zhou, Wei, Hu, Songlin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
Dial-MAE: ConTextual Masked Auto-Encoder for Retrieval-based Dialogue Systems
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
von: Lv, Minxuan, et al.
Veröffentlicht: (2025)
von: Lv, Minxuan, et al.
Veröffentlicht: (2025)
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
LBPE: Long-token-first Tokenization to Improve Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
Temporal Scaling Law for Large Language Models
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
Fast Quiet-STaR: Thinking Without Thought Tokens
von: Huang, Wei, et al.
Veröffentlicht: (2025)
von: Huang, Wei, et al.
Veröffentlicht: (2025)
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
von: Pan, Leiyu, et al.
Veröffentlicht: (2025)
von: Pan, Leiyu, et al.
Veröffentlicht: (2025)
HC3 Plus: A Semantic-Invariant Human ChatGPT Comparison Corpus
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
Drop your Decoder: Pre-training with Bag-of-Word Prediction for Dense Passage Retrieval
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
Task-level Distributionally Robust Optimization for Large Language Model-based Dense Retrieval
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
BEAM: Binary Expert Activation Masking for Dynamic Routing in MoE
von: Wu, Juntong, et al.
Veröffentlicht: (2026)
von: Wu, Juntong, et al.
Veröffentlicht: (2026)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
MoETuner: Optimized Mixture of Expert Serving with Balanced Expert Placement and Token Routing
von: Go, Seokjin, et al.
Veröffentlicht: (2025)
von: Go, Seokjin, et al.
Veröffentlicht: (2025)
SegMoTE: Token-Level Mixture of Experts for Medical Image Segmentation
von: Lu, Yujie, et al.
Veröffentlicht: (2026)
von: Lu, Yujie, et al.
Veröffentlicht: (2026)
AdaMoE: Token-Adaptive Routing with Null Experts for Mixture-of-Experts Language Models
von: Zeng, Zihao, et al.
Veröffentlicht: (2024)
von: Zeng, Zihao, et al.
Veröffentlicht: (2024)
LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference
von: Ma, Guangyuan, et al.
Veröffentlicht: (2025)
von: Ma, Guangyuan, et al.
Veröffentlicht: (2025)
PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task Adaptation
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
Improving Routing in Sparse Mixture of Experts with Graph of Tokens
von: Nguyen, Tam, et al.
Veröffentlicht: (2025)
von: Nguyen, Tam, et al.
Veröffentlicht: (2025)
RepViT-SAM: Towards Real-Time Segmenting Anything
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
LSNet: See Large, Focus Small
von: Wang, Ao, et al.
Veröffentlicht: (2025)
von: Wang, Ao, et al.
Veröffentlicht: (2025)
RepViT: Revisiting Mobile CNN From ViT Perspective
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
MambaFormer: Token-Level Guided Routing Mixture-of-Experts for Accurate and Efficient Clinical Assistance
von: Khan, Hamad, et al.
Veröffentlicht: (2026)
von: Khan, Hamad, et al.
Veröffentlicht: (2026)
LD-MoLE: Learnable Dynamic Routing for Mixture of LoRA Experts
von: Zhuang, Yuan, et al.
Veröffentlicht: (2025)
von: Zhuang, Yuan, et al.
Veröffentlicht: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
von: Liang, Yiwen, et al.
Veröffentlicht: (2025)
von: Liang, Yiwen, et al.
Veröffentlicht: (2025)
Multilingual Routing in Mixture-of-Experts
von: Bandarkar, Lucas, et al.
Veröffentlicht: (2025)
von: Bandarkar, Lucas, et al.
Veröffentlicht: (2025)
Lightweight Metadata-Aware Mixture-of-Experts Masked Autoencoder for Earth Observation
von: Albughdadi, Mohanad
Veröffentlicht: (2025)
von: Albughdadi, Mohanad
Veröffentlicht: (2025)
MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
von: Lintelo, Jona te, et al.
Veröffentlicht: (2026)
von: Lintelo, Jona te, et al.
Veröffentlicht: (2026)
Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
von: Liu, Haozhe, et al.
Veröffentlicht: (2025)
von: Liu, Haozhe, et al.
Veröffentlicht: (2025)
Stable-MoE: Lyapunov-based Token Routing for Distributed Mixture-of-Experts Training over Edge Networks
von: Shi, Long, et al.
Veröffentlicht: (2025)
von: Shi, Long, et al.
Veröffentlicht: (2025)
ProbMoE: Differentiable Probabilistic Routing for Mixture-of-Experts
von: Zhao, Heng, et al.
Veröffentlicht: (2026)
von: Zhao, Heng, et al.
Veröffentlicht: (2026)
DynMoLE: Boosting Mixture of LoRA Experts Fine-Tuning with a Hybrid Routing Mechanism
von: Li, Dengchun, et al.
Veröffentlicht: (2025)
von: Li, Dengchun, et al.
Veröffentlicht: (2025)
Task-Routed Mixture-of-Experts with Cognitive Appraisal for Implicit Sentiment Analysis
von: Chai, Yaping, et al.
Veröffentlicht: (2026)
von: Chai, Yaping, et al.
Veröffentlicht: (2026)
DynaMoE: Dynamic Token-Level Expert Activation with Layer-Wise Adaptive Capacity for Mixture-of-Experts Neural Networks
von: Gülmez, Gökdeniz
Veröffentlicht: (2026)
von: Gülmez, Gökdeniz
Veröffentlicht: (2026)
BLR-MoE: Boosted Language-Routing Mixture of Experts for Domain-Robust Multilingual E2E ASR
von: Ma, Guodong, et al.
Veröffentlicht: (2025)
von: Ma, Guodong, et al.
Veröffentlicht: (2025)
Task-customized Masked AutoEncoder via Mixture of Cluster-conditional Experts
von: Liu, Zhili, et al.
Veröffentlicht: (2024)
von: Liu, Zhili, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024) -
Dial-MAE: ConTextual Masked Auto-Encoder for Retrieval-based Dialogue Systems
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023) -
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023) -
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
von: Lian, Haoran, et al.
Veröffentlicht: (2024) -
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
von: Lv, Minxuan, et al.
Veröffentlicht: (2025)