DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lv, Minxuan, Su, Zhenpeng, Pan, Leiyu, Xiong, Yizhe, Lin, Zijia, Chen, Hui, Zhou, Wei, Han, Jungong, Ding, Guiguang, Luo, Cheng, Zhang, Di, Gai, Kun, Hu, Songlin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
von: Pan, Leiyu, et al.
Veröffentlicht: (2025)
von: Pan, Leiyu, et al.
Veröffentlicht: (2025)
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)
CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
Temporal Scaling Law for Large Language Models
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
RepViT-SAM: Towards Real-Time Segmenting Anything
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
LSNet: See Large, Focus Small
von: Wang, Ao, et al.
Veröffentlicht: (2025)
von: Wang, Ao, et al.
Veröffentlicht: (2025)
RepViT: Revisiting Mobile CNN From ViT Perspective
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
von: Mei, Tiehua, et al.
Veröffentlicht: (2026)
von: Mei, Tiehua, et al.
Veröffentlicht: (2026)
PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task Adaptation
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
LANDeRMT: Detecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
YOLOE: Real-Time Seeing Anything
von: Wang, Ao, et al.
Veröffentlicht: (2025)
von: Wang, Ao, et al.
Veröffentlicht: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
von: Liang, Yiwen, et al.
Veröffentlicht: (2025)
von: Liang, Yiwen, et al.
Veröffentlicht: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
von: Huang, Wei, et al.
Veröffentlicht: (2025)
von: Huang, Wei, et al.
Veröffentlicht: (2025)
Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual Persistence
von: Lyu, Mengyao, et al.
Veröffentlicht: (2024)
von: Lyu, Mengyao, et al.
Veröffentlicht: (2024)
YOLOv10: Real-Time End-to-End Object Detection
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
Tracking and Segmenting Anything in Any Modality
von: Zhang, Tianlu, et al.
Veröffentlicht: (2025)
von: Zhang, Tianlu, et al.
Veröffentlicht: (2025)
LBPE: Long-token-first Tokenization to Improve Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
An Empirical Study on the Robustness of Massively Multilingual Neural Machine Translation
von: Supryadi, et al.
Veröffentlicht: (2024)
von: Supryadi, et al.
Veröffentlicht: (2024)
Drop your Decoder: Pre-training with Bag-of-Word Prediction for Dense Passage Retrieval
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
Context Enhancement with Reconstruction as Sequence for Unified Unsupervised Anomaly Detection
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
Task-level Distributionally Robust Optimization for Large Language Model-based Dense Retrieval
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
Promptable Anomaly Segmentation with SAM Through Self-Perception Tuning
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs
von: Sun, Chenxi, et al.
Veröffentlicht: (2024)
von: Sun, Chenxi, et al.
Veröffentlicht: (2024)
RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry
von: Lv, Bo, et al.
Veröffentlicht: (2026)
von: Lv, Bo, et al.
Veröffentlicht: (2026)
YOLO-UniOW: Efficient Universal Open-World Object Detection
von: Liu, Lihao, et al.
Veröffentlicht: (2024)
von: Liu, Lihao, et al.
Veröffentlicht: (2024)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
von: Yang, Fan, et al.
Veröffentlicht: (2024)
von: Yang, Fan, et al.
Veröffentlicht: (2024)
Dial-MAE: ConTextual Masked Auto-Encoder for Retrieval-based Dialogue Systems
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
von: Pan, Leiyu, et al.
Veröffentlicht: (2025) -
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024) -
MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024) -
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025) -
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
von: Su, Zhenpeng, et al.
Veröffentlicht: (2025)