Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tian, Changxin, Chen, Kunlong, Liu, Jia, Liu, Ziqi, Zhang, Zhiqiang, Zhou, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training
von: Tian, Changxin, et al.
Veröffentlicht: (2025)
von: Tian, Changxin, et al.
Veröffentlicht: (2025)
Sparsing Law: Towards Large Language Models with Greater Activation Sparsity
von: Luo, Yuqi, et al.
Veröffentlicht: (2024)
von: Luo, Yuqi, et al.
Veröffentlicht: (2024)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
von: Collado-Montañez, Jaime, et al.
Veröffentlicht: (2025)
von: Collado-Montañez, Jaime, et al.
Veröffentlicht: (2025)
Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM
von: Codefuse, et al.
Veröffentlicht: (2025)
von: Codefuse, et al.
Veröffentlicht: (2025)
I run as fast as a rabbit, can you? A Multilingual Simile Dialogue Dataset
von: Ma, Longxuan, et al.
Veröffentlicht: (2023)
von: Ma, Longxuan, et al.
Veröffentlicht: (2023)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
von: Peters, Sydney, et al.
Veröffentlicht: (2025)
von: Peters, Sydney, et al.
Veröffentlicht: (2025)
ConPET: Continual Parameter-Efficient Tuning for Large Language Models
von: Song, Chenyang, et al.
Veröffentlicht: (2023)
von: Song, Chenyang, et al.
Veröffentlicht: (2023)
RUQuant: Towards Refining Uniform Quantization for Large Language Models
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level
von: Herbst, Jeremy, et al.
Veröffentlicht: (2026)
von: Herbst, Jeremy, et al.
Veröffentlicht: (2026)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2024)
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2024)
Towards Effective and Efficient Continual Pre-training of Large Language Models
von: Chen, Jie, et al.
Veröffentlicht: (2024)
von: Chen, Jie, et al.
Veröffentlicht: (2024)
Effective and Efficient Schema-aware Information Extraction Using On-Device Large Language Models
von: Wen, Zhihao, et al.
Veröffentlicht: (2025)
von: Wen, Zhihao, et al.
Veröffentlicht: (2025)
PLM: Efficient Peripheral Language Models Hardware-Co-Designed for Ubiquitous Computing
von: Deng, Cheng, et al.
Veröffentlicht: (2025)
von: Deng, Cheng, et al.
Veröffentlicht: (2025)
Scaling Laws for Forgetting When Fine-Tuning Large Language Models
von: Kalajdzievski, Damjan
Veröffentlicht: (2024)
von: Kalajdzievski, Damjan
Veröffentlicht: (2024)
LoRS: Efficient Low-Rank Adaptation for Sparse Large Language Model
von: Hu, Yuxuan, et al.
Veröffentlicht: (2025)
von: Hu, Yuxuan, et al.
Veröffentlicht: (2025)
Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models
von: Cacioli, Jon-Paul
Veröffentlicht: (2026)
von: Cacioli, Jon-Paul
Veröffentlicht: (2026)
Towards Human Understanding of Paraphrase Types in Large Language Models
von: Meier, Dominik, et al.
Veröffentlicht: (2024)
von: Meier, Dominik, et al.
Veröffentlicht: (2024)
Emergent Lexical Semantics in Neural Language Models: Testing Martin's Law on LLM-Generated Text
von: Kugler, Kai
Veröffentlicht: (2025)
von: Kugler, Kai
Veröffentlicht: (2025)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
von: Feng, Ruitao, et al.
Veröffentlicht: (2025)
von: Feng, Ruitao, et al.
Veröffentlicht: (2025)
PowLU: An Activation Function for Stable Pre-Training of LLMs
von: Jiang, Peijie, et al.
Veröffentlicht: (2026)
von: Jiang, Peijie, et al.
Veröffentlicht: (2026)
Low-Resource Court Judgment Summarization for Common Law Systems
von: Liu, Shuaiqi, et al.
Veröffentlicht: (2024)
von: Liu, Shuaiqi, et al.
Veröffentlicht: (2024)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
von: Ashuach, Tomer, et al.
Veröffentlicht: (2025)
von: Ashuach, Tomer, et al.
Veröffentlicht: (2025)
Lacuna Language Learning: Leveraging RNNs for Ranked Text Completion in Digitized Coptic Manuscripts
von: Levine, Lauren, et al.
Veröffentlicht: (2024)
von: Levine, Lauren, et al.
Veröffentlicht: (2024)
KyrgyzBERT: A Compact, Efficient Language Model for Kyrgyz NLP
von: Metinov, Adilet, et al.
Veröffentlicht: (2025)
von: Metinov, Adilet, et al.
Veröffentlicht: (2025)
Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
von: Saini, Mayank, et al.
Veröffentlicht: (2025)
von: Saini, Mayank, et al.
Veröffentlicht: (2025)
Efficient Aspect-Based Summarization of Climate Change Reports with Small Language Models
von: Ghinassi, Iacopo, et al.
Veröffentlicht: (2024)
von: Ghinassi, Iacopo, et al.
Veröffentlicht: (2024)
Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer
von: Lasbordes, Maxence, et al.
Veröffentlicht: (2025)
von: Lasbordes, Maxence, et al.
Veröffentlicht: (2025)
Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs
von: Sun, Luoyang, et al.
Veröffentlicht: (2026)
von: Sun, Luoyang, et al.
Veröffentlicht: (2026)
Scaling Laws for State Dynamics in Large Language Models
von: Li, Jacob X, et al.
Veröffentlicht: (2025)
von: Li, Jacob X, et al.
Veröffentlicht: (2025)
Towards Alignment-Centric Paradigm: A Survey of Instruction Tuning in Large Language Models
von: Han, Xudong, et al.
Veröffentlicht: (2025)
von: Han, Xudong, et al.
Veröffentlicht: (2025)
A Multi-Pass Large Language Model Framework for Precise and Efficient Radiology Report Error Detection
von: Kim, Songsoo, et al.
Veröffentlicht: (2025)
von: Kim, Songsoo, et al.
Veröffentlicht: (2025)
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
von: Liu, Aiwei, et al.
Veröffentlicht: (2025)
von: Liu, Aiwei, et al.
Veröffentlicht: (2025)
An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs
von: Zhu, Qian, et al.
Veröffentlicht: (2026)
von: Zhu, Qian, et al.
Veröffentlicht: (2026)
D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models
von: Ubukata, Shunsuke
Veröffentlicht: (2026)
von: Ubukata, Shunsuke
Veröffentlicht: (2026)
SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
Test-Time Scaling of Reasoning Models for Machine Translation
von: Li, Zihao, et al.
Veröffentlicht: (2025)
von: Li, Zihao, et al.
Veröffentlicht: (2025)
The Data Efficiency Frontier of Financial Foundation Models: Scaling Laws from Continued Pretraining
von: Ponnock, Jesse
Veröffentlicht: (2025)
von: Ponnock, Jesse
Veröffentlicht: (2025)
LLM-Ref: Enhancing Reference Handling in Technical Writing with Large Language Models
von: Fuad, Kazi Ahmed Asif, et al.
Veröffentlicht: (2024)
von: Fuad, Kazi Ahmed Asif, et al.
Veröffentlicht: (2024)
Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models
von: Chen, Yanbing, et al.
Veröffentlicht: (2024)
von: Chen, Yanbing, et al.
Veröffentlicht: (2024)
Pre-trained Language Model with Prompts for Temporal Knowledge Graph Completion
von: Xu, Wenjie, et al.
Veröffentlicht: (2023)
von: Xu, Wenjie, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training
von: Tian, Changxin, et al.
Veröffentlicht: (2025) -
Sparsing Law: Towards Large Language Models with Greater Activation Sparsity
von: Luo, Yuqi, et al.
Veröffentlicht: (2024) -
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
von: Collado-Montañez, Jaime, et al.
Veröffentlicht: (2025) -
Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM
von: Codefuse, et al.
Veröffentlicht: (2025) -
I run as fast as a rabbit, can you? A Multilingual Simile Dialogue Dataset
von: Ma, Longxuan, et al.
Veröffentlicht: (2023)