MoE-CT: A Novel Approach For Large Language Models Training With Resistance To Catastrophic Forgetting
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Tianhao, Li, Shangjie, Xie, Binbin, Xiong, Deyi, Yang, Baosong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
Dynamic Expert Specialization: Towards Catastrophic Forgetting-Free Multi-Domain MoE Adaptation
von: Li, Junzhuo, et al.
Veröffentlicht: (2025)
von: Li, Junzhuo, et al.
Veröffentlicht: (2025)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
von: Li, Hongyu, et al.
Veröffentlicht: (2024)
von: Li, Hongyu, et al.
Veröffentlicht: (2024)
LocMoE: A Low-Overhead MoE for Large Language Model Training
von: Li, Jing, et al.
Veröffentlicht: (2024)
von: Li, Jing, et al.
Veröffentlicht: (2024)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
von: Zhu, Fengqi, et al.
Veröffentlicht: (2025)
von: Zhu, Fengqi, et al.
Veröffentlicht: (2025)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
von: Ding, Fei, et al.
Veröffentlicht: (2025)
von: Ding, Fei, et al.
Veröffentlicht: (2025)
Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging
von: Lyu, Mengxian, et al.
Veröffentlicht: (2026)
von: Lyu, Mengxian, et al.
Veröffentlicht: (2026)
AquilaMoE: Efficient Training for MoE Models with Scale-Up and Scale-Out Strategies
von: Zhang, Bo-Wen, et al.
Veröffentlicht: (2024)
von: Zhang, Bo-Wen, et al.
Veröffentlicht: (2024)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
von: Wei, Tianwen, et al.
Veröffentlicht: (2024)
von: Wei, Tianwen, et al.
Veröffentlicht: (2024)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
von: Zheng, Kening, et al.
Veröffentlicht: (2026)
von: Zheng, Kening, et al.
Veröffentlicht: (2026)
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities
von: Xia, Guoyang, et al.
Veröffentlicht: (2025)
von: Xia, Guoyang, et al.
Veröffentlicht: (2025)
Sigma-MoE-Tiny Technical Report
von: Hu, Qingguo, et al.
Veröffentlicht: (2025)
von: Hu, Qingguo, et al.
Veröffentlicht: (2025)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
von: Xie, Yanyue, et al.
Veröffentlicht: (2024)
von: Xie, Yanyue, et al.
Veröffentlicht: (2024)
Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent
von: Sun, Xingwu, et al.
Veröffentlicht: (2024)
von: Sun, Xingwu, et al.
Veröffentlicht: (2024)
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
von: Pham, Anh, et al.
Veröffentlicht: (2025)
von: Pham, Anh, et al.
Veröffentlicht: (2025)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
von: Hsiao, Chi-Yuan, et al.
Veröffentlicht: (2025)
von: Hsiao, Chi-Yuan, et al.
Veröffentlicht: (2025)
Unveiling and Addressing Pseudo Forgetting in Large Language Models
von: Sun, Huashan, et al.
Veröffentlicht: (2024)
von: Sun, Huashan, et al.
Veröffentlicht: (2024)
Analyzing and Reducing Catastrophic Forgetting in Parameter Efficient Tuning
von: Ren, Weijieying, et al.
Veröffentlicht: (2024)
von: Ren, Weijieying, et al.
Veröffentlicht: (2024)
Large Language Model Safety: A Holistic Survey
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
von: Li, Shuhuai, et al.
Veröffentlicht: (2026)
von: Li, Shuhuai, et al.
Veröffentlicht: (2026)
Model Editing at Scale leads to Gradual and Catastrophic Forgetting
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
Post-Trained MoE Can Skip Half Experts via Self-Distillation
von: Lv, Xingtai, et al.
Veröffentlicht: (2026)
von: Lv, Xingtai, et al.
Veröffentlicht: (2026)
Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling
von: Jiang, Fan, et al.
Veröffentlicht: (2026)
von: Jiang, Fan, et al.
Veröffentlicht: (2026)
MultiPL-MoE: Multi-Programming-Lingual Extension of Large Language Models through Hybrid Mixture-of-Experts
von: Wang, Qing, et al.
Veröffentlicht: (2025)
von: Wang, Qing, et al.
Veröffentlicht: (2025)
MoRAL: MoE Augmented LoRA for LLMs' Lifelong Learning
von: Yang, Shu, et al.
Veröffentlicht: (2024)
von: Yang, Shu, et al.
Veröffentlicht: (2024)
Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
von: Yamaguchi, Atsuki, et al.
Veröffentlicht: (2025)
von: Yamaguchi, Atsuki, et al.
Veröffentlicht: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
von: Ma, Wenhan, et al.
Veröffentlicht: (2025)
von: Ma, Wenhan, et al.
Veröffentlicht: (2025)
PithTrain: A Compact and Agent-Native MoE Training System
von: Lai, Ruihang, et al.
Veröffentlicht: (2026)
von: Lai, Ruihang, et al.
Veröffentlicht: (2026)
Evolutionary Strategies lead to Catastrophic Forgetting in LLMs
von: Abdi, Immanuel, et al.
Veröffentlicht: (2026)
von: Abdi, Immanuel, et al.
Veröffentlicht: (2026)
OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale
von: Shi, Jingze, et al.
Veröffentlicht: (2026)
von: Shi, Jingze, et al.
Veröffentlicht: (2026)
Dynamic Language Group-Based MoE: Enhancing Code-Switching Speech Recognition with Hierarchical Routing
von: Huang, Hukai, et al.
Veröffentlicht: (2024)
von: Huang, Hukai, et al.
Veröffentlicht: (2024)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
von: Huang, Haiduo, et al.
Veröffentlicht: (2025)
von: Huang, Haiduo, et al.
Veröffentlicht: (2025)
Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
von: Jian, Chengtao, et al.
Veröffentlicht: (2025)
von: Jian, Chengtao, et al.
Veröffentlicht: (2025)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
von: Tang, Shengkun, et al.
Veröffentlicht: (2026)
von: Tang, Shengkun, et al.
Veröffentlicht: (2026)
GRIN: GRadient-INformed MoE
von: Liu, Liyuan, et al.
Veröffentlicht: (2024)
von: Liu, Liyuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
von: Li, Bo, et al.
Veröffentlicht: (2026) -
Dynamic Expert Specialization: Towards Catastrophic Forgetting-Free Multi-Domain MoE Adaptation
von: Li, Junzhuo, et al.
Veröffentlicht: (2025) -
Revisiting Catastrophic Forgetting in Large Language Model Tuning
von: Li, Hongyu, et al.
Veröffentlicht: (2024) -
LocMoE: A Low-Overhead MoE for Large Language Model Training
von: Li, Jing, et al.
Veröffentlicht: (2024) -
LLaDA-MoE: A Sparse MoE Diffusion Language Model
von: Zhu, Fengqi, et al.
Veröffentlicht: (2025)