Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Dengming, Ma, Xiaowen, Ni, Zhenliang, Wu, Zhenkai, Shu, Han, Jiang, Xin, Chen, Xinghao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
par: Wu, Zhenkai, et autres
Publié: (2025)
par: Wu, Zhenkai, et autres
Publié: (2025)
Ada-MoGE: Adaptive Mixture of Gaussian Expert Model for Time Series Forecasting
par: Ni, Zhenliang, et autres
Publié: (2025)
par: Ni, Zhenliang, et autres
Publié: (2025)
TimePro: Efficient Multivariate Long-term Time Series Forecasting with Variable- and Time-Aware Hyper-state
par: Ma, Xiaowen, et autres
Publié: (2025)
par: Ma, Xiaowen, et autres
Publié: (2025)
Expert Merging in Sparse Mixture of Experts with Nash Bargaining
par: Nguyen, Dung V., et autres
Publié: (2025)
par: Nguyen, Dung V., et autres
Publié: (2025)
Channel Merging: Preserving Specialization for Merged Experts
par: Zhang, Mingyang, et autres
Publié: (2024)
par: Zhang, Mingyang, et autres
Publié: (2024)
Learning More Generalized Experts by Merging Experts in Mixture-of-Experts
par: Park, Sejik
Publié: (2024)
par: Park, Sejik
Publié: (2024)
Fine-Grained Model Merging via Modular Expert Recombination
par: Qiu, Haiyun, et autres
Publié: (2026)
par: Qiu, Haiyun, et autres
Publié: (2026)
CAMEx: Curvature-aware Merging of Experts
par: Nguyen, Dung V., et autres
Publié: (2025)
par: Nguyen, Dung V., et autres
Publié: (2025)
Soft Merging of Experts with Adaptive Routing
par: Muqeeth, Mohammed, et autres
Publié: (2023)
par: Muqeeth, Mohammed, et autres
Publié: (2023)
Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution
par: Qiu, Haiyun, et autres
Publié: (2026)
par: Qiu, Haiyun, et autres
Publié: (2026)
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
par: Miao, Ruijie, et autres
Publié: (2025)
par: Miao, Ruijie, et autres
Publié: (2025)
Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging
par: Li, Lujun, et autres
Publié: (2025)
par: Li, Lujun, et autres
Publié: (2025)
Merge and Guide: Unifying Model Merging and Guided Decoding for Controllable Multi-Objective Generation
par: Xie, Guofu, et autres
Publié: (2025)
par: Xie, Guofu, et autres
Publié: (2025)
Why Do More Experts Fail? A Theoretical Analysis of Model Merging
par: Wang, Zijing, et autres
Publié: (2025)
par: Wang, Zijing, et autres
Publié: (2025)
FedMerge: Federated Personalization via Model Merging
par: Chen, Shutong, et autres
Publié: (2025)
par: Chen, Shutong, et autres
Publié: (2025)
Exploring Sparse Adapters for Scalable Merging of Parameter Efficient Experts
par: Arnob, Samin Yeasar, et autres
Publié: (2025)
par: Arnob, Samin Yeasar, et autres
Publié: (2025)
Rethinking Layer-wise Model Merging through Chain of Merges
par: Buzzega, Pietro, et autres
Publié: (2025)
par: Buzzega, Pietro, et autres
Publié: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
par: Jha, Saurav, et autres
Publié: (2026)
par: Jha, Saurav, et autres
Publié: (2026)
Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
par: Tang, Anke, et autres
Publié: (2024)
par: Tang, Anke, et autres
Publié: (2024)
Faster, Smaller, and Smarter: Task-Aware Expert Merging for Online MoE Inference
par: Han, Ziyi, et autres
Publié: (2025)
par: Han, Ziyi, et autres
Publié: (2025)
Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts
par: Morrison, Jacob, et autres
Publié: (2026)
par: Morrison, Jacob, et autres
Publié: (2026)
Trade-offs in Ensembling, Merging and Routing Among Parameter-Efficient Experts
par: Lotfi, Sanae, et autres
Publié: (2026)
par: Lotfi, Sanae, et autres
Publié: (2026)
Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging
par: Wang, Yuanyi, et autres
Publié: (2026)
par: Wang, Yuanyi, et autres
Publié: (2026)
PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference
par: Zhao, Yushu, et autres
Publié: (2025)
par: Zhao, Yushu, et autres
Publié: (2025)
SyMerge: From Non-Interference to Synergistic Merging via Single-Layer Adaptation
par: Jung, Aecheon, et autres
Publié: (2024)
par: Jung, Aecheon, et autres
Publié: (2024)
Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging
par: Hui, Tingfeng, et autres
Publié: (2024)
par: Hui, Tingfeng, et autres
Publié: (2024)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
par: Shen, Li, et autres
Publié: (2024)
par: Shen, Li, et autres
Publié: (2024)
BD-Merging: Bias-Aware Dynamic Model Merging with Evidence-Guided Contrastive Learning
par: Xie, Yuhan, et autres
Publié: (2026)
par: Xie, Yuhan, et autres
Publié: (2026)
DC-Merge: Improving Model Merging with Directional Consistency
par: Zhang, Han-Chen, et autres
Publié: (2026)
par: Zhang, Han-Chen, et autres
Publié: (2026)
Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging
par: Bertolissi, Ryo, et autres
Publié: (2025)
par: Bertolissi, Ryo, et autres
Publié: (2025)
Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
par: Esfandiari, Yasin, et autres
Publié: (2025)
par: Esfandiari, Yasin, et autres
Publié: (2025)
Scalable Model Merging with Progressive Layer-wise Distillation
par: Xu, Jing, et autres
Publié: (2025)
par: Xu, Jing, et autres
Publié: (2025)
TimeExpert: Boosting Long Time Series Forecasting with Temporal Mix of Experts
par: Ma, Xiaowen, et autres
Publié: (2025)
par: Ma, Xiaowen, et autres
Publié: (2025)
MIN-Merging: Merge the Important Neurons for Model Merging
par: Liang, Yunfei
Publié: (2025)
par: Liang, Yunfei
Publié: (2025)
Model Assembly Learning with Heterogeneous Layer Weight Merging
par: Zhang, Yi-Kai, et autres
Publié: (2025)
par: Zhang, Yi-Kai, et autres
Publié: (2025)
CodeMerge: Codebook-Guided Model Merging for Robust Test-Time Adaptation in Autonomous Driving
par: Yang, Huitong, et autres
Publié: (2025)
par: Yang, Huitong, et autres
Publié: (2025)
From Coefficients to Directions: Rethinking Model Merging with Directional Alignment
par: Chen, Zhikang, et autres
Publié: (2025)
par: Chen, Zhikang, et autres
Publié: (2025)
MergeBench: A Benchmark for Merging Domain-Specialized LLMs
par: He, Yifei, et autres
Publié: (2025)
par: He, Yifei, et autres
Publié: (2025)
Pareto Merging: Multi-Objective Optimization for Preference-Aware Model Merging
par: Chen, Weiyu, et autres
Publié: (2024)
par: Chen, Weiyu, et autres
Publié: (2024)
MINGLE: Mixture of Null-Space Gated Low-Rank Experts for Test-Time Continual Model Merging
par: Qiu, Zihuan, et autres
Publié: (2025)
par: Qiu, Zihuan, et autres
Publié: (2025)
Documents similaires
-
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
par: Wu, Zhenkai, et autres
Publié: (2025) -
Ada-MoGE: Adaptive Mixture of Gaussian Expert Model for Time Series Forecasting
par: Ni, Zhenliang, et autres
Publié: (2025) -
TimePro: Efficient Multivariate Long-term Time Series Forecasting with Variable- and Time-Aware Hyper-state
par: Ma, Xiaowen, et autres
Publié: (2025) -
Expert Merging in Sparse Mixture of Experts with Nash Bargaining
par: Nguyen, Dung V., et autres
Publié: (2025) -
Channel Merging: Preserving Specialization for Merged Experts
par: Zhang, Mingyang, et autres
Publié: (2024)