Why Do More Experts Fail? A Theoretical Analysis of Model Merging
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zijing, Xu, Xingle, Liu, Yongkang, Zhang, Yiqun, Lin, Peiqin, Feng, Shi, Yang, Xiaocui, Wang, Daling, Schütze, Hinrich |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Look Within or Look Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning
by: Liu, Yongkang, et al.
Published: (2025)
by: Liu, Yongkang, et al.
Published: (2025)
DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging
by: Wang, Zijing, et al.
Published: (2026)
by: Wang, Zijing, et al.
Published: (2026)
PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs
by: Wang, Zijing, et al.
Published: (2026)
by: Wang, Zijing, et al.
Published: (2026)
MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis
by: Xu, Xingle, et al.
Published: (2025)
by: Xu, Xingle, et al.
Published: (2025)
Evaluate What You Can't Evaluate: Unassessable Quality for Generated Response
by: Liu, Yongkang, et al.
Published: (2023)
by: Liu, Yongkang, et al.
Published: (2023)
ChatZero:Zero-shot Cross-Lingual Dialogue Generation via Pseudo-Target Language
by: Liu, Yongkang, et al.
Published: (2024)
by: Liu, Yongkang, et al.
Published: (2024)
HiFT: A Hierarchical Full Parameter Fine-Tuning Strategy
by: Liu, Yongkang, et al.
Published: (2024)
by: Liu, Yongkang, et al.
Published: (2024)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
by: Liu, Yihong, et al.
Published: (2023)
by: Liu, Yihong, et al.
Published: (2023)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
by: Lin, Peiqin, et al.
Published: (2024)
by: Lin, Peiqin, et al.
Published: (2024)
SAD: A Large-Scale Strategic Argumentative Dialogue Dataset
by: Liu, Yongkang, et al.
Published: (2026)
by: Liu, Yongkang, et al.
Published: (2026)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
by: Wang, Zihan, et al.
Published: (2024)
by: Wang, Zihan, et al.
Published: (2024)
ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning
by: Liu, Yongkang, et al.
Published: (2026)
by: Liu, Yongkang, et al.
Published: (2026)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
by: Huang, YiJie, et al.
Published: (2026)
by: Huang, YiJie, et al.
Published: (2026)
XAMPLER: Learning to Retrieve Cross-Lingual In-Context Examples
by: Lin, Peiqin, et al.
Published: (2024)
by: Lin, Peiqin, et al.
Published: (2024)
SMoA: Spectrum Modulation Adapter for Parameter-Efficient Fine-Tuning
by: Liu, Yongkang, et al.
Published: (2026)
by: Liu, Yongkang, et al.
Published: (2026)
High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning
by: Liu, Yongkang, et al.
Published: (2026)
by: Liu, Yongkang, et al.
Published: (2026)
Why Better Cross-Lingual Alignment Fails for Better Cross-Lingual Transfer: Case of Encoders
by: Veitsman, Yana, et al.
Published: (2026)
by: Veitsman, Yana, et al.
Published: (2026)
MEKiT: Multi-source Heterogeneous Knowledge Injection Method via Instruction Tuning for Emotion-Cause Pair Extraction
by: Mu, Shiyi, et al.
Published: (2025)
by: Mu, Shiyi, et al.
Published: (2025)
Affective Computing in the Era of Large Language Models: A Survey from the NLP Perspective
by: Zhang, Yiqun, et al.
Published: (2024)
by: Zhang, Yiqun, et al.
Published: (2024)
Enhancing LLM-based Recommendation through Semantic-Aligned Collaborative Knowledge
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Can LLMs Beat Humans in Debating? A Dynamic Multi-agent Framework for Competitive Debate
by: Zhang, Yiqun, et al.
Published: (2024)
by: Zhang, Yiqun, et al.
Published: (2024)
TOOL-ED: Enhancing Empathetic Response Generation with the Tool Calling Capability of LLM
by: Cao, Huiying, et al.
Published: (2024)
by: Cao, Huiying, et al.
Published: (2024)
A Unified Data Augmentation Framework for Low-Resource Multi-Domain Dialogue Generation
by: Liu, Yongkang, et al.
Published: (2024)
by: Liu, Yongkang, et al.
Published: (2024)
NEAT: Neuron-Based Early Exit for Large Reasoning Models
by: Liu, Kang, et al.
Published: (2026)
by: Liu, Kang, et al.
Published: (2026)
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
by: Cai, Dexian, et al.
Published: (2025)
by: Cai, Dexian, et al.
Published: (2025)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
by: Pei, Renhao, et al.
Published: (2025)
by: Pei, Renhao, et al.
Published: (2025)
MaLA-500: Massive Language Adaptation of Large Language Models
by: Lin, Peiqin, et al.
Published: (2024)
by: Lin, Peiqin, et al.
Published: (2024)
mPLM-Sim: Better Cross-Lingual Similarity and Transfer in Multilingual Pretrained Language Models
by: Lin, Peiqin, et al.
Published: (2023)
by: Lin, Peiqin, et al.
Published: (2023)
DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference
by: Wang, Zihan, et al.
Published: (2026)
by: Wang, Zihan, et al.
Published: (2026)
Generative Emotion Cause Explanation in Multimodal Conversations
by: Wang, Lin, et al.
Published: (2024)
by: Wang, Lin, et al.
Published: (2024)
Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answering
by: Zhang, Xiaoming, et al.
Published: (2024)
by: Zhang, Xiaoming, et al.
Published: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
by: Zhao, Yinzhi, et al.
Published: (2026)
by: Zhao, Yinzhi, et al.
Published: (2026)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
by: Zhang, Yiqun, et al.
Published: (2026)
by: Zhang, Yiqun, et al.
Published: (2026)
SSMLoRA: Enhancing Low-Rank Adaptation with State Space Model
by: Yu, Jiayang, et al.
Published: (2025)
by: Yu, Jiayang, et al.
Published: (2025)
PsyDraw: A Multi-Agent Multimodal System for Mental Health Screening in Left-Behind Children
by: Zhang, Yiqun, et al.
Published: (2024)
by: Zhang, Yiqun, et al.
Published: (2024)
ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation
by: Gao, Zhuoyue, et al.
Published: (2026)
by: Gao, Zhuoyue, et al.
Published: (2026)
Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and Distillation
by: Shangguan, Haonan, et al.
Published: (2025)
by: Shangguan, Haonan, et al.
Published: (2025)
GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification
by: Wan, Faxian, et al.
Published: (2026)
by: Wan, Faxian, et al.
Published: (2026)
From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning
by: Wang, Xiao, et al.
Published: (2026)
by: Wang, Xiao, et al.
Published: (2026)
Language Models as Continuous Self-Evolving Data Engineers
by: Wang, Peidong, et al.
Published: (2024)
by: Wang, Peidong, et al.
Published: (2024)
Similar Items
-
Look Within or Look Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning
by: Liu, Yongkang, et al.
Published: (2025) -
DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging
by: Wang, Zijing, et al.
Published: (2026) -
PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs
by: Wang, Zijing, et al.
Published: (2026) -
MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis
by: Xu, Xingle, et al.
Published: (2025) -
Evaluate What You Can't Evaluate: Unassessable Quality for Generated Response
by: Liu, Yongkang, et al.
Published: (2023)