An Empirical Study and Theoretical Explanation on Task-Level Model-Merging Collapse
Fuente:
arXiv
Salvato in:
| Autori principali: | Cao, Yuan, Ran, Dezhi, Guo, Yuzhe, Wu, Mengzhou, Chen, Simin, Li, Linyi, Yang, Wei, Xie, Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Foundation Model Engineering: Engineering Foundation Models Just as Engineering Software
di: Ran, Dezhi, et al.
Pubblicazione: (2024)
di: Ran, Dezhi, et al.
Pubblicazione: (2024)
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
di: Cao, Yuan, et al.
Pubblicazione: (2026)
di: Cao, Yuan, et al.
Pubblicazione: (2026)
KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics
di: Wu, Mengzhou, et al.
Pubblicazione: (2026)
di: Wu, Mengzhou, et al.
Pubblicazione: (2026)
An Infrastructure Software Perspective Toward Computation Offloading between Executable Specifications and Foundation Models
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
Representation Surgery for Multi-Task Model Merging
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
di: Xie, Qiujie, et al.
Pubblicazione: (2025)
di: Xie, Qiujie, et al.
Pubblicazione: (2025)
The Thinking Spectrum: An Empirical Study of Tunable Reasoning in LLMs through Model Merging
di: Lan, Xiaochong, et al.
Pubblicazione: (2025)
di: Lan, Xiaochong, et al.
Pubblicazione: (2025)
OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging
di: Wei, Yongxian, et al.
Pubblicazione: (2025)
di: Wei, Yongxian, et al.
Pubblicazione: (2025)
Superpose Task-specific Features for Model Merging
di: Qiu, Haiquan, et al.
Pubblicazione: (2025)
di: Qiu, Haiquan, et al.
Pubblicazione: (2025)
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
di: Chen, Simin, et al.
Pubblicazione: (2025)
di: Chen, Simin, et al.
Pubblicazione: (2025)
Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models
di: Liu, Zhiming, et al.
Pubblicazione: (2026)
di: Liu, Zhiming, et al.
Pubblicazione: (2026)
Explanations are a Means to an End: Decision Theoretic Explanation Evaluation
di: Guo, Ziyang, et al.
Pubblicazione: (2025)
di: Guo, Ziyang, et al.
Pubblicazione: (2025)
Skill-Adpative Imitation Learning for UI Test Reuse
di: Wu, Mengzhou, et al.
Pubblicazione: (2024)
di: Wu, Mengzhou, et al.
Pubblicazione: (2024)
SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
A Theoretical Perspective: How to Prevent Model Collapse in Self-consuming Training Loops
di: Fu, Shi, et al.
Pubblicazione: (2025)
di: Fu, Shi, et al.
Pubblicazione: (2025)
Data and System Perspectives of Sustainable Artificial Intelligence
di: Xie, Tao, et al.
Pubblicazione: (2025)
di: Xie, Tao, et al.
Pubblicazione: (2025)
LoRE-Merging: Exploring Low-Rank Estimation For Large Language Model Merging
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
MergeRepair: An Exploratory Study on Merging Task-Specific Adapters in Code LLMs for Automated Program Repair
di: Dehghan, Meghdad, et al.
Pubblicazione: (2024)
di: Dehghan, Meghdad, et al.
Pubblicazione: (2024)
Modeling Endogenous Logic: Causal Neuro-Symbolic Reasoning Model for Explainable Multi-Behavior Recommendation
di: Chen, Yuzhe, et al.
Pubblicazione: (2026)
di: Chen, Yuzhe, et al.
Pubblicazione: (2026)
BD-Merging: Bias-Aware Dynamic Model Merging with Evidence-Guided Contrastive Learning
di: Xie, Yuhan, et al.
Pubblicazione: (2026)
di: Xie, Yuhan, et al.
Pubblicazione: (2026)
On Generating Explanations for Reinforcement Learning Policies: An Empirical Study
di: Yuasa, Mikihisa, et al.
Pubblicazione: (2023)
di: Yuasa, Mikihisa, et al.
Pubblicazione: (2023)
Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
di: An, Bang, et al.
Pubblicazione: (2025)
di: An, Bang, et al.
Pubblicazione: (2025)
MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis
di: Huo, Simin, et al.
Pubblicazione: (2026)
di: Huo, Simin, et al.
Pubblicazione: (2026)
Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance
di: Yang, Wei, et al.
Pubblicazione: (2026)
di: Yang, Wei, et al.
Pubblicazione: (2026)
Multi-Level Collaboration in Model Merging
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
An Evolutionary Game-Theoretic Merging Decision-Making Considering Social Acceptance for Autonomous Driving
di: Liu, Haolin, et al.
Pubblicazione: (2025)
di: Liu, Haolin, et al.
Pubblicazione: (2025)
Merge to Mix: Mixing Datasets via Model Merging
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
Model Merging Scaling Laws in Large Language Models
di: Wang, Yuanyi, et al.
Pubblicazione: (2025)
di: Wang, Yuanyi, et al.
Pubblicazione: (2025)
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents
di: Yang, Linyi, et al.
Pubblicazione: (2025)
di: Yang, Linyi, et al.
Pubblicazione: (2025)
Collapsing Sequence-Level Data-Policy Coverage via Poisoning Attack in Offline Reinforcement Learning
di: Zhou, Xue, et al.
Pubblicazione: (2025)
di: Zhou, Xue, et al.
Pubblicazione: (2025)
MergeNet: Knowledge Migration across Heterogeneous Models, Tasks, and Modalities
di: Li, Kunxi, et al.
Pubblicazione: (2024)
di: Li, Kunxi, et al.
Pubblicazione: (2024)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
di: Kim, Sunghwan, et al.
Pubblicazione: (2026)
di: Kim, Sunghwan, et al.
Pubblicazione: (2026)
Multi-Level Explanations for Generative Language Models
di: Paes, Lucas Monteiro, et al.
Pubblicazione: (2024)
di: Paes, Lucas Monteiro, et al.
Pubblicazione: (2024)
Finding Minimum-Cost Explanations for Predictions made by Tree Ensembles
di: Törnblom, John, et al.
Pubblicazione: (2023)
di: Törnblom, John, et al.
Pubblicazione: (2023)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
An Empirical Survey of Model Merging Algorithms for Social Bias Mitigation
di: Shirafuji, Daiki, et al.
Pubblicazione: (2025)
di: Shirafuji, Daiki, et al.
Pubblicazione: (2025)
CultureLLM: Incorporating Cultural Differences into Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024)
di: Li, Cheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Foundation Model Engineering: Engineering Foundation Models Just as Engineering Software
di: Ran, Dezhi, et al.
Pubblicazione: (2024) -
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
di: Ran, Dezhi, et al.
Pubblicazione: (2025) -
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
di: Cao, Yuan, et al.
Pubblicazione: (2026) -
KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits
di: Ran, Dezhi, et al.
Pubblicazione: (2025) -
From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents
di: Ran, Dezhi, et al.
Pubblicazione: (2025)