Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent
Fuente:
arXiv
Guardado en:
| Autores principales: | Wei, Yongxian, Tang, Anke, Shen, Li, Hu, Zixuan, Yuan, Chun, Cao, Xiaochun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Task Groupings Regularization: Data-Free Meta-Learning with Heterogeneous Pre-trained Models
por: Wei, Yongxian, et al.
Publicado: (2024)
por: Wei, Yongxian, et al.
Publicado: (2024)
Whoever Started the Interference Should End It: Guiding Data-Free Model Merging via Task Vectors
por: Cheng, Runxi, et al.
Publicado: (2025)
por: Cheng, Runxi, et al.
Publicado: (2025)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
por: Shen, Li, et al.
Publicado: (2024)
por: Shen, Li, et al.
Publicado: (2024)
Unlocking Tuning-Free Few-Shot Adaptability in Visual Foundation Models by Recycling Pre-Tuned LoRAs
por: Hu, Zixuan, et al.
Publicado: (2024)
por: Hu, Zixuan, et al.
Publicado: (2024)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
por: Hu, Zixuan, et al.
Publicado: (2025)
por: Hu, Zixuan, et al.
Publicado: (2025)
Task-Distributionally Robust Data-Free Meta-Learning
por: Hu, Zixuan, et al.
Publicado: (2023)
por: Hu, Zixuan, et al.
Publicado: (2023)
Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
por: Tang, Anke, et al.
Publicado: (2024)
por: Tang, Anke, et al.
Publicado: (2024)
Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace
por: Yang, Jinluan, et al.
Publicado: (2024)
por: Yang, Jinluan, et al.
Publicado: (2024)
Sparse Model Inversion: Efficient Inversion of Vision Transformers for Data-Free Applications
por: Hu, Zixuan, et al.
Publicado: (2025)
por: Hu, Zixuan, et al.
Publicado: (2025)
AdaMerging: Adaptive Model Merging for Multi-Task Learning
por: Yang, Enneng, et al.
Publicado: (2023)
por: Yang, Enneng, et al.
Publicado: (2023)
FREE: Faster and Better Data-Free Meta-Learning
por: Wei, Yongxian, et al.
Publicado: (2024)
por: Wei, Yongxian, et al.
Publicado: (2024)
Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging
por: Tang, Anke, et al.
Publicado: (2025)
por: Tang, Anke, et al.
Publicado: (2025)
Multi-Task Model Merging via Adaptive Weight Disentanglement
por: Xiong, Feng, et al.
Publicado: (2024)
por: Xiong, Feng, et al.
Publicado: (2024)
Attacking Large Language Models with Projected Gradient Descent
por: Geisler, Simon, et al.
Publicado: (2024)
por: Geisler, Simon, et al.
Publicado: (2024)
A Unified Generalization Framework for Model Merging: Trade-offs, Non-Linearity, and Scaling Laws
por: Li, Qinglun, et al.
Publicado: (2026)
por: Li, Qinglun, et al.
Publicado: (2026)
Gradient Flow Drifting: Generative Modeling via Wasserstein Gradient Flows of KDE-Approximated Divergences
por: Cao, Jiarui, et al.
Publicado: (2026)
por: Cao, Jiarui, et al.
Publicado: (2026)
Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought
por: Huang, Jianhao, et al.
Publicado: (2025)
por: Huang, Jianhao, et al.
Publicado: (2025)
Representation Surgery for Multi-Task Model Merging
por: Yang, Enneng, et al.
Publicado: (2024)
por: Yang, Enneng, et al.
Publicado: (2024)
One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
por: Pu, Yuan, et al.
Publicado: (2025)
por: Pu, Yuan, et al.
Publicado: (2025)
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
por: Zhang, Chenyang, et al.
Publicado: (2026)
por: Zhang, Chenyang, et al.
Publicado: (2026)
Grams: Gradient Descent with Adaptive Momentum Scaling
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
Stochastic Adaptive Gradient Descent Without Descent
por: Aujol, Jean-François, et al.
Publicado: (2025)
por: Aujol, Jean-François, et al.
Publicado: (2025)
Transformers Efficiently Perform In-Context Logistic Regression via Normalized Gradient Descent
por: Zhang, Chenyang, et al.
Publicado: (2026)
por: Zhang, Chenyang, et al.
Publicado: (2026)
Adaptive Conditional Gradient Descent
por: Khademi, Abbas, et al.
Publicado: (2025)
por: Khademi, Abbas, et al.
Publicado: (2025)
Model Breadcrumbs: Scaling Multi-Task Model Merging with Sparse Masks
por: Davari, MohammadReza, et al.
Publicado: (2023)
por: Davari, MohammadReza, et al.
Publicado: (2023)
OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging
por: Wei, Yongxian, et al.
Publicado: (2025)
por: Wei, Yongxian, et al.
Publicado: (2025)
Enhancing Adversarial Text Attacks on BERT Models with Projected Gradient Descent
por: Waghela, Hetvi, et al.
Publicado: (2024)
por: Waghela, Hetvi, et al.
Publicado: (2024)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
por: Yang, Enneng, et al.
Publicado: (2024)
por: Yang, Enneng, et al.
Publicado: (2024)
Stochastic Gradient Descent with Adaptive Data
por: Che, Ethan, et al.
Publicado: (2024)
por: Che, Ethan, et al.
Publicado: (2024)
Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training
por: Zhao, Shen-Yi, et al.
Publicado: (2020)
por: Zhao, Shen-Yi, et al.
Publicado: (2020)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
por: Yang, Jinluan, et al.
Publicado: (2025)
por: Yang, Jinluan, et al.
Publicado: (2025)
Learning Tree-Based Models with Gradient Descent
por: Marton, Sascha
Publicado: (2026)
por: Marton, Sascha
Publicado: (2026)
Bolstering Stochastic Gradient Descent with Model Building
por: Birbil, S. Ilker, et al.
Publicado: (2021)
por: Birbil, S. Ilker, et al.
Publicado: (2021)
Adaptive Kernel Selection for Stein Variational Gradient Descent
por: Melcher, Moritz, et al.
Publicado: (2025)
por: Melcher, Moritz, et al.
Publicado: (2025)
Elastic Multi-Gradient Descent for Parallel Continual Learning
por: Lyu, Fan, et al.
Publicado: (2024)
por: Lyu, Fan, et al.
Publicado: (2024)
Towards Understanding the Generalizability of Delayed Stochastic Gradient Descent
por: Deng, Xiaoge, et al.
Publicado: (2023)
por: Deng, Xiaoge, et al.
Publicado: (2023)
Integrating Intermediate Layer Optimization and Projected Gradient Descent for Solving Inverse Problems with Diffusion Models
por: Zheng, Yang, et al.
Publicado: (2025)
por: Zheng, Yang, et al.
Publicado: (2025)
Euclidean Distance Matrix Completion via Asymmetric Projected Gradient Descent
por: Li, Yicheng, et al.
Publicado: (2025)
por: Li, Yicheng, et al.
Publicado: (2025)
The Implicit Bias of Steepest Descent with Mini-batch Stochastic Gradient
por: Li, Jichu, et al.
Publicado: (2026)
por: Li, Jichu, et al.
Publicado: (2026)
Parameter Efficient Multi-task Model Fusion with Partial Linearization
por: Tang, Anke, et al.
Publicado: (2023)
por: Tang, Anke, et al.
Publicado: (2023)
Ejemplares similares
-
Task Groupings Regularization: Data-Free Meta-Learning with Heterogeneous Pre-trained Models
por: Wei, Yongxian, et al.
Publicado: (2024) -
Whoever Started the Interference Should End It: Guiding Data-Free Model Merging via Task Vectors
por: Cheng, Runxi, et al.
Publicado: (2025) -
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
por: Shen, Li, et al.
Publicado: (2024) -
Unlocking Tuning-Free Few-Shot Adaptability in Visual Foundation Models by Recycling Pre-Tuned LoRAs
por: Hu, Zixuan, et al.
Publicado: (2024) -
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
por: Hu, Zixuan, et al.
Publicado: (2025)