Superpose Task-specific Features for Model Merging
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiu, Haiquan, Wu, You, Li, Dong, Guo, Jianmin, Yao, Quanming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
par: Qiu, Haiquan, et autres
Publié: (2025)
par: Qiu, Haiquan, et autres
Publié: (2025)
Graph Unitary Message Passing
par: Qiu, Haiquan, et autres
Publié: (2024)
par: Qiu, Haiquan, et autres
Publié: (2024)
Understanding Expressivity of GNN in Rule Learning
par: Qiu, Haiquan, et autres
Publié: (2023)
par: Qiu, Haiquan, et autres
Publié: (2023)
Dictionary Learning: The Complexity of Learning Sparse Superposed Features with Feedback
par: Kumar, Akash
Publié: (2025)
par: Kumar, Akash
Publié: (2025)
FeatCal: Feature Calibration for Post-Merging Models
par: Gu, Yanggan, et autres
Publié: (2026)
par: Gu, Yanggan, et autres
Publié: (2026)
PACIA: Parameter-Efficient Adapter for Few-Shot Molecular Property Prediction
par: Wu, Shiguang, et autres
Publié: (2023)
par: Wu, Shiguang, et autres
Publié: (2023)
MergeNet: Knowledge Migration across Heterogeneous Models, Tasks, and Modalities
par: Li, Kunxi, et autres
Publié: (2024)
par: Li, Kunxi, et autres
Publié: (2024)
Spectral Alignment as Predictor of Loss Explosion in Neural Network Training
par: Qiu, Haiquan, et autres
Publié: (2025)
par: Qiu, Haiquan, et autres
Publié: (2025)
Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration
par: Sun, Wenju, et autres
Publié: (2025)
par: Sun, Wenju, et autres
Publié: (2025)
Attention Sinks Induce Gradient Sinks: Massive Activations as Gradient Regulators in Transformers
par: Chen, Yihong, et autres
Publié: (2026)
par: Chen, Yihong, et autres
Publié: (2026)
Accurate and interpretable drug-drug interaction prediction enabled by knowledge subgraph learning
par: Wang, Yaqing, et autres
Publié: (2023)
par: Wang, Yaqing, et autres
Publié: (2023)
Generalizing Hyperedge Expansion for Hyper-relational Knowledge Graph Modeling
par: Liu, Yu, et autres
Publié: (2024)
par: Liu, Yu, et autres
Publié: (2024)
Neural Symbolic Regression of Complex Network Dynamics
par: Qiu, Haiquan, et autres
Publié: (2024)
par: Qiu, Haiquan, et autres
Publié: (2024)
Vanishing Feature: Diagnosing Model Merging and Beyond
par: Qu, Xingyu, et autres
Publié: (2024)
par: Qu, Xingyu, et autres
Publié: (2024)
Case-Based Reasoning Enhances the Predictive Power of LLMs in Drug-Drug Interaction
par: Liu, Guangyi, et autres
Publié: (2025)
par: Liu, Guangyi, et autres
Publié: (2025)
Scaling GraphLLM with Bilevel-Optimized Sparse Querying
par: Peng, Yangzhe, et autres
Publié: (2026)
par: Peng, Yangzhe, et autres
Publié: (2026)
Merging Smarter, Generalizing Better: Enhancing Model Merging on OOD Data
par: Zhang, Bingjie, et autres
Publié: (2025)
par: Zhang, Bingjie, et autres
Publié: (2025)
Representation Surgery for Multi-Task Model Merging
par: Yang, Enneng, et autres
Publié: (2024)
par: Yang, Enneng, et autres
Publié: (2024)
UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation
par: Guo, Shuhan, et autres
Publié: (2024)
par: Guo, Shuhan, et autres
Publié: (2024)
MIN-Merging: Merge the Important Neurons for Model Merging
par: Liang, Yunfei
Publié: (2025)
par: Liang, Yunfei
Publié: (2025)
Task Arithmetic in Trust Region: A Training-Free Model Merging Approach to Navigate Knowledge Conflicts
par: Sun, Wenju, et autres
Publié: (2025)
par: Sun, Wenju, et autres
Publié: (2025)
Bayesian Model Merging
par: Li, Kaiyang, et autres
Publié: (2026)
par: Li, Kaiyang, et autres
Publié: (2026)
Attending on Multilevel Structure of Proteins enables Accurate Prediction of Cold-Start Drug-Target Interactions
par: Zhang, Ziying, et autres
Publié: (2025)
par: Zhang, Ziying, et autres
Publié: (2025)
Automated Machine Learning: From Principles to Practices
par: Shen, Zhenqian, et autres
Publié: (2018)
par: Shen, Zhenqian, et autres
Publié: (2018)
A Versatile Graph Learning Approach through LLM-based Agent
par: Wei, Lanning, et autres
Publié: (2023)
par: Wei, Lanning, et autres
Publié: (2023)
TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models
par: Liu, Zuxin, et autres
Publié: (2023)
par: Liu, Zuxin, et autres
Publié: (2023)
CAT Merging: A Training-Free Approach for Resolving Conflicts in Model Merging
par: Sun, Wenju, et autres
Publié: (2025)
par: Sun, Wenju, et autres
Publié: (2025)
Model Merging in the Essential Subspace
par: Li, Longhua, et autres
Publié: (2026)
par: Li, Longhua, et autres
Publié: (2026)
MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
DualWeaver: Synergistic Feature Weaving Surrogates for Multivariate Forecasting with Univariate Time Series Foundation Models
par: Li, Jinpeng, et autres
Publié: (2026)
par: Li, Jinpeng, et autres
Publié: (2026)
Knowledge-Enhanced Recommendation with User-Centric Subgraph Network
par: Liu, Guangyi, et autres
Publié: (2024)
par: Liu, Guangyi, et autres
Publié: (2024)
Heuristic Learning with Graph Neural Networks: A Unified Framework for Link Prediction
par: Zhang, Juzheng, et autres
Publié: (2024)
par: Zhang, Juzheng, et autres
Publié: (2024)
Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge
par: Tang, Yao, et autres
Publié: (2026)
par: Tang, Yao, et autres
Publié: (2026)
CALM: Consensus-Aware Localized Merging for Multi-Task Learning
par: Yan, Kunda, et autres
Publié: (2025)
par: Yan, Kunda, et autres
Publié: (2025)
Multi-Level Collaboration in Model Merging
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Customized Subgraph Selection and Encoding for Drug-drug Interaction Prediction
par: Du, Haotong, et autres
Publié: (2024)
par: Du, Haotong, et autres
Publié: (2024)
Efficient Reinforcement Learning for Zero-Shot Coordination in Evolving Games
par: Hui, Bingyu, et autres
Publié: (2025)
par: Hui, Bingyu, et autres
Publié: (2025)
Beyond Scaleup: Knowledge-aware Parsimony Learning from Deep Networks
par: Yao, Quanming, et autres
Publié: (2024)
par: Yao, Quanming, et autres
Publié: (2024)
Degree-Conscious Spiking Graph for Cross-Domain Adaptation
par: Wang, Yingxu, et autres
Publié: (2024)
par: Wang, Yingxu, et autres
Publié: (2024)
Documents similaires
-
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
par: Qiu, Haiquan, et autres
Publié: (2025) -
Graph Unitary Message Passing
par: Qiu, Haiquan, et autres
Publié: (2024) -
Understanding Expressivity of GNN in Rule Learning
par: Qiu, Haiquan, et autres
Publié: (2023) -
Dictionary Learning: The Complexity of Learning Sparse Superposed Features with Feedback
par: Kumar, Akash
Publié: (2025) -
FeatCal: Feature Calibration for Post-Merging Models
par: Gu, Yanggan, et autres
Publié: (2026)