Less is More: Efficient Model Merging with Binary Task Switch
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qi, Biqing, Li, Fangyuan, Wang, Zhen, Gao, Junqi, Li, Dong, Ye, Peng, Zhou, Bowen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Auto-FlexSwitch: Efficient Dynamic Model Merging via Learnable Task Vector Compression
par: Gao, Junqi, et autres
Publié: (2026)
par: Gao, Junqi, et autres
Publié: (2026)
Fast and Slow Gradient Approximation for Binary Neural Network Optimization
par: Chen, Xinquan, et autres
Publié: (2024)
par: Chen, Xinquan, et autres
Publié: (2024)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
An Efficient Memory Module for Graph Few-Shot Class-Incremental Learning
par: Li, Dong, et autres
Publié: (2024)
par: Li, Dong, et autres
Publié: (2024)
SMR: State Memory Replay for Long Sequence Modeling
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
par: Li, Fangyuan, et autres
Publié: (2026)
par: Li, Fangyuan, et autres
Publié: (2026)
Enhancing Adversarial Transferability via Information Bottleneck Constraints
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Exploring Adversarial Robustness of Deep State Space Models
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Interactive Continual Learning: Fast and Slow Thinking
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
PDAC: Efficient Coreset Selection for Continual Learning via Probability Density Awareness
par: Gao, Junqi, et autres
Publié: (2025)
par: Gao, Junqi, et autres
Publié: (2025)
Bohdi: Heterogeneous LLM Fusion with Automatic Data Exploration
par: Gao, Junqi, et autres
Publié: (2025)
par: Gao, Junqi, et autres
Publié: (2025)
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
par: Gao, Junqi, et autres
Publié: (2024)
par: Gao, Junqi, et autres
Publié: (2024)
Less is More: Efficient Weight Farcasting with 1-Layer Neural Network
par: Shou, Xiao, et autres
Publié: (2025)
par: Shou, Xiao, et autres
Publié: (2025)
Achieving More with Less: A Tensor-Optimization-Powered Ensemble Method
par: Yuan, Jinghui, et autres
Publié: (2024)
par: Yuan, Jinghui, et autres
Publié: (2024)
More with Less: An Empirical Study of Turn-Control Strategies for Efficient Coding Agents
par: Gao, Pengfei, et autres
Publié: (2025)
par: Gao, Pengfei, et autres
Publié: (2025)
Less is More: Parameter-Efficient Selection of Intermediate Tasks for Transfer Learning
par: Schulte, David, et autres
Publié: (2024)
par: Schulte, David, et autres
Publié: (2024)
Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning
par: Zhang, Zhi, et autres
Publié: (2026)
par: Zhang, Zhi, et autres
Publié: (2026)
Less is More: Non-uniform Road Segments are Efficient for Bus Arrival Prediction
par: Huang, Zhen, et autres
Publié: (2025)
par: Huang, Zhen, et autres
Publié: (2025)
Nirvana: A Specialized Generalist Model With Task-Aware Memory Mechanism
par: Jiang, Yuhua, et autres
Publié: (2025)
par: Jiang, Yuhua, et autres
Publié: (2025)
When Less Is More: Binary Feedback Can Outperform Ordinal Comparisons in Ranking Recovery
par: Xu, Shirong, et autres
Publié: (2025)
par: Xu, Shirong, et autres
Publié: (2025)
Superpose Task-specific Features for Model Merging
par: Qiu, Haiquan, et autres
Publié: (2025)
par: Qiu, Haiquan, et autres
Publié: (2025)
MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation
par: Wang, Shijie, et autres
Publié: (2026)
par: Wang, Shijie, et autres
Publié: (2026)
No More, No Less: Task Alignment in Terminal Agents
par: Mavali, Sina, et autres
Publié: (2026)
par: Mavali, Sina, et autres
Publié: (2026)
Task Vector Quantization for Memory-Efficient Model Merging
par: Kim, Youngeun, et autres
Publié: (2025)
par: Kim, Youngeun, et autres
Publié: (2025)
SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning
par: Shen, Shuaike, et autres
Publié: (2025)
par: Shen, Shuaike, et autres
Publié: (2025)
Less Approximates More: Harmonizing Performance and Confidence Faithfulness via Hybrid Post-Training for High-Stakes Tasks
par: Ma, Haokai, et autres
Publié: (2026)
par: Ma, Haokai, et autres
Publié: (2026)
AdaMerging: Adaptive Model Merging for Multi-Task Learning
par: Yang, Enneng, et autres
Publié: (2023)
par: Yang, Enneng, et autres
Publié: (2023)
Transformer Multivariate Forecasting: Less is More?
par: Xu, Jingjing, et autres
Publié: (2023)
par: Xu, Jingjing, et autres
Publié: (2023)
Less is More for Improving Automatic Evaluation of Factual Consistency
par: Wang, Tong, et autres
Publié: (2024)
par: Wang, Tong, et autres
Publié: (2024)
Multi-Level Collaboration in Model Merging
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Less is More: Towards Simple Graph Contrastive Learning
par: Zhao, Yanan, et autres
Publié: (2025)
par: Zhao, Yanan, et autres
Publié: (2025)
Cut Less, Fold More: Model Compression through the Lens of Projection Geometry
par: Saukh, Olga, et autres
Publié: (2026)
par: Saukh, Olga, et autres
Publié: (2026)
Less is More: on the Over-Globalizing Problem in Graph Transformers
par: Xing, Yujie, et autres
Publié: (2024)
par: Xing, Yujie, et autres
Publié: (2024)
Model Merging in the Essential Subspace
par: Li, Longhua, et autres
Publié: (2026)
par: Li, Longhua, et autres
Publié: (2026)
Less is More: Empowering GUI Agent with Context-Aware Simplification
par: Chen, Gongwei, et autres
Publié: (2025)
par: Chen, Gongwei, et autres
Publié: (2025)
LIMR: Less is More for RL Scaling
par: Li, Xuefeng, et autres
Publié: (2025)
par: Li, Xuefeng, et autres
Publié: (2025)
MergeNet: Knowledge Migration across Heterogeneous Models, Tasks, and Modalities
par: Li, Kunxi, et autres
Publié: (2024)
par: Li, Kunxi, et autres
Publié: (2024)
Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent
par: Wei, Yongxian, et autres
Publié: (2025)
par: Wei, Yongxian, et autres
Publié: (2025)
No More, No Less: Least-Privilege Language Models
par: Rauba, Paulius, et autres
Publié: (2026)
par: Rauba, Paulius, et autres
Publié: (2026)
Less or More From Teacher: Exploiting Trilateral Geometry For Knowledge Distillation
par: Hu, Chengming, et autres
Publié: (2023)
par: Hu, Chengming, et autres
Publié: (2023)
Documents similaires
-
Auto-FlexSwitch: Efficient Dynamic Model Merging via Learnable Task Vector Compression
par: Gao, Junqi, et autres
Publié: (2026) -
Fast and Slow Gradient Approximation for Binary Neural Network Optimization
par: Chen, Xinquan, et autres
Publié: (2024) -
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024) -
An Efficient Memory Module for Graph Few-Shot Class-Incremental Learning
par: Li, Dong, et autres
Publié: (2024) -
SMR: State Memory Replay for Long Sequence Modeling
par: Qi, Biqing, et autres
Publié: (2024)