Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Weihong, Sun, Lin, Shi, Qilong, Yuan, Aomufei, Tian, Yuxuan, Wang, Zhengyang, Zhao, Guangxiang, Zhang, Xiangzheng, Yang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Primer in Post-Training Reasoning Data: What We Know About How It Works
par: Li, Yaoming, et autres
Publié: (2026)
par: Li, Yaoming, et autres
Publié: (2026)
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
par: Zhao, Guangxiang, et autres
Publié: (2026)
par: Zhao, Guangxiang, et autres
Publié: (2026)
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
par: Zhu, Yongfu, et autres
Publié: (2025)
par: Zhu, Yongfu, et autres
Publié: (2025)
TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought
par: Si, Jianfeng, et autres
Publié: (2026)
par: Si, Jianfeng, et autres
Publié: (2026)
Localize-and-Stitch: Efficient Model Merging via Sparse Task Arithmetic
par: He, Yifei, et autres
Publié: (2024)
par: He, Yifei, et autres
Publié: (2024)
Prediction Is All MoE Needs: Expert Load Distribution Goes from Fluctuating to Stabilizing
par: Cong, Peizhuang, et autres
Publié: (2024)
par: Cong, Peizhuang, et autres
Publié: (2024)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
par: Yao, Yilun, et autres
Publié: (2026)
par: Yao, Yilun, et autres
Publié: (2026)
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
par: Zhao, Guangxiang, et autres
Publié: (2025)
par: Zhao, Guangxiang, et autres
Publié: (2025)
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
par: Zhao, Bingzhe, et autres
Publié: (2025)
par: Zhao, Bingzhe, et autres
Publié: (2025)
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling
par: Ran, Junfeng, et autres
Publié: (2025)
par: Ran, Junfeng, et autres
Publié: (2025)
BiCo-Fusion: Bidirectional Complementary LiDAR-Camera Fusion for Semantic- and Spatial-Aware 3D Object Detection
par: Song, Yang, et autres
Publié: (2024)
par: Song, Yang, et autres
Publié: (2024)
Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision
par: Zhu, Dawei, et autres
Publié: (2025)
par: Zhu, Dawei, et autres
Publié: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025)
par: Tian, Yuxuan, et autres
Publié: (2025)
One Size Does Not Fit All: A Distribution-Aware Sparsification for More Precise Model Merging
par: Luo, Yingfeng, et autres
Publié: (2025)
par: Luo, Yingfeng, et autres
Publié: (2025)
MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging
par: Wang, Yuanyi, et autres
Publié: (2026)
par: Wang, Yuanyi, et autres
Publié: (2026)
The Immersed Discontinuous Galerkin Method for Elliptic Interface Problems
par: Yang, Lin, et autres
Publié: (2026)
par: Yang, Lin, et autres
Publié: (2026)
The Immersed Skeletal Finite Element Method for Elliptic Interface Problems
par: Yang, Lin, et autres
Publié: (2024)
par: Yang, Lin, et autres
Publié: (2024)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
par: Yuan, Zenghui, et autres
Publié: (2025)
par: Yuan, Zenghui, et autres
Publié: (2025)
KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction
par: Yuan, Aomufei, et autres
Publié: (2025)
par: Yuan, Aomufei, et autres
Publié: (2025)
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
par: Zhao, Qiuming, et autres
Publié: (2025)
par: Zhao, Qiuming, et autres
Publié: (2025)
A remark on $Λ^2$-enlargeable manifolds
par: Su, Guangxiang
Publié: (2025)
par: Su, Guangxiang
Publié: (2025)
Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training
par: Si, Jianfeng, et autres
Publié: (2025)
par: Si, Jianfeng, et autres
Publié: (2025)
BadMerging: Backdoor Attacks Against Model Merging
par: Zhang, Jinghuai, et autres
Publié: (2024)
par: Zhang, Jinghuai, et autres
Publié: (2024)
CABS: Conflict-Aware and Balanced Sparsification for Enhancing Model Merging
par: Yang, Zongzhen, et autres
Publié: (2025)
par: Yang, Zongzhen, et autres
Publié: (2025)
Exploring Sparse Adapters for Scalable Merging of Parameter Efficient Experts
par: Arnob, Samin Yeasar, et autres
Publié: (2025)
par: Arnob, Samin Yeasar, et autres
Publié: (2025)
SparseTSF: Modeling Long-term Time Series Forecasting with 1k Parameters
par: Lin, Shengsheng, et autres
Publié: (2024)
par: Lin, Shengsheng, et autres
Publié: (2024)
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Models
par: Liu, Shuqi, et autres
Publié: (2025)
par: Liu, Shuqi, et autres
Publié: (2025)
Complementary Fusion of Deep Network and Tree Model for ETA Prediction
par: Huang, YuRui, et autres
Publié: (2024)
par: Huang, YuRui, et autres
Publié: (2024)
DC-Merge: Improving Model Merging with Directional Consistency
par: Zhang, Han-Chen, et autres
Publié: (2026)
par: Zhang, Han-Chen, et autres
Publié: (2026)
Position-Aware Parameter Efficient Fine-Tuning Approach for Reducing Positional Bias in LLMs
par: Zhang, Zheng, et autres
Publié: (2024)
par: Zhang, Zheng, et autres
Publié: (2024)
CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond
par: Shi, Yukai, et autres
Publié: (2025)
par: Shi, Yukai, et autres
Publié: (2025)
The Predictive Effects of Sociobiographical Variables, English Learning Confidence, and Digital Competence on AI‐Mediated Informal Digital Learning of English (AI‐IDLE)
par: Guangxiang Leon Liu, et autres
Publié: (2025)
par: Guangxiang Leon Liu, et autres
Publié: (2025)
Rethinking Retrieval-Augmentation as Synthesis: A Query-Aware Context Merging Approach
par: Guo, Jiarui, et autres
Publié: (2026)
par: Guo, Jiarui, et autres
Publié: (2026)
Mitigating Parameter Interference in Model Merging via Sharpness-Aware Fine-Tuning
par: Lee, Yeoreum, et autres
Publié: (2025)
par: Lee, Yeoreum, et autres
Publié: (2025)
Symmetry-Aware Graph Metanetwork Autoencoders: Model Merging through Parameter Canonicalization
par: Boufalis, Odysseas, et autres
Publié: (2025)
par: Boufalis, Odysseas, et autres
Publié: (2025)
1bit-Merging: Dynamic Quantized Merging for Large Language Models
par: Liu, Shuqi, et autres
Publié: (2025)
par: Liu, Shuqi, et autres
Publié: (2025)
Assignment-Routing Optimization with Cutting-Plane Subtour Elimination: Solver and Benchmark Dataset
par: Yuan, Qilong
Publié: (2025)
par: Yuan, Qilong
Publié: (2025)
An Efficient and Almost Optimal Solver for the Joint Routing-Assignment Problem via Partial JRA and Large-α Optimization
par: Yuan, Qilong
Publié: (2025)
par: Yuan, Qilong
Publié: (2025)
Documents similaires
-
A Primer in Post-Training Reasoning Data: What We Know About How It Works
par: Li, Yaoming, et autres
Publié: (2026) -
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
par: Zhao, Guangxiang, et autres
Publié: (2026) -
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
par: Zhu, Yongfu, et autres
Publié: (2025) -
TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
par: Sun, Lin, et autres
Publié: (2025) -
Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought
par: Si, Jianfeng, et autres
Publié: (2026)