Extrapolation Merging: Keep Improving With Extrapolation and Merging
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Yiguan, Xu, Bin, Li, Yinghao, Gao, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SRA-MCTS: Self-driven Reasoning Augmentation with Monte Carlo Tree Search for Code Generation
di: Xu, Bin, et al.
Pubblicazione: (2024)
di: Xu, Bin, et al.
Pubblicazione: (2024)
Scaling Laws of RoPE-based Extrapolation
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)
SuperMerge: An Approach For Gradient-Based Model Merging
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
Large Language Models for Extrapolative Modeling of Manufacturing Processes
di: Khanghah, Kiarash Naghavi, et al.
Pubblicazione: (2025)
di: Khanghah, Kiarash Naghavi, et al.
Pubblicazione: (2025)
Transport and Merge: Cross-Architecture Merging for Large Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
di: Yang, Wenkai, et al.
Pubblicazione: (2026)
di: Yang, Wenkai, et al.
Pubblicazione: (2026)
Extrapolation by Association: Length Generalization Transfer in Transformers
di: Cai, Ziyang, et al.
Pubblicazione: (2025)
di: Cai, Ziyang, et al.
Pubblicazione: (2025)
Model Extrapolation Expedites Alignment
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
Pruning via Merging: Compressing LLMs via Manifold Alignment Based Layer Merging
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
Effective Length Extrapolation via Dimension-Wise Positional Embeddings Manipulation
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
Merging Improves Self-Critique Against Jailbreak Attacks
di: Gallego, Victor
Pubblicazione: (2024)
di: Gallego, Victor
Pubblicazione: (2024)
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging
di: Chen, Zijun, et al.
Pubblicazione: (2025)
di: Chen, Zijun, et al.
Pubblicazione: (2025)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
di: Li, Zongjie, et al.
Pubblicazione: (2023)
di: Li, Zongjie, et al.
Pubblicazione: (2023)
Channel Merging: Preserving Specialization for Merged Experts
di: Zhang, Mingyang, et al.
Pubblicazione: (2024)
di: Zhang, Mingyang, et al.
Pubblicazione: (2024)
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
Optimal Brain Iterative Merging: Mitigating Interference in LLM Merging
di: Wang, Zhixiang, et al.
Pubblicazione: (2025)
di: Wang, Zhixiang, et al.
Pubblicazione: (2025)
RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
di: Yang, Junyao, et al.
Pubblicazione: (2025)
di: Yang, Junyao, et al.
Pubblicazione: (2025)
LoRE-Merging: Exploring Low-Rank Estimation For Large Language Model Merging
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
di: Ma, Qianli, et al.
Pubblicazione: (2025)
di: Ma, Qianli, et al.
Pubblicazione: (2025)
Merge to Mix: Mixing Datasets via Model Merging
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
EpiCoDe: Boosting Model Performance Beyond Training with Extrapolation and Contrastive Decoding
di: Tao, Mingxu, et al.
Pubblicazione: (2025)
di: Tao, Mingxu, et al.
Pubblicazione: (2025)
Batching BPE Tokenization Merges
di: Morgan, Alexander P.
Pubblicazione: (2024)
di: Morgan, Alexander P.
Pubblicazione: (2024)
Softplus Attention with Re-weighting Boosts Length Extrapolation in Large Language Models
di: Gao, Bo, et al.
Pubblicazione: (2025)
di: Gao, Bo, et al.
Pubblicazione: (2025)
Dynamic Model Merging Made Slim
di: Du, Guodong, et al.
Pubblicazione: (2026)
di: Du, Guodong, et al.
Pubblicazione: (2026)
A Training-Free Length Extrapolation Approach for LLMs: Greedy Attention Logit Interpolation (GALI)
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
Twin-Merging: Dynamic Integration of Modular Expertise in Model Merging
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
AdaMergeX: Cross-Lingual Transfer with Large Language Models via Adaptive Adapter Merging
di: Zhao, Yiran, et al.
Pubblicazione: (2024)
di: Zhao, Yiran, et al.
Pubblicazione: (2024)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
di: Xiao, Chaojun, et al.
Pubblicazione: (2024)
di: Xiao, Chaojun, et al.
Pubblicazione: (2024)
Two Stones Hit One Bird: Bilevel Positional Encoding for Better Length Extrapolation
di: He, Zhenyu, et al.
Pubblicazione: (2024)
di: He, Zhenyu, et al.
Pubblicazione: (2024)
REAM: Merging Improves Pruning of Experts in LLMs
di: Jha, Saurav, et al.
Pubblicazione: (2026)
di: Jha, Saurav, et al.
Pubblicazione: (2026)
Arcee's MergeKit: A Toolkit for Merging Large Language Models
di: Goddard, Charles, et al.
Pubblicazione: (2024)
di: Goddard, Charles, et al.
Pubblicazione: (2024)
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
di: Saha, Swarnadeep, et al.
Pubblicazione: (2023)
di: Saha, Swarnadeep, et al.
Pubblicazione: (2023)
Merge-of-Thought Distillation
di: Shen, Zhanming, et al.
Pubblicazione: (2025)
di: Shen, Zhanming, et al.
Pubblicazione: (2025)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
di: He, Jiashu, et al.
Pubblicazione: (2025)
di: He, Jiashu, et al.
Pubblicazione: (2025)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation
di: He, Jiashu, et al.
Pubblicazione: (2024)
di: He, Jiashu, et al.
Pubblicazione: (2024)
Improving Training Efficiency and Reducing Maintenance Costs via Language Specific Model Merging
di: Dmonte, Alphaeus, et al.
Pubblicazione: (2026)
di: Dmonte, Alphaeus, et al.
Pubblicazione: (2026)
K-Merge: Online Continual Merging of Adapters for On-device Large Language Models
di: Shenaj, Donald, et al.
Pubblicazione: (2025)
di: Shenaj, Donald, et al.
Pubblicazione: (2025)
Model Merging for Knowledge Editing
di: Fu, Zichuan, et al.
Pubblicazione: (2025)
di: Fu, Zichuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SRA-MCTS: Self-driven Reasoning Augmentation with Monte Carlo Tree Search for Code Generation
di: Xu, Bin, et al.
Pubblicazione: (2024) -
Scaling Laws of RoPE-based Extrapolation
di: Liu, Xiaoran, et al.
Pubblicazione: (2023) -
SuperMerge: An Approach For Gradient-Based Model Merging
di: Yang, Haoyu, et al.
Pubblicazione: (2024) -
Large Language Models for Extrapolative Modeling of Manufacturing Processes
di: Khanghah, Kiarash Naghavi, et al.
Pubblicazione: (2025) -
Transport and Merge: Cross-Architecture Merging for Large Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2026)