Salvato in:
| Autori principali: | Wang, Zihao, Yang, Enneng, Yin, Lu, Liu, Shiwei, Shen, Li |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2509.01548 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AdaMerging: Adaptive Model Merging for Multi-Task Learning
di: Yang, Enneng, et al.
Pubblicazione: (2023)
di: Yang, Enneng, et al.
Pubblicazione: (2023)
Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging
di: Tang, Anke, et al.
Pubblicazione: (2025)
di: Tang, Anke, et al.
Pubblicazione: (2025)
Representation Surgery for Multi-Task Model Merging
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
LOST: Low-rank and Sparse Pre-training for Large Language Models
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
Generalized Embedding Machines for Recommender Systems
di: Yang, Enneng, et al.
Pubblicazione: (2020)
di: Yang, Enneng, et al.
Pubblicazione: (2020)
Continual Learning From a Stream of APIs
di: Yang, Enneng, et al.
Pubblicazione: (2023)
di: Yang, Enneng, et al.
Pubblicazione: (2023)
The Curse of Depth in Large Language Models
di: Sun, Wenfang, et al.
Pubblicazione: (2025)
di: Sun, Wenfang, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Forgetting in Deep Learning Beyond Continual Learning
di: Wang, Zhenyi, et al.
Pubblicazione: (2023)
di: Wang, Zhenyi, et al.
Pubblicazione: (2023)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
Distributionally Robust Graph Out-of-Distribution Recommendation via Diffusion Model
di: Zhao, Chu, et al.
Pubblicazione: (2025)
di: Zhao, Chu, et al.
Pubblicazione: (2025)
Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN
di: Li, Pengxiang, et al.
Pubblicazione: (2024)
di: Li, Pengxiang, et al.
Pubblicazione: (2024)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
di: Shen, Li, et al.
Pubblicazione: (2024)
di: Shen, Li, et al.
Pubblicazione: (2024)
Making Models Unmergeable via Scaling-Sensitive Loss Landscape
di: Jang, Minwoo, et al.
Pubblicazione: (2026)
di: Jang, Minwoo, et al.
Pubblicazione: (2026)
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
di: Lu, Haiquan, et al.
Pubblicazione: (2024)
di: Lu, Haiquan, et al.
Pubblicazione: (2024)
DBR: Divergence-Based Regularization for Debiasing Natural Language Understanding Models
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
Layer Collapse in Diffusion Language Models
di: Conzelmann, Alexander, et al.
Pubblicazione: (2026)
di: Conzelmann, Alexander, et al.
Pubblicazione: (2026)
Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Privacy-Preserving Hybrid Ensemble Model for Network Anomaly Detection: Balancing Security and Data Protection
di: Liu, Shaobo, et al.
Pubblicazione: (2025)
di: Liu, Shaobo, et al.
Pubblicazione: (2025)
Towards Efficient Pareto Set Approximation via Mixture of Experts Based Model Fusion
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2024)
di: Li, Pengxiang, et al.
Pubblicazione: (2024)
Believe Your Model: Distribution-Guided Confidence Calibration
di: Yang, Xizhong, et al.
Pubblicazione: (2026)
di: Yang, Xizhong, et al.
Pubblicazione: (2026)
ActTail: Global Activation Sparsity in Large Language Models
di: Hou, Wenwen, et al.
Pubblicazione: (2026)
di: Hou, Wenwen, et al.
Pubblicazione: (2026)
ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning
di: Zhao, Chu, et al.
Pubblicazione: (2026)
di: Zhao, Chu, et al.
Pubblicazione: (2026)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs
di: Yin, Lu, et al.
Pubblicazione: (2023)
di: Yin, Lu, et al.
Pubblicazione: (2023)
One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs
di: He, Di, et al.
Pubblicazione: (2026)
di: He, Di, et al.
Pubblicazione: (2026)
Compression Repair for Feedforward Neural Networks Based on Model Equivalence Evaluation
di: Mo, Zihao, et al.
Pubblicazione: (2024)
di: Mo, Zihao, et al.
Pubblicazione: (2024)
Attribute-Efficient PAC Learning of Sparse Halfspaces with Constant Malicious Noise Rate
di: Zeng, Shiwei, et al.
Pubblicazione: (2025)
di: Zeng, Shiwei, et al.
Pubblicazione: (2025)
Conformalized Exceptional Model Mining: Telling Where Your Model Performs (Not) Well
di: Du, Xin, et al.
Pubblicazione: (2025)
di: Du, Xin, et al.
Pubblicazione: (2025)
Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations
di: Li, Kevin Y., et al.
Pubblicazione: (2026)
di: Li, Kevin Y., et al.
Pubblicazione: (2026)
LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
ModelLock: Locking Your Model With a Spell
di: Gao, Yifeng, et al.
Pubblicazione: (2024)
di: Gao, Yifeng, et al.
Pubblicazione: (2024)
Efficient Prompt Tuning by Multi-Space Projection and Prompt Fusion
di: Lan, Pengxiang, et al.
Pubblicazione: (2024)
di: Lan, Pengxiang, et al.
Pubblicazione: (2024)
Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model Compression
di: Wang, Jingcun, et al.
Pubblicazione: (2024)
di: Wang, Jingcun, et al.
Pubblicazione: (2024)
Unlocking Your Sales Insights: Advanced XGBoost Forecasting Models for Amazon Products
di: Wang, Meng, et al.
Pubblicazione: (2024)
di: Wang, Meng, et al.
Pubblicazione: (2024)
Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation
di: Yang, Xinyu, et al.
Pubblicazione: (2025)
di: Yang, Xinyu, et al.
Pubblicazione: (2025)
AlphaDecay: Module-wise Weight Decay for Heavy-Tailed Balancing in LLMs
di: He, Di, et al.
Pubblicazione: (2025)
di: He, Di, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AdaMerging: Adaptive Model Merging for Multi-Task Learning
di: Yang, Enneng, et al.
Pubblicazione: (2023) -
Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging
di: Tang, Anke, et al.
Pubblicazione: (2025) -
Representation Surgery for Multi-Task Model Merging
di: Yang, Enneng, et al.
Pubblicazione: (2024) -
LOST: Low-rank and Sparse Pre-training for Large Language Models
di: Li, Jiaxi, et al.
Pubblicazione: (2025) -
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
di: Li, Jiaxi, et al.
Pubblicazione: (2026)