Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berasi, Davide, Farina, Matteo, Mancini, Massimiliano, Ricci, Elisa |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
par: Berasi, Davide, et autres
Publié: (2025)
par: Berasi, Davide, et autres
Publié: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
XFT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts
par: Ding, Yifeng, et autres
Publié: (2024)
par: Ding, Yifeng, et autres
Publié: (2024)
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
par: Wen, Bingbing, et autres
Publié: (2026)
par: Wen, Bingbing, et autres
Publié: (2026)
Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
par: Ye, Jiasheng, et autres
Publié: (2024)
par: Ye, Jiasheng, et autres
Publié: (2024)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
par: Yang, Jinluan, et autres
Publié: (2025)
par: Yang, Jinluan, et autres
Publié: (2025)
MoM: Linear Sequence Modeling with Mixture-of-Memories
par: Du, Jusen, et autres
Publié: (2025)
par: Du, Jusen, et autres
Publié: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
par: Luo, Ruilin, et autres
Publié: (2025)
par: Luo, Ruilin, et autres
Publié: (2025)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
par: Ibrahim, Adam, et autres
Publié: (2024)
par: Ibrahim, Adam, et autres
Publié: (2024)
Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging
par: Hui, Tingfeng, et autres
Publié: (2024)
par: Hui, Tingfeng, et autres
Publié: (2024)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
par: Farina, Matteo, et autres
Publié: (2025)
par: Farina, Matteo, et autres
Publié: (2025)
Merge to Mix: Mixing Datasets via Model Merging
par: Tao, Zhixu Silvia, et autres
Publié: (2025)
par: Tao, Zhixu Silvia, et autres
Publié: (2025)
Classifier-to-Bias: Toward Unsupervised Automatic Bias Detection for Visual Classifiers
par: Guimard, Quentin, et autres
Publié: (2025)
par: Guimard, Quentin, et autres
Publié: (2025)
Twin-Merging: Dynamic Integration of Modular Expertise in Model Merging
par: Lu, Zhenyi, et autres
Publié: (2024)
par: Lu, Zhenyi, et autres
Publié: (2024)
Data-driven Clustering and Merging of Adapters for On-device Large Language Models
par: Bohdal, Ondrej, et autres
Publié: (2026)
par: Bohdal, Ondrej, et autres
Publié: (2026)
Arcee's MergeKit: A Toolkit for Merging Large Language Models
par: Goddard, Charles, et autres
Publié: (2024)
par: Goddard, Charles, et autres
Publié: (2024)
Model Merging for Knowledge Editing
par: Fu, Zichuan, et autres
Publié: (2025)
par: Fu, Zichuan, et autres
Publié: (2025)
K-Merge: Online Continual Merging of Adapters for On-device Large Language Models
par: Shenaj, Donald, et autres
Publié: (2025)
par: Shenaj, Donald, et autres
Publié: (2025)
LLMSurgeon: Diagnosing Data Mixture of Large Language Models
par: Luo, Yaxin, et autres
Publié: (2026)
par: Luo, Yaxin, et autres
Publié: (2026)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
par: Foroutan, Negar, et autres
Publié: (2025)
par: Foroutan, Negar, et autres
Publié: (2025)
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
Dynamic Model Merging Made Slim
par: Du, Guodong, et autres
Publié: (2026)
par: Du, Guodong, et autres
Publié: (2026)
What Matters for Model Merging at Scale?
par: Yadav, Prateek, et autres
Publié: (2024)
par: Yadav, Prateek, et autres
Publié: (2024)
Channel Merging: Preserving Specialization for Merged Experts
par: Zhang, Mingyang, et autres
Publié: (2024)
par: Zhang, Mingyang, et autres
Publié: (2024)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
par: Jiang, Ruixiang, et autres
Publié: (2024)
par: Jiang, Ruixiang, et autres
Publié: (2024)
Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMs
par: Yang, Hongming, et autres
Publié: (2025)
par: Yang, Hongming, et autres
Publié: (2025)
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
par: Guimard, Quentin, et autres
Publié: (2026)
par: Guimard, Quentin, et autres
Publié: (2026)
STAR: Spectral Truncation and Rescale for Model Merging
par: Lee, Yu-Ang, et autres
Publié: (2025)
par: Lee, Yu-Ang, et autres
Publié: (2025)
Fisher Mask Nodes for Language Model Merging
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Model Merging by Uncertainty-Based Gradient Matching
par: Daheim, Nico, et autres
Publié: (2023)
par: Daheim, Nico, et autres
Publié: (2023)
Optimal Brain Iterative Merging: Mitigating Interference in LLM Merging
par: Wang, Zhixiang, et autres
Publié: (2025)
par: Wang, Zhixiang, et autres
Publié: (2025)
Model Assembly Learning with Heterogeneous Layer Weight Merging
par: Zhang, Yi-Kai, et autres
Publié: (2025)
par: Zhang, Yi-Kai, et autres
Publié: (2025)
Merging Text Transformer Models from Different Initializations
par: Verma, Neha, et autres
Publié: (2024)
par: Verma, Neha, et autres
Publié: (2024)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
par: Li, Ziniu, et autres
Publié: (2025)
par: Li, Ziniu, et autres
Publié: (2025)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
par: Kadhe, Swanand Ravindra, et autres
Publié: (2024)
par: Kadhe, Swanand Ravindra, et autres
Publié: (2024)
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
par: Sun, Weigao, et autres
Publié: (2025)
par: Sun, Weigao, et autres
Publié: (2025)
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
Merge-of-Thought Distillation
par: Shen, Zhanming, et autres
Publié: (2025)
par: Shen, Zhanming, et autres
Publié: (2025)
LeMoLE: LLM-Enhanced Mixture of Linear Experts for Time Series Forecasting
par: Zhang, Lingzheng, et autres
Publié: (2024)
par: Zhang, Lingzheng, et autres
Publié: (2024)
Documents similaires
-
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
par: Berasi, Davide, et autres
Publié: (2025) -
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
par: Gu, Naibin, et autres
Publié: (2025) -
XFT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts
par: Ding, Yifeng, et autres
Publié: (2024) -
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
par: Wen, Bingbing, et autres
Publié: (2026) -
Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
par: Ye, Jiasheng, et autres
Publié: (2024)