Multi-task Code LLMs: Data Mix or Model Merge?
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Mingzhi, Sobolev, Boris, Krishna, Rahul, Pavuluri, Raju, Patterson, Stacy, Merler, Michele |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing
di: Zhu, Mingzhi, et al.
Pubblicazione: (2026)
di: Zhu, Mingzhi, et al.
Pubblicazione: (2026)
Merge to Mix: Mixing Datasets via Model Merging
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
Training-free LLM Merging for Multi-task Learning
di: Fu, Zichuan, et al.
Pubblicazione: (2025)
di: Fu, Zichuan, et al.
Pubblicazione: (2025)
When MOE Meets LLMs: Parameter Efficient Fine-tuning for Multi-task Medical Applications
di: Liu, Qidong, et al.
Pubblicazione: (2023)
di: Liu, Qidong, et al.
Pubblicazione: (2023)
From Human Judgements to Predictive Models: Unravelling Acceptability in Code-Mixed Sentences
di: Kodali, Prashant, et al.
Pubblicazione: (2024)
di: Kodali, Prashant, et al.
Pubblicazione: (2024)
REAM: Merging Improves Pruning of Experts in LLMs
di: Jha, Saurav, et al.
Pubblicazione: (2026)
di: Jha, Saurav, et al.
Pubblicazione: (2026)
Granite Code Models: A Family of Open Foundation Models for Code Intelligence
di: Mishra, Mayank, et al.
Pubblicazione: (2024)
di: Mishra, Mayank, et al.
Pubblicazione: (2024)
Code-Mixer Ya Nahi: Novel Approaches to Measuring Multilingual LLMs' Code-Mixing Capabilities
di: Gupta, Ayushman, et al.
Pubblicazione: (2024)
di: Gupta, Ayushman, et al.
Pubblicazione: (2024)
Pruning via Merging: Compressing LLMs via Manifold Alignment Based Layer Merging
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation
di: Cooray, Lakshan, et al.
Pubblicazione: (2026)
di: Cooray, Lakshan, et al.
Pubblicazione: (2026)
Generalizable Chain-of-Thought Prompting in Mixed-task Scenarios with Large Language Models
di: Zou, Anni, et al.
Pubblicazione: (2023)
di: Zou, Anni, et al.
Pubblicazione: (2023)
Trustful LLMs: Customizing and Grounding Text Generation with Knowledge Bases and Dual Decoders
di: Zhu, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhu, Xiaofeng, et al.
Pubblicazione: (2024)
HM3: Heterogeneous Multi-Class Model Merging
di: Hackmann, Stefan
Pubblicazione: (2024)
di: Hackmann, Stefan
Pubblicazione: (2024)
The Thinking Spectrum: An Empirical Study of Tunable Reasoning in LLMs through Model Merging
di: Lan, Xiaochong, et al.
Pubblicazione: (2025)
di: Lan, Xiaochong, et al.
Pubblicazione: (2025)
DPPA: Pruning Method for Large Language Model to Model Merging
di: Zhu, Yaochen, et al.
Pubblicazione: (2024)
di: Zhu, Yaochen, et al.
Pubblicazione: (2024)
CTourLLM: Enhancing LLMs with Chinese Tourism Knowledge
di: Wei, Qikai, et al.
Pubblicazione: (2024)
di: Wei, Qikai, et al.
Pubblicazione: (2024)
Multi-Stage Evolutionary Model Merging with Meta Data Driven Curriculum Learning for Sentiment-Specialized Large Language Modeling
di: Inoshita, Keito, et al.
Pubblicazione: (2026)
di: Inoshita, Keito, et al.
Pubblicazione: (2026)
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
di: Iacobelli, Mario, et al.
Pubblicazione: (2026)
di: Iacobelli, Mario, et al.
Pubblicazione: (2026)
SuperMerge: An Approach For Gradient-Based Model Merging
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks
di: Jain, Purvam, et al.
Pubblicazione: (2026)
di: Jain, Purvam, et al.
Pubblicazione: (2026)
Fake News Detection: Comparative Evaluation of BERT-like Models and Large Language Models with Generative AI-Annotated Data
di: Raza, Shaina, et al.
Pubblicazione: (2024)
di: Raza, Shaina, et al.
Pubblicazione: (2024)
How Reliable are LLMs for Reasoning on the Re-ranking task?
di: Islam, Nafis Tanveer, et al.
Pubblicazione: (2025)
di: Islam, Nafis Tanveer, et al.
Pubblicazione: (2025)
Persona-Coded Poly-Encoder: Persona-Guided Multi-Stream Conversational Sentence Scoring
di: Liu, Junfeng, et al.
Pubblicazione: (2023)
di: Liu, Junfeng, et al.
Pubblicazione: (2023)
Transport and Merge: Cross-Architecture Merging for Large Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
Deploying Multi-task Online Server with Large Language Model
di: Qu, Yincen, et al.
Pubblicazione: (2024)
di: Qu, Yincen, et al.
Pubblicazione: (2024)
Usage, Effects and Requirements for AI Coding Assistants in the Enterprise: An Empirical Study
di: Vukovic, Maja, et al.
Pubblicazione: (2026)
di: Vukovic, Maja, et al.
Pubblicazione: (2026)
A Critical Study of What Code-LLMs (Do Not) Learn
di: Anand, Abhinav, et al.
Pubblicazione: (2024)
di: Anand, Abhinav, et al.
Pubblicazione: (2024)
Adapting Language-Specific LLMs to a Reasoning Model in One Day via Model Merging -- An Open Recipe
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2025)
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2025)
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging
di: Chen, Zijun, et al.
Pubblicazione: (2025)
di: Chen, Zijun, et al.
Pubblicazione: (2025)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
di: Kadhe, Swanand Ravindra, et al.
Pubblicazione: (2024)
di: Kadhe, Swanand Ravindra, et al.
Pubblicazione: (2024)
Large Language Model as a Universal Clinical Multi-task Decoder
di: Wu, Yujiang, et al.
Pubblicazione: (2024)
di: Wu, Yujiang, et al.
Pubblicazione: (2024)
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
QCG-Rerank: Chunks Graph Rerank with Query Expansion in Retrieval-Augmented LLMs for Tourism Domain
di: Wei, Qikai, et al.
Pubblicazione: (2024)
di: Wei, Qikai, et al.
Pubblicazione: (2024)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
LoRE-Merging: Exploring Low-Rank Estimation For Large Language Model Merging
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
di: Ma, Qianli, et al.
Pubblicazione: (2025)
di: Ma, Qianli, et al.
Pubblicazione: (2025)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing
di: Zhu, Mingzhi, et al.
Pubblicazione: (2026) -
Merge to Mix: Mixing Datasets via Model Merging
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025) -
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025) -
Training-free LLM Merging for Multi-task Learning
di: Fu, Zichuan, et al.
Pubblicazione: (2025) -
When MOE Meets LLMs: Parameter Efficient Fine-tuning for Multi-task Medical Applications
di: Liu, Qidong, et al.
Pubblicazione: (2023)