On the Limits of Model Merging for Multilinguality in Pre-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aycock, Seth, Vitiugin, Fedor, Umnov, Aleksandr, Monz, Christof, Sima'an, Khalil |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can LLMs Really Learn to Translate a Low-Resource Language from One Grammar Book?
par: Aycock, Seth, et autres
Publié: (2024)
par: Aycock, Seth, et autres
Publié: (2024)
Please Translate Again: Two Simple Experiments on Whether Human-Like Reasoning Helps Translation
par: Wu, Di, et autres
Publié: (2025)
par: Wu, Di, et autres
Publié: (2025)
Construction of Hyper-Relational Knowledge Graphs Using Pre-Trained Large Language Models
par: Datta, Preetha, et autres
Publié: (2024)
par: Datta, Preetha, et autres
Publié: (2024)
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
par: Rajaee, Sara, et autres
Publié: (2024)
par: Rajaee, Sara, et autres
Publié: (2024)
Beyond Shared Vocabulary: Increasing Representational Word Similarities across Languages for Multilingual Machine Translation
par: Wu, Di, et autres
Publié: (2023)
par: Wu, Di, et autres
Publié: (2023)
Disentangling the Roles of Target-Side Transfer and Regularization in Multilingual Machine Translation
par: Meng, Yan, et autres
Publié: (2024)
par: Meng, Yan, et autres
Publié: (2024)
Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling
par: Tan, Shaomu, et autres
Publié: (2025)
par: Tan, Shaomu, et autres
Publié: (2025)
The Effect of Language Diversity When Fine-Tuning Large Language Models for Translation
par: Stap, David, et autres
Publié: (2025)
par: Stap, David, et autres
Publié: (2025)
IKUN for WMT24 General MT Task: LLMs Are here for Multilingual Machine Translation
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
On the Evaluation Practices in Multilingual NLP: Can Machine Translation Offer an Alternative to Human Translations?
par: Choenni, Rochelle, et autres
Publié: (2024)
par: Choenni, Rochelle, et autres
Publié: (2024)
Is It a Free Lunch for Removing Outliers during Pretraining?
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
Do Language Models Reason Across Languages?
par: Meng, Yan, et autres
Publié: (2026)
par: Meng, Yan, et autres
Publié: (2026)
3-in-1: 2D Rotary Adaptation for Efficient Finetuning, Efficient Batching and Composability
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
Unraveling Code-Mixing Patterns in Migration Discourse: Automated Detection and Analysis of Online Conversations on Reddit
par: Vitiugin, Fedor, et autres
Publié: (2024)
par: Vitiugin, Fedor, et autres
Publié: (2024)
HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
par: Oepen, Stephan, et autres
Publié: (2025)
par: Oepen, Stephan, et autres
Publié: (2025)
Neuron Specialization: Leveraging intrinsic task modularity for multilingual machine translation
par: Tan, Shaomu, et autres
Publié: (2024)
par: Tan, Shaomu, et autres
Publié: (2024)
Calibrating Translation Decoding with Quality Estimation on LLMs
par: Wu, Di, et autres
Publié: (2025)
par: Wu, Di, et autres
Publié: (2025)
How Far Can 100 Samples Go? Unlocking Overall Zero-Shot Multilingual Translation via Tiny Multi-Parallel Data
par: Wu, Di, et autres
Publié: (2024)
par: Wu, Di, et autres
Publié: (2024)
How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine Translation
par: Meng, Yan, et autres
Publié: (2024)
par: Meng, Yan, et autres
Publié: (2024)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025)
par: Kytöniemi, Joona, et autres
Publié: (2025)
Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
par: Rajaee, Sara, et autres
Publié: (2025)
par: Rajaee, Sara, et autres
Publié: (2025)
ApiQ: Finetuning of 2-Bit Quantized Large Language Model
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
When Contextual Inference Fails: Cancelability in Interactive Instruction Following
par: Bila, Natalia, et autres
Publié: (2026)
par: Bila, Natalia, et autres
Publié: (2026)
Communicating with Speakers and Listeners of Different Pragmatic Levels
par: Naszadi, Kata, et autres
Publié: (2024)
par: Naszadi, Kata, et autres
Publié: (2024)
What Does Neuro Mean to Cardio? Investigating the Role of Clinical Specialty Data in Medical LLMs
par: Yan, Xinlan, et autres
Publié: (2025)
par: Yan, Xinlan, et autres
Publié: (2025)
The Fine-Tuning Paradox: Boosting Translation Quality Without Sacrificing LLM Abilities
par: Stap, David, et autres
Publié: (2024)
par: Stap, David, et autres
Publié: (2024)
Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training
par: Wang, Zhijun, et autres
Publié: (2025)
par: Wang, Zhijun, et autres
Publié: (2025)
Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
par: Xhelili, Orgest, et autres
Publié: (2024)
par: Xhelili, Orgest, et autres
Publié: (2024)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
How Important is `Perfect' English for Machine Translation Prompts?
par: Schmidtová, Patrícia, et autres
Publié: (2025)
par: Schmidtová, Patrícia, et autres
Publié: (2025)
Extend Model Merging from Fine-Tuned to Pre-Trained Large Language Models via Weight Disentanglement
par: Yu, Le, et autres
Publié: (2024)
par: Yu, Le, et autres
Publié: (2024)
Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations
par: Tan, Shaomu, et autres
Publié: (2025)
par: Tan, Shaomu, et autres
Publié: (2025)
The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models
par: Chen, Xinyi, et autres
Publié: (2024)
par: Chen, Xinyi, et autres
Publié: (2024)
ClusComp: A Simple Paradigm for Model Compression and Efficient Finetuning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
Model Merging in Pre-training of Large Language Models
par: Li, Yunshui, et autres
Publié: (2025)
par: Li, Yunshui, et autres
Publié: (2025)
Adapting Multilingual Models to Code-Mixed Tasks via Model Merging
par: Kodali, Prashant, et autres
Publié: (2025)
par: Kodali, Prashant, et autres
Publié: (2025)
Merge and Conquer: Instructing Multilingual Models by Adding Target Language Weights
par: Valero, Eneko, et autres
Publié: (2026)
par: Valero, Eneko, et autres
Publié: (2026)
Masks and Mimicry: Strategic Obfuscation and Impersonation Attacks on Authorship Verification
par: Alperin, Kenneth, et autres
Publié: (2025)
par: Alperin, Kenneth, et autres
Publié: (2025)
Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging
par: Farn, Hua, et autres
Publié: (2024)
par: Farn, Hua, et autres
Publié: (2024)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
par: Lee, Kunil, et autres
Publié: (2026)
par: Lee, Kunil, et autres
Publié: (2026)
Documents similaires
-
Can LLMs Really Learn to Translate a Low-Resource Language from One Grammar Book?
par: Aycock, Seth, et autres
Publié: (2024) -
Please Translate Again: Two Simple Experiments on Whether Human-Like Reasoning Helps Translation
par: Wu, Di, et autres
Publié: (2025) -
Construction of Hyper-Relational Knowledge Graphs Using Pre-Trained Large Language Models
par: Datta, Preetha, et autres
Publié: (2024) -
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
par: Rajaee, Sara, et autres
Publié: (2024) -
Beyond Shared Vocabulary: Increasing Representational Word Similarities across Languages for Multilingual Machine Translation
par: Wu, Di, et autres
Publié: (2023)