Unlocking the Potential of Model Merging for Low-Resource Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Tao, Mingxu, Zhang, Chen, Huang, Quzhe, Ma, Tianyao, Huang, Songfang, Zhao, Dongyan, Feng, Yansong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Probing Multimodal Large Language Models for Global and Local Semantic Representations
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
EpiCoDe: Boosting Model Performance Beyond Training with Extrapolation and Contrastive Decoding
di: Tao, Mingxu, et al.
Pubblicazione: (2025)
di: Tao, Mingxu, et al.
Pubblicazione: (2025)
Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?
di: Hu, Yutong, et al.
Pubblicazione: (2024)
di: Hu, Yutong, et al.
Pubblicazione: (2024)
Automating Legal Interpretation with LLMs: Retrieval, Generation, and Evaluation
di: Luo, Kangcheng, et al.
Pubblicazione: (2025)
di: Luo, Kangcheng, et al.
Pubblicazione: (2025)
MC$^2$: Towards Transparent and Culturally-Aware NLP for Minority Languages in China
di: Zhang, Chen, et al.
Pubblicazione: (2023)
di: Zhang, Chen, et al.
Pubblicazione: (2023)
JUREX-4E: Juridical Expert-Annotated Four-Element Knowledge Base for Legal Reasoning
di: Liu, Huanghai, et al.
Pubblicazione: (2025)
di: Liu, Huanghai, et al.
Pubblicazione: (2025)
Harder Tasks Need More Experts: Dynamic Routing in MoE Models
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
Synergetic Event Understanding: A Collaborative Approach to Cross-Document Event Coreference Resolution with Large Language Models
di: Min, Qingkai, et al.
Pubblicazione: (2024)
di: Min, Qingkai, et al.
Pubblicazione: (2024)
Only One Relation Possible? Modeling the Ambiguity in Event Temporal Relation Extraction
di: Hu, Yutong, et al.
Pubblicazione: (2024)
di: Hu, Yutong, et al.
Pubblicazione: (2024)
LoRE-Merging: Exploring Low-Rank Estimation For Large Language Model Merging
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
di: Zhang, Yeqin, et al.
Pubblicazione: (2025)
di: Zhang, Yeqin, et al.
Pubblicazione: (2025)
What Kinds of Tokens Benefit from Distant Text? An Analysis on Long Context Language Modeling
di: Hu, Yutong, et al.
Pubblicazione: (2024)
di: Hu, Yutong, et al.
Pubblicazione: (2024)
Transport and Merge: Cross-Architecture Merging for Large Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
Can Language Models Discover Scaling Laws?
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
ChemATP: A Training-Free Chemical Reasoning Framework for Large Language Models
di: Zhang, Mingxu, et al.
Pubblicazione: (2025)
di: Zhang, Mingxu, et al.
Pubblicazione: (2025)
Unlocking the Potential of Diffusion Language Models through Template Infilling
di: Lee, Junhoo, et al.
Pubblicazione: (2025)
di: Lee, Junhoo, et al.
Pubblicazione: (2025)
Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages
di: Li, Haolin, et al.
Pubblicazione: (2025)
di: Li, Haolin, et al.
Pubblicazione: (2025)
AdaMergeX: Cross-Lingual Transfer with Large Language Models via Adaptive Adapter Merging
di: Zhao, Yiran, et al.
Pubblicazione: (2024)
di: Zhao, Yiran, et al.
Pubblicazione: (2024)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
di: Ma, Qianli, et al.
Pubblicazione: (2025)
di: Ma, Qianli, et al.
Pubblicazione: (2025)
Unlocking the Potential: Benchmarking Large Language Models in Water Engineering and Research
di: Xu, Boyan, et al.
Pubblicazione: (2024)
di: Xu, Boyan, et al.
Pubblicazione: (2024)
MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
di: Xiaomi, LLM-Core, et al.
Pubblicazione: (2025)
di: Xiaomi, LLM-Core, et al.
Pubblicazione: (2025)
Evidence-Enhanced Triplet Generation Framework for Hallucination Alleviation in Generative Question Answering
di: Du, Haowei, et al.
Pubblicazione: (2024)
di: Du, Haowei, et al.
Pubblicazione: (2024)
Fine-grained Stateful Knowledge Exploration: Effective and Efficient Graph Retrieval with Large Language Models
di: Tao, Dehao, et al.
Pubblicazione: (2024)
di: Tao, Dehao, et al.
Pubblicazione: (2024)
Targeted Augmentation for Low-Resource Event Extraction
di: Wang, Sijia, et al.
Pubblicazione: (2024)
di: Wang, Sijia, et al.
Pubblicazione: (2024)
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
Leveraging the Potential of Prompt Engineering for Hate Speech Detection in Low-Resource Languages
di: Prome, Ruhina Tabasshum, et al.
Pubblicazione: (2025)
di: Prome, Ruhina Tabasshum, et al.
Pubblicazione: (2025)
AIMMerging: Adaptive Iterative Model Merging Using Training Trajectories for Language Model Continual Learning
di: Feng, Yujie, et al.
Pubblicazione: (2025)
di: Feng, Yujie, et al.
Pubblicazione: (2025)
SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging
di: Chen, Zijun, et al.
Pubblicazione: (2025)
di: Chen, Zijun, et al.
Pubblicazione: (2025)
Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
MiLiC-Eval: Benchmarking Multilingual LLMs for China's Minority Languages
di: Zhang, Chen, et al.
Pubblicazione: (2025)
di: Zhang, Chen, et al.
Pubblicazione: (2025)
DPPA: Pruning Method for Large Language Model to Model Merging
di: Zhu, Yaochen, et al.
Pubblicazione: (2024)
di: Zhu, Yaochen, et al.
Pubblicazione: (2024)
Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation
di: Su, Zeli, et al.
Pubblicazione: (2026)
di: Su, Zeli, et al.
Pubblicazione: (2026)
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
SuperMerge: An Approach For Gradient-Based Model Merging
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
Continual-learning for Modelling Low-Resource Languages from Large Language Models
di: K, Santosh Srinath, et al.
Pubblicazione: (2026)
di: K, Santosh Srinath, et al.
Pubblicazione: (2026)
Activation-Informed Merging of Large Language Models
di: Nobari, Amin Heyrani, et al.
Pubblicazione: (2025)
di: Nobari, Amin Heyrani, et al.
Pubblicazione: (2025)
Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
di: Cheng, Xin, et al.
Pubblicazione: (2026)
di: Cheng, Xin, et al.
Pubblicazione: (2026)
Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
di: Zhang, Zhen, et al.
Pubblicazione: (2025)
di: Zhang, Zhen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Probing Multimodal Large Language Models for Global and Local Semantic Representations
di: Tao, Mingxu, et al.
Pubblicazione: (2024) -
Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering
di: Tao, Mingxu, et al.
Pubblicazione: (2024) -
EpiCoDe: Boosting Model Performance Beyond Training with Extrapolation and Contrastive Decoding
di: Tao, Mingxu, et al.
Pubblicazione: (2025) -
Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?
di: Hu, Yutong, et al.
Pubblicazione: (2024) -
Automating Legal Interpretation with LLMs: Retrieval, Generation, and Evaluation
di: Luo, Kangcheng, et al.
Pubblicazione: (2025)