Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-Experts
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xue, Liang, Yunlong, Meng, Fandong, Zhang, Songming, Chen, Yufeng, Xu, Jinan, Zhou, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multilingual Knowledge Editing with Language-Agnostic Factual Neurons
por: Zhang, Xue, et al.
Publicado: (2024)
por: Zhang, Xue, et al.
Publicado: (2024)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
por: Zhang, Xue, et al.
Publicado: (2025)
por: Zhang, Xue, et al.
Publicado: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
por: Zhang, Xue, et al.
Publicado: (2025)
por: Zhang, Xue, et al.
Publicado: (2025)
A Dual-Space Framework for General Knowledge Distillation of Large Language Models
por: Zhang, Xue, et al.
Publicado: (2025)
por: Zhang, Xue, et al.
Publicado: (2025)
Dual-Space Knowledge Distillation for Large Language Models
por: Zhang, Songming, et al.
Publicado: (2024)
por: Zhang, Songming, et al.
Publicado: (2024)
Comments as Natural Logic Pivots: Improve Code Generation via Comment Perspective
por: Chen, Yijie, et al.
Publicado: (2024)
por: Chen, Yijie, et al.
Publicado: (2024)
KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models
por: Zhang, Songming, et al.
Publicado: (2026)
por: Zhang, Songming, et al.
Publicado: (2026)
Towards Understanding and Improving Knowledge Distillation for Neural Machine Translation
por: Zhang, Songming, et al.
Publicado: (2023)
por: Zhang, Songming, et al.
Publicado: (2023)
SlangDIT: Benchmarking LLMs in Interpretative Slang Translation
por: Liang, Yunlong, et al.
Publicado: (2025)
por: Liang, Yunlong, et al.
Publicado: (2025)
Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mapping
por: Chen, Yijie, et al.
Publicado: (2025)
por: Chen, Yijie, et al.
Publicado: (2025)
Beyond Binary Gender: Evaluating Gender-Inclusive Machine Translation with Ambiguous Attitude Words
por: Chen, Yijie, et al.
Publicado: (2024)
por: Chen, Yijie, et al.
Publicado: (2024)
Warmup-Distill: Bridge the Distribution Mismatch between Teacher and Student before Knowledge Distillation
por: Sun, Zengkui, et al.
Publicado: (2025)
por: Sun, Zengkui, et al.
Publicado: (2025)
THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine Translation
por: Liang, Yunlong, et al.
Publicado: (2025)
por: Liang, Yunlong, et al.
Publicado: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025)
por: Zhang, Songming, et al.
Publicado: (2025)
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
por: Sun, Zengkui, et al.
Publicado: (2024)
por: Sun, Zengkui, et al.
Publicado: (2024)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
por: Wang, Jiaan, et al.
Publicado: (2024)
por: Wang, Jiaan, et al.
Publicado: (2024)
Towards Faster k-Nearest-Neighbor Machine Translation
por: Shi, Xiangyu, et al.
Publicado: (2023)
por: Shi, Xiangyu, et al.
Publicado: (2023)
Outdated Issue Aware Decoding for Reasoning Questions on Edited Knowledge
por: Sun, Zengkui, et al.
Publicado: (2024)
por: Sun, Zengkui, et al.
Publicado: (2024)
LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information
por: Ping, Bowen, et al.
Publicado: (2025)
por: Ping, Bowen, et al.
Publicado: (2025)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
por: Wang, Jiaan, et al.
Publicado: (2025)
por: Wang, Jiaan, et al.
Publicado: (2025)
Lamer-SSL: Layer-aware Mixture of LoRA Experts for Continual Multilingual Expansion of Self-supervised Models without Forgetting
por: Xu, Jing, et al.
Publicado: (2026)
por: Xu, Jing, et al.
Publicado: (2026)
Less Data Less Tokens: Multilingual Unification Learning for Efficient Test-Time Reasoning in LLMs
por: Chen, Kang, et al.
Publicado: (2025)
por: Chen, Kang, et al.
Publicado: (2025)
Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy
por: Liu, Yijin, et al.
Publicado: (2024)
por: Liu, Yijin, et al.
Publicado: (2024)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
por: Chen, Yuxin, et al.
Publicado: (2026)
por: Chen, Yuxin, et al.
Publicado: (2026)
Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation
por: Qi, Rui, et al.
Publicado: (2026)
por: Qi, Rui, et al.
Publicado: (2026)
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Models
por: Qi, Rui, et al.
Publicado: (2025)
por: Qi, Rui, et al.
Publicado: (2025)
Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
por: Chen, Meiqi, et al.
Publicado: (2025)
por: Chen, Meiqi, et al.
Publicado: (2025)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
por: Wang, Jiaan, et al.
Publicado: (2025)
por: Wang, Jiaan, et al.
Publicado: (2025)
Efficiently Democratizing Medical LLMs for 50 Languages via a Mixture of Language Family Experts
por: Zheng, Guorui, et al.
Publicado: (2024)
por: Zheng, Guorui, et al.
Publicado: (2024)
CRAT: A Multi-Agent Framework for Causality-Enhanced Reflective and Retrieval-Augmented Translation with Large Language Models
por: Chen, Meiqi, et al.
Publicado: (2024)
por: Chen, Meiqi, et al.
Publicado: (2024)
D2C: Unlocking the Potential of Continuous Autoregressive Image Generation with Discrete Tokens
por: Wang, Panpan, et al.
Publicado: (2025)
por: Wang, Panpan, et al.
Publicado: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
por: Liu, Juntao, et al.
Publicado: (2025)
por: Liu, Juntao, et al.
Publicado: (2025)
Layer-wise Swapping for Generalizable Multilingual Safety
por: Shin, Hyunseo, et al.
Publicado: (2026)
por: Shin, Hyunseo, et al.
Publicado: (2026)
Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
por: Ma, Zhengrui, et al.
Publicado: (2025)
por: Ma, Zhengrui, et al.
Publicado: (2025)
XAL: EXplainable Active Learning Makes Classifiers Better Low-resource Learners
por: Luo, Yun, et al.
Publicado: (2023)
por: Luo, Yun, et al.
Publicado: (2023)
DMDTEval: An Evaluation and Analysis of LLMs on Disambiguation in Multi-domain Translation
por: Man, Zhibo, et al.
Publicado: (2025)
por: Man, Zhibo, et al.
Publicado: (2025)
Layer-wise Importance Matters: Less Memory for Better Performance in Parameter-efficient Fine-tuning of Large Language Models
por: Yao, Kai, et al.
Publicado: (2024)
por: Yao, Kai, et al.
Publicado: (2024)
Multiple Heads are Better than One: Mixture of Modality Knowledge Experts for Entity Representation Learning
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Multilingual Routing in Mixture-of-Experts
por: Bandarkar, Lucas, et al.
Publicado: (2025)
por: Bandarkar, Lucas, et al.
Publicado: (2025)
Ejemplares similares
-
Multilingual Knowledge Editing with Language-Agnostic Factual Neurons
por: Zhang, Xue, et al.
Publicado: (2024) -
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
por: Zhang, Xue, et al.
Publicado: (2025) -
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
por: Zhang, Xue, et al.
Publicado: (2025) -
A Dual-Space Framework for General Knowledge Distillation of Large Language Models
por: Zhang, Xue, et al.
Publicado: (2025) -
Dual-Space Knowledge Distillation for Large Language Models
por: Zhang, Songming, et al.
Publicado: (2024)