Advantageous Parameter Expansion Training Makes Better Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Gu, Naibin, Chen, Yilong, Zhang, Zhenyu, Fu, Peng, Lin, Zheng, Wang, Shuohuan, Sun, Yu, Wu, Hua, Wang, Weiping, Wang, Haifeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
by: Gu, Naibin, et al.
Published: (2025)
by: Gu, Naibin, et al.
Published: (2025)
BeamLoRA: Beam-Constraint Low-Rank Adaptation
by: Gu, Naibin, et al.
Published: (2025)
by: Gu, Naibin, et al.
Published: (2025)
Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning
by: Gu, Naibin, et al.
Published: (2024)
by: Gu, Naibin, et al.
Published: (2024)
Adapt Once, Thrive with Updates: Transferable Parameter-Efficient Fine-Tuning on Evolving Base Models
by: Gu, Naibin, et al.
Published: (2025)
by: Gu, Naibin, et al.
Published: (2025)
Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation
by: Chen, Yilong, et al.
Published: (2026)
by: Chen, Yilong, et al.
Published: (2026)
CBP-Tuning: Efficient Local Customization for Black-box Large Language Models
by: Zhao, Jiaxuan, et al.
Published: (2025)
by: Zhao, Jiaxuan, et al.
Published: (2025)
Causal Path Alignment: Anchoring the Optimization Trajectory for Controllable In-Parameter Knowledge Editing
by: Liu, Xiyu, et al.
Published: (2025)
by: Liu, Xiyu, et al.
Published: (2025)
DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
by: Feng, Yuchen, et al.
Published: (2025)
by: Feng, Yuchen, et al.
Published: (2025)
HFT: Half Fine-Tuning for Large Language Models
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
Weights-Rotated Preference Optimization for Large Language Models
by: Yang, Chenxu, et al.
Published: (2025)
by: Yang, Chenxu, et al.
Published: (2025)
Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
by: Sun, Nan, et al.
Published: (2025)
by: Sun, Nan, et al.
Published: (2025)
Curiosity-Driven Reinforcement Learning from Human Feedback
by: Sun, Haoran, et al.
Published: (2025)
by: Sun, Haoran, et al.
Published: (2025)
Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking
by: Chen, Yilong, et al.
Published: (2025)
by: Chen, Yilong, et al.
Published: (2025)
On Training Data Influence of GPT Models
by: Chai, Yekun, et al.
Published: (2024)
by: Chai, Yekun, et al.
Published: (2024)
Mixture of Hidden-Dimensions Transformer
by: Chen, Yilong, et al.
Published: (2024)
by: Chen, Yilong, et al.
Published: (2024)
Relation Also Knows: Rethinking the Recall and Editing of Factual Associations in Auto-Regressive Transformer Language Models
by: Liu, Xiyu, et al.
Published: (2024)
by: Liu, Xiyu, et al.
Published: (2024)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
by: Chen, Yilong, et al.
Published: (2024)
by: Chen, Yilong, et al.
Published: (2024)
Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping
by: Chen, Yao, et al.
Published: (2026)
by: Chen, Yao, et al.
Published: (2026)
Autoregressive Pre-Training on Pixels and Texts
by: Chai, Yekun, et al.
Published: (2024)
by: Chai, Yekun, et al.
Published: (2024)
DHA: Learning Decoupled-Head Attention from Transformer Checkpoints via Adaptive Heads Fusion
by: Chen, Yilong, et al.
Published: (2024)
by: Chen, Yilong, et al.
Published: (2024)
Orthogonal Finetuning for Direct Preference Optimization
by: Yang, Chenxu, et al.
Published: (2024)
by: Yang, Chenxu, et al.
Published: (2024)
Are Large Language Models Table-based Fact-Checkers?
by: Zhang, Hanwen, et al.
Published: (2024)
by: Zhang, Hanwen, et al.
Published: (2024)
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
by: Chai, Yekun, et al.
Published: (2024)
by: Chai, Yekun, et al.
Published: (2024)
Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models
by: Liu, Xiyu, et al.
Published: (2026)
by: Liu, Xiyu, et al.
Published: (2026)
Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?
by: Wang, Yatong, et al.
Published: (2026)
by: Wang, Yatong, et al.
Published: (2026)
Towards Boosting Many-to-Many Multilingual Machine Translation with Large Language Models
by: Gao, Pengzhi, et al.
Published: (2024)
by: Gao, Pengzhi, et al.
Published: (2024)
Self-Distilled RLVR
by: Yang, Chenxu, et al.
Published: (2026)
by: Yang, Chenxu, et al.
Published: (2026)
Supervised Knowledge Makes Large Language Models Better In-context Learners
by: Yang, Linyi, et al.
Published: (2023)
by: Yang, Linyi, et al.
Published: (2023)
Tool-Augmented Reward Modeling
by: Li, Lei, et al.
Published: (2023)
by: Li, Lei, et al.
Published: (2023)
RuleAlign: Making Large Language Models Better Physicians with Diagnostic Rule Alignment
by: Wang, Xiaohan, et al.
Published: (2024)
by: Wang, Xiaohan, et al.
Published: (2024)
Learning to Self-Verify Makes Language Models Better Reasoners
by: Chen, Yuxin, et al.
Published: (2026)
by: Chen, Yuxin, et al.
Published: (2026)
Make Large Language Model a Better Ranker
by: Chao, Wen-Shuo, et al.
Published: (2024)
by: Chao, Wen-Shuo, et al.
Published: (2024)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
by: Wang, Lanrui, et al.
Published: (2025)
by: Wang, Lanrui, et al.
Published: (2025)
Training Language Model to Critique for Better Refinement
by: Yu, Tianshu, et al.
Published: (2025)
by: Yu, Tianshu, et al.
Published: (2025)
AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators
by: He, Xingwei, et al.
Published: (2023)
by: He, Xingwei, et al.
Published: (2023)
Meta In-Context Learning Makes Large Language Models Better Zero and Few-Shot Relation Extractors
by: Li, Guozheng, et al.
Published: (2024)
by: Li, Guozheng, et al.
Published: (2024)
LogitLens4LLMs: Extending Logit Lens Analysis to Modern Large Language Models
by: Wang, Zhenyu
Published: (2025)
by: Wang, Zhenyu
Published: (2025)
ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation
by: Mei, Zhiyu, et al.
Published: (2024)
by: Mei, Zhiyu, et al.
Published: (2024)
Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
Similar Items
-
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
by: Gu, Naibin, et al.
Published: (2025) -
BeamLoRA: Beam-Constraint Low-Rank Adaptation
by: Gu, Naibin, et al.
Published: (2025) -
Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning
by: Gu, Naibin, et al.
Published: (2024) -
Adapt Once, Thrive with Updates: Transferable Parameter-Efficient Fine-Tuning on Evolving Base Models
by: Gu, Naibin, et al.
Published: (2025) -
Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation
by: Chen, Yilong, et al.
Published: (2026)