Evolving Subnetwork Training for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Hanqi, Chen, Lu, Ma, Da, Wu, Zijian, Zhu, Su, Yu, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models
di: Zheng, Yingming, et al.
Pubblicazione: (2025)
di: Zheng, Yingming, et al.
Pubblicazione: (2025)
Your Language Model Secretly Contains Personality Subnetworks
di: Ye, Ruimeng, et al.
Pubblicazione: (2026)
di: Ye, Ruimeng, et al.
Pubblicazione: (2026)
SciDFM: A Large Language Model with Mixture-of-Experts for Science
di: Sun, Liangtai, et al.
Pubblicazione: (2024)
di: Sun, Liangtai, et al.
Pubblicazione: (2024)
Sparsity-Accelerated Training for Large Language Models
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
di: Zheng, Kening, et al.
Pubblicazione: (2026)
di: Zheng, Kening, et al.
Pubblicazione: (2026)
Learning Evolving Tools for Large Language Models
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
The Evolving Landscape of Generative Large Language Models and Traditional Natural Language Processing in Medicine
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
Automatic Instruction Evolving for Large Language Models
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
Delusions of Large Language Models
di: Xu, Hongshen, et al.
Pubblicazione: (2025)
di: Xu, Hongshen, et al.
Pubblicazione: (2025)
LLMs as Scalable, General-Purpose Simulators For Evolving Digital Agent Training
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024)
AgentGym: Evolving Large Language Model-based Agents across Diverse Environments
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
Personalized Large Language Model Assistant with Evolving Conditional Memory
di: Yuan, Ruifeng, et al.
Pubblicazione: (2023)
di: Yuan, Ruifeng, et al.
Pubblicazione: (2023)
Improving Automatic Summarization of Radiology Reports through Mid-Training of Large Language Models
di: Lyu, Mengxian, et al.
Pubblicazione: (2026)
di: Lyu, Mengxian, et al.
Pubblicazione: (2026)
Online Training of Large Language Models: Learn while chatting
di: Liang, Juhao, et al.
Pubblicazione: (2024)
di: Liang, Juhao, et al.
Pubblicazione: (2024)
Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts
di: Xie, Jian, et al.
Pubblicazione: (2023)
di: Xie, Jian, et al.
Pubblicazione: (2023)
Unveiling and Manipulating Prompt Influence in Large Language Models
di: Feng, Zijian, et al.
Pubblicazione: (2024)
di: Feng, Zijian, et al.
Pubblicazione: (2024)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
di: Zhang, Situo, et al.
Pubblicazione: (2024)
di: Zhang, Situo, et al.
Pubblicazione: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
di: Chen, Zijian, et al.
Pubblicazione: (2025)
di: Chen, Zijian, et al.
Pubblicazione: (2025)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
di: Wu, Da, et al.
Pubblicazione: (2023)
di: Wu, Da, et al.
Pubblicazione: (2023)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
di: Diao, Muxi, et al.
Pubblicazione: (2024)
di: Diao, Muxi, et al.
Pubblicazione: (2024)
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Self-Evolving Critique Abilities in Large Language Models
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
The Ever-Evolving Science Exam
di: Wang, Junying, et al.
Pubblicazione: (2025)
di: Wang, Junying, et al.
Pubblicazione: (2025)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
di: Li, Yibo, et al.
Pubblicazione: (2025)
di: Li, Yibo, et al.
Pubblicazione: (2025)
QueEn: A Large Language Model for Quechua-English Translation
di: Chen, Junhao, et al.
Pubblicazione: (2024)
di: Chen, Junhao, et al.
Pubblicazione: (2024)
Cognitive Memory in Large Language Models
di: Shan, Lianlei, et al.
Pubblicazione: (2025)
di: Shan, Lianlei, et al.
Pubblicazione: (2025)
Large Language Models for Manufacturing
di: Li, Yiwei, et al.
Pubblicazione: (2024)
di: Li, Yiwei, et al.
Pubblicazione: (2024)
Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
Training-Free Test-Time Contrastive Learning for Large Language Models
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
Ask Good Questions for Large Language Models
di: Wu, Qi, et al.
Pubblicazione: (2025)
di: Wu, Qi, et al.
Pubblicazione: (2025)
A Survey on Model Compression for Large Language Models
di: Zhu, Xunyu, et al.
Pubblicazione: (2023)
di: Zhu, Xunyu, et al.
Pubblicazione: (2023)
Language Models as Continuous Self-Evolving Data Engineers
di: Wang, Peidong, et al.
Pubblicazione: (2024)
di: Wang, Peidong, et al.
Pubblicazione: (2024)
On the Effectiveness of Incremental Training of Large Language Models
di: Li, Miles Q., et al.
Pubblicazione: (2024)
di: Li, Miles Q., et al.
Pubblicazione: (2024)
Where to Begin: Efficient Pretraining via Subnetwork Selection and Distillation
di: Krishnakumar, Arjun, et al.
Pubblicazione: (2025)
di: Krishnakumar, Arjun, et al.
Pubblicazione: (2025)
Catching Chameleons: Detecting Evolving Disinformation Generated using Large Language Models
di: Jiang, Bohan, et al.
Pubblicazione: (2024)
di: Jiang, Bohan, et al.
Pubblicazione: (2024)
Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models
di: Xu, Fangzhi, et al.
Pubblicazione: (2024)
di: Xu, Fangzhi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models
di: Zheng, Yingming, et al.
Pubblicazione: (2025) -
Your Language Model Secretly Contains Personality Subnetworks
di: Ye, Ruimeng, et al.
Pubblicazione: (2026) -
SciDFM: A Large Language Model with Mixture-of-Experts for Science
di: Sun, Liangtai, et al.
Pubblicazione: (2024) -
Sparsity-Accelerated Training for Large Language Models
di: Ma, Da, et al.
Pubblicazione: (2024) -
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
di: Zheng, Kening, et al.
Pubblicazione: (2026)