A Learning Rate Path Switching Training Paradigm for Version Updates of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Zhihao, Liu, Shiyu, Huang, Jianheng, Wang, Zheng, Liao, Yixuan, Chen, Xiaoxin, Yao, Junfeng, Su, Jinsong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
On the Information Redundancy in Non-Autoregressive Translation
von: Wang, Zhihao, et al.
Veröffentlicht: (2024)
von: Wang, Zhihao, et al.
Veröffentlicht: (2024)
Response Enhanced Semi-supervised Dialogue Query Generation
von: Huang, Jianheng, et al.
Veröffentlicht: (2023)
von: Huang, Jianheng, et al.
Veröffentlicht: (2023)
TDAG: A Multi-Agent Framework based on Dynamic Task Decomposition and Agent Generation
von: Wang, Yaoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Yaoxiang, et al.
Veröffentlicht: (2024)
Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models
von: Shi, Luohe, et al.
Veröffentlicht: (2024)
von: Shi, Luohe, et al.
Veröffentlicht: (2024)
Latent Causal Void: Explicit Missing-Context Reconstruction for Misinformation Detection
von: Li, Hui, et al.
Veröffentlicht: (2026)
von: Li, Hui, et al.
Veröffentlicht: (2026)
A Dual-Perspective Metaphor Detection Framework Using Large Language Models
von: Lin, Yujie, et al.
Veröffentlicht: (2024)
von: Lin, Yujie, et al.
Veröffentlicht: (2024)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
von: Liu, Bingshuai, et al.
Veröffentlicht: (2023)
von: Liu, Bingshuai, et al.
Veröffentlicht: (2023)
Not All Languages are Equal: Insights into Multilingual Retrieval-Augmented Generation
von: Wu, Suhang, et al.
Veröffentlicht: (2024)
von: Wu, Suhang, et al.
Veröffentlicht: (2024)
How Do Large Language Models Learn Concepts During Continual Pre-Training?
von: Yao, Barry Menglong, et al.
Veröffentlicht: (2026)
von: Yao, Barry Menglong, et al.
Veröffentlicht: (2026)
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
von: Li, Jinsong, et al.
Veröffentlicht: (2025)
von: Li, Jinsong, et al.
Veröffentlicht: (2025)
ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training
von: Han, Feijiang, et al.
Veröffentlicht: (2025)
von: Han, Feijiang, et al.
Veröffentlicht: (2025)
Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training
von: Wang, Zhijun, et al.
Veröffentlicht: (2025)
von: Wang, Zhijun, et al.
Veröffentlicht: (2025)
500xCompressor: Generalized Prompt Compression for Large Language Models
von: Li, Zongqian, et al.
Veröffentlicht: (2024)
von: Li, Zongqian, et al.
Veröffentlicht: (2024)
Towards Alignment-Centric Paradigm: A Survey of Instruction Tuning in Large Language Models
von: Han, Xudong, et al.
Veröffentlicht: (2025)
von: Han, Xudong, et al.
Veröffentlicht: (2025)
Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
von: Liu, Runxuan, et al.
Veröffentlicht: (2026)
von: Liu, Runxuan, et al.
Veröffentlicht: (2026)
Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models
von: Shang, Yuzhe, et al.
Veröffentlicht: (2026)
von: Shang, Yuzhe, et al.
Veröffentlicht: (2026)
Mitigating the Negative Impact of Over-association for Conversational Query Production
von: Wang, Ante, et al.
Veröffentlicht: (2024)
von: Wang, Ante, et al.
Veröffentlicht: (2024)
How does Misinformation Affect Large Language Model Behaviors and Preferences?
von: Peng, Miao, et al.
Veröffentlicht: (2025)
von: Peng, Miao, et al.
Veröffentlicht: (2025)
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
von: Xu, Zhihao, et al.
Veröffentlicht: (2024)
von: Xu, Zhihao, et al.
Veröffentlicht: (2024)
Prompt Compression for Large Language Models: A Survey
von: Li, Zongqian, et al.
Veröffentlicht: (2024)
von: Li, Zongqian, et al.
Veröffentlicht: (2024)
Locate-and-Focus: Enhancing Terminology Translation in Speech Language Models
von: Wu, Suhang, et al.
Veröffentlicht: (2025)
von: Wu, Suhang, et al.
Veröffentlicht: (2025)
SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
von: Wu, Haotian, et al.
Veröffentlicht: (2025)
von: Wu, Haotian, et al.
Veröffentlicht: (2025)
Towards Better Graph-based Cross-document Relation Extraction via Non-bridge Entity Enhancement and Prediction Debiasing
von: Yue, Hao, et al.
Veröffentlicht: (2024)
von: Yue, Hao, et al.
Veröffentlicht: (2024)
Improved Unbiased Watermark for Large Language Models
von: Chen, Ruibo, et al.
Veröffentlicht: (2025)
von: Chen, Ruibo, et al.
Veröffentlicht: (2025)
UniGenCoder: Merging Seq2Seq and Seq2Tree Paradigms for Unified Code Generation
von: Shao, Liangying, et al.
Veröffentlicht: (2025)
von: Shao, Liangying, et al.
Veröffentlicht: (2025)
JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models
von: Jiang, Junfeng, et al.
Veröffentlicht: (2024)
von: Jiang, Junfeng, et al.
Veröffentlicht: (2024)
De-mark: Watermark Removal in Large Language Models
von: Chen, Ruibo, et al.
Veröffentlicht: (2024)
von: Chen, Ruibo, et al.
Veröffentlicht: (2024)
LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models
von: Liao, Weibin, et al.
Veröffentlicht: (2025)
von: Liao, Weibin, et al.
Veröffentlicht: (2025)
GraphArena: Evaluating and Exploring Large Language Models on Graph Computation
von: Tang, Jianheng, et al.
Veröffentlicht: (2024)
von: Tang, Jianheng, et al.
Veröffentlicht: (2024)
Sparsity-Accelerated Training for Large Language Models
von: Ma, Da, et al.
Veröffentlicht: (2024)
von: Ma, Da, et al.
Veröffentlicht: (2024)
AICoderEval: Improving AI Domain Code Generation of Large Language Models
von: Xia, Yinghui, et al.
Veröffentlicht: (2024)
von: Xia, Yinghui, et al.
Veröffentlicht: (2024)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
von: Tian, Junfeng, et al.
Veröffentlicht: (2024)
von: Tian, Junfeng, et al.
Veröffentlicht: (2024)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
Can Large Language Models Master Complex Card Games?
von: Wang, Wei, et al.
Veröffentlicht: (2025)
von: Wang, Wei, et al.
Veröffentlicht: (2025)
GTA: Supervised-Guided Reinforcement Learning for Text Classification with Large Language Models
von: Zeng, Min, et al.
Veröffentlicht: (2025)
von: Zeng, Min, et al.
Veröffentlicht: (2025)
Neuron-Level Sequential Editing for Large Language Models
von: Jiang, Houcheng, et al.
Veröffentlicht: (2024)
von: Jiang, Houcheng, et al.
Veröffentlicht: (2024)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
von: Cheng, Jiale, et al.
Veröffentlicht: (2023)
von: Cheng, Jiale, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
von: Huang, Jianheng, et al.
Veröffentlicht: (2024) -
Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
von: Lin, Yujie, et al.
Veröffentlicht: (2026) -
On the Information Redundancy in Non-Autoregressive Translation
von: Wang, Zhihao, et al.
Veröffentlicht: (2024) -
Response Enhanced Semi-supervised Dialogue Query Generation
von: Huang, Jianheng, et al.
Veröffentlicht: (2023) -
TDAG: A Multi-Agent Framework based on Dynamic Task Decomposition and Agent Generation
von: Wang, Yaoxiang, et al.
Veröffentlicht: (2024)