AdaGC: Improving Training Stability for Large Language Model Pretraining
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Guoxia, Li, Shuai, Chen, Congliang, Zeng, Jinle, Yang, Jiabin, Yu, Dianhai, Ma, Yanjun, Shen, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FlashMask: Efficient and Rich Mask Extension of FlashAttention
von: Wang, Guoxia, et al.
Veröffentlicht: (2024)
von: Wang, Guoxia, et al.
Veröffentlicht: (2024)
Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities
von: Hao, Zhiwei, et al.
Veröffentlicht: (2025)
von: Hao, Zhiwei, et al.
Veröffentlicht: (2025)
Sparse Layer Sharpness-Aware Minimization for Efficient Fine-Tuning
von: Cheng, Yifei, et al.
Veröffentlicht: (2026)
von: Cheng, Yifei, et al.
Veröffentlicht: (2026)
SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
von: Sun, Yan, et al.
Veröffentlicht: (2026)
von: Sun, Yan, et al.
Veröffentlicht: (2026)
SeWA: Selective Weight Average via Probabilistic Masking
von: Wang, Peng, et al.
Veröffentlicht: (2025)
von: Wang, Peng, et al.
Veröffentlicht: (2025)
GraphNet: A Large-Scale Computational Graph Dataset for Tensor Compiler Research
von: Li, Xinqi, et al.
Veröffentlicht: (2025)
von: Li, Xinqi, et al.
Veröffentlicht: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2026)
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2026)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
TPLLM: A Traffic Prediction Framework Based on Pretrained Large Language Models
von: Ren, Yilong, et al.
Veröffentlicht: (2024)
von: Ren, Yilong, et al.
Veröffentlicht: (2024)
Race, Ethnicity and Their Implication on Bias in Large Language Models
von: Hu, Shiyue, et al.
Veröffentlicht: (2026)
von: Hu, Shiyue, et al.
Veröffentlicht: (2026)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
von: Zhang, Yao, et al.
Veröffentlicht: (2025)
von: Zhang, Yao, et al.
Veröffentlicht: (2025)
AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
AdaZeta: Adaptive Zeroth-Order Tensor-Train Adaption for Memory-Efficient Large Language Models Fine-Tuning
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model Training
von: Li, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2026)
CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
von: Zhou, Zhaojing, et al.
Veröffentlicht: (2025)
von: Zhou, Zhaojing, et al.
Veröffentlicht: (2025)
RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
von: Yu, Zichun, et al.
Veröffentlicht: (2025)
von: Yu, Zichun, et al.
Veröffentlicht: (2025)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
von: Galinkin, Erick, et al.
Veröffentlicht: (2024)
von: Galinkin, Erick, et al.
Veröffentlicht: (2024)
On the Plasticity and Stability for Post-Training Large Language Models
von: Qiang, Wenwen, et al.
Veröffentlicht: (2026)
von: Qiang, Wenwen, et al.
Veröffentlicht: (2026)
Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining
von: Sow, Daouda, et al.
Veröffentlicht: (2025)
von: Sow, Daouda, et al.
Veröffentlicht: (2025)
Exploring the Generalization Capabilities of AID-based Bi-level Optimization
von: Chen, Congliang, et al.
Veröffentlicht: (2024)
von: Chen, Congliang, et al.
Veröffentlicht: (2024)
MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
von: Guo, Bowei, et al.
Veröffentlicht: (2025)
von: Guo, Bowei, et al.
Veröffentlicht: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024)
Benchmarking Optimizers for Large Language Model Pretraining
von: Semenov, Andrei, et al.
Veröffentlicht: (2025)
von: Semenov, Andrei, et al.
Veröffentlicht: (2025)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
AdaMerging: Adaptive Model Merging for Multi-Task Learning
von: Yang, Enneng, et al.
Veröffentlicht: (2023)
von: Yang, Enneng, et al.
Veröffentlicht: (2023)
CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model
von: Di, Peng, et al.
Veröffentlicht: (2023)
von: Di, Peng, et al.
Veröffentlicht: (2023)
GNMR: Runtime Stability Control for Low-Precision Large Language Model Training
von: Kong, Boao, et al.
Veröffentlicht: (2026)
von: Kong, Boao, et al.
Veröffentlicht: (2026)
Language Models Improve When Pretraining Data Matches Target Tasks
von: Mizrahi, David, et al.
Veröffentlicht: (2025)
von: Mizrahi, David, et al.
Veröffentlicht: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
von: Kim, Gyuwan, et al.
Veröffentlicht: (2024)
von: Kim, Gyuwan, et al.
Veröffentlicht: (2024)
Ada-MoGE: Adaptive Mixture of Gaussian Expert Model for Time Series Forecasting
von: Ni, Zhenliang, et al.
Veröffentlicht: (2025)
von: Ni, Zhenliang, et al.
Veröffentlicht: (2025)
Estimating the Effects of Sample Training Orders for Large Language Models without Retraining
von: Yang, Hao, et al.
Veröffentlicht: (2025)
von: Yang, Hao, et al.
Veröffentlicht: (2025)
Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
Unlock the Potential of Large Language Models for Predictive Tabular Tasks in Data Science with Table-Specific Pretraining
von: Yang, Yazheng, et al.
Veröffentlicht: (2024)
von: Yang, Yazheng, et al.
Veröffentlicht: (2024)
Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
von: Liu, Yajiao, et al.
Veröffentlicht: (2025)
von: Liu, Yajiao, et al.
Veröffentlicht: (2025)
Progressive-Hint Prompting Improves Reasoning in Large Language Models
von: Zheng, Chuanyang, et al.
Veröffentlicht: (2023)
von: Zheng, Chuanyang, et al.
Veröffentlicht: (2023)
Exploring the Feasibility of End-to-End Large Language Model as a Compiler
von: Zhang, Hongbin, et al.
Veröffentlicht: (2025)
von: Zhang, Hongbin, et al.
Veröffentlicht: (2025)
Learning Dynamics in Continual Pre-Training for Large Language Models
von: Wang, Xingjin, et al.
Veröffentlicht: (2025)
von: Wang, Xingjin, et al.
Veröffentlicht: (2025)
A Survey of Large Language Models for Graphs
von: Ren, Xubin, et al.
Veröffentlicht: (2024)
von: Ren, Xubin, et al.
Veröffentlicht: (2024)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
von: Ge, Ce, et al.
Veröffentlicht: (2024)
von: Ge, Ce, et al.
Veröffentlicht: (2024)
Detecting Pretraining Data from Large Language Models
von: Shi, Weijia, et al.
Veröffentlicht: (2023)
von: Shi, Weijia, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
FlashMask: Efficient and Rich Mask Extension of FlashAttention
von: Wang, Guoxia, et al.
Veröffentlicht: (2024) -
Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities
von: Hao, Zhiwei, et al.
Veröffentlicht: (2025) -
Sparse Layer Sharpness-Aware Minimization for Efficient Fine-Tuning
von: Cheng, Yifei, et al.
Veröffentlicht: (2026) -
SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
von: Sun, Yan, et al.
Veröffentlicht: (2026) -
SeWA: Selective Weight Average via Probabilistic Masking
von: Wang, Peng, et al.
Veröffentlicht: (2025)