The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Hongtao, Zhou, Wenjie, Jia, Chenxi, Chen, Wei, Cheng, Xueqi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training
von: Zhou, Wenjie, et al.
Veröffentlicht: (2026)
von: Zhou, Wenjie, et al.
Veröffentlicht: (2026)
When and Why Grouping Attention Heads Accelerates Muon Optimization
von: Zhang, Hongtao, et al.
Veröffentlicht: (2026)
von: Zhang, Hongtao, et al.
Veröffentlicht: (2026)
BSFA: Leveraging the Subspace Dichotomy to Accelerate Neural Network Training
von: Zhou, Wenjie, et al.
Veröffentlicht: (2025)
von: Zhou, Wenjie, et al.
Veröffentlicht: (2025)
Cross-Domain Pre-training with Language Models for Transferable Time Series Representations
von: Cheng, Mingyue, et al.
Veröffentlicht: (2024)
von: Cheng, Mingyue, et al.
Veröffentlicht: (2024)
Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation
von: Li, Yi-Chen, et al.
Veröffentlicht: (2024)
von: Li, Yi-Chen, et al.
Veröffentlicht: (2024)
Pre-trained Large Language Models Use Fourier Features to Compute Addition
von: Zhou, Tianyi, et al.
Veröffentlicht: (2024)
von: Zhou, Tianyi, et al.
Veröffentlicht: (2024)
TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training
von: Wang, Yifan, et al.
Veröffentlicht: (2025)
von: Wang, Yifan, et al.
Veröffentlicht: (2025)
Pre-trained Language Model and Knowledge Distillation for Lightweight Sequential Recommendation
von: Li, Li, et al.
Veröffentlicht: (2024)
von: Li, Li, et al.
Veröffentlicht: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
von: Fu, Wenjie, et al.
Veröffentlicht: (2024)
von: Fu, Wenjie, et al.
Veröffentlicht: (2024)
On the Usage of Continual Learning for Out-of-Distribution Generalization in Pre-trained Language Models of Code
von: Weyssow, Martin, et al.
Veröffentlicht: (2023)
von: Weyssow, Martin, et al.
Veröffentlicht: (2023)
Model Merging in Pre-training of Large Language Models
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
CLDyB: Towards Dynamic Benchmarking for Continual Learning with Pre-trained Models
von: Chen, Shengzhuang, et al.
Veröffentlicht: (2025)
von: Chen, Shengzhuang, et al.
Veröffentlicht: (2025)
Assessing Pre-Trained Models for Transfer Learning Through Distribution of Spectral Components
von: Zhang, Tengxue, et al.
Veröffentlicht: (2024)
von: Zhang, Tengxue, et al.
Veröffentlicht: (2024)
A Pre-trained Data Deduplication Model based on Active Learning
von: Shi, Haochen, et al.
Veröffentlicht: (2023)
von: Shi, Haochen, et al.
Veröffentlicht: (2023)
GraphSculptor: Sculpting Pre-training Coreset for Graph Self-supervised Learning
von: Liu, Chuang, et al.
Veröffentlicht: (2026)
von: Liu, Chuang, et al.
Veröffentlicht: (2026)
Spectral Thresholds for Identifiability and Stability:Finite-Sample Phase Transitions in High-Dimensional Learning
von: Huang, William Hao-Cheng
Veröffentlicht: (2025)
von: Huang, William Hao-Cheng
Veröffentlicht: (2025)
VectorFit : Adaptive Singular & Bias Vector Fine-Tuning of Pre-trained Foundation Models
von: Hegde, Suhas G, et al.
Veröffentlicht: (2025)
von: Hegde, Suhas G, et al.
Veröffentlicht: (2025)
Making Pre-trained Language Models Great on Tabular Prediction
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024)
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024)
Utilizing Strategic Pre-training to Reduce Overfitting: Baguan -- A Pre-trained Weather Forecasting Model
von: Niu, Peisong, et al.
Veröffentlicht: (2025)
von: Niu, Peisong, et al.
Veröffentlicht: (2025)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
OmniFluids: Physics Pre-trained Modeling of Fluid Dynamics
von: Zhang, Rui, et al.
Veröffentlicht: (2025)
von: Zhang, Rui, et al.
Veröffentlicht: (2025)
Stabilizing RNN Gradients through Pre-training
von: Herranz-Celotti, Luca, et al.
Veröffentlicht: (2023)
von: Herranz-Celotti, Luca, et al.
Veröffentlicht: (2023)
Rethinking Graph Domain Adaptation: A Spectral Contrastive Perspective
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
von: Liu, Chenxi, et al.
Veröffentlicht: (2025)
von: Liu, Chenxi, et al.
Veröffentlicht: (2025)
Stability of In-Context Learning: A Spectral Coverage Perspective
von: Wang, Tongxi, et al.
Veröffentlicht: (2025)
von: Wang, Tongxi, et al.
Veröffentlicht: (2025)
Machine Unlearning of Pre-trained Large Language Models
von: Yao, Jin, et al.
Veröffentlicht: (2024)
von: Yao, Jin, et al.
Veröffentlicht: (2024)
DEPT: Decoupled Embeddings for Pre-training Language Models
von: Iacob, Alex, et al.
Veröffentlicht: (2024)
von: Iacob, Alex, et al.
Veröffentlicht: (2024)
Bias Mitigation in Fine-tuning Pre-trained Models for Enhanced Fairness and Efficiency
von: Zhang, Yixuan, et al.
Veröffentlicht: (2024)
von: Zhang, Yixuan, et al.
Veröffentlicht: (2024)
Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning
von: Shi, Ruizhe, et al.
Veröffentlicht: (2023)
von: Shi, Ruizhe, et al.
Veröffentlicht: (2023)
LOST: Low-rank and Sparse Pre-training for Large Language Models
von: Li, Jiaxi, et al.
Veröffentlicht: (2025)
von: Li, Jiaxi, et al.
Veröffentlicht: (2025)
Rethinking Pre-Training in Tabular Data: A Neighborhood Embedding Perspective
von: Ye, Han-Jia, et al.
Veröffentlicht: (2023)
von: Ye, Han-Jia, et al.
Veröffentlicht: (2023)
PLMTrajRec: A Scalable and Generalizable Trajectory Recovery Method with Pre-trained Language Models
von: Wei, Tonglong, et al.
Veröffentlicht: (2024)
von: Wei, Tonglong, et al.
Veröffentlicht: (2024)
Text-Free Multi-domain Graph Pre-training: Toward Graph Foundation Models
von: Yu, Xingtong, et al.
Veröffentlicht: (2024)
von: Yu, Xingtong, et al.
Veröffentlicht: (2024)
LEDA: Latent Semantic Distribution Alignment for Multi-domain Graph Pre-training
von: Shan, Lianze, et al.
Veröffentlicht: (2026)
von: Shan, Lianze, et al.
Veröffentlicht: (2026)
Inductive Graph Alignment Prompt: Bridging the Gap between Graph Pre-training and Inductive Fine-tuning From Spectral Perspective
von: Yan, Yuchen, et al.
Veröffentlicht: (2024)
von: Yan, Yuchen, et al.
Veröffentlicht: (2024)
Augmenting Parameter-Efficient Pre-trained Language Models with Large Language Models
von: Anand, Saurabh, et al.
Veröffentlicht: (2026)
von: Anand, Saurabh, et al.
Veröffentlicht: (2026)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
CDGP: Automatic Cloze Distractor Generation based on Pre-trained Language Model
von: Chiang, Shang-Hsuan, et al.
Veröffentlicht: (2024)
von: Chiang, Shang-Hsuan, et al.
Veröffentlicht: (2024)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
HLAT: High-quality Large Language Model Pre-trained on AWS Trainium
von: Fan, Haozheng, et al.
Veröffentlicht: (2024)
von: Fan, Haozheng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training
von: Zhou, Wenjie, et al.
Veröffentlicht: (2026) -
When and Why Grouping Attention Heads Accelerates Muon Optimization
von: Zhang, Hongtao, et al.
Veröffentlicht: (2026) -
BSFA: Leveraging the Subspace Dichotomy to Accelerate Neural Network Training
von: Zhou, Wenjie, et al.
Veröffentlicht: (2025) -
Cross-Domain Pre-training with Language Models for Transferable Time Series Representations
von: Cheng, Mingyue, et al.
Veröffentlicht: (2024) -
Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation
von: Li, Yi-Chen, et al.
Veröffentlicht: (2024)