The Curse of Depth in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Wenfang, Song, Xinyuan, Li, Pengxiang, Yin, Lu, Zheng, Yefeng, Liu, Shiwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN
von: Li, Pengxiang, et al.
Veröffentlicht: (2024)
von: Li, Pengxiang, et al.
Veröffentlicht: (2024)
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
von: Li, Pengxiang, et al.
Veröffentlicht: (2024)
von: Li, Pengxiang, et al.
Veröffentlicht: (2024)
Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
von: Kapl, Ferdinand, et al.
Veröffentlicht: (2025)
von: Kapl, Ferdinand, et al.
Veröffentlicht: (2025)
Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation
von: Shang, Yingjia, et al.
Veröffentlicht: (2025)
von: Shang, Yingjia, et al.
Veröffentlicht: (2025)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
von: Li, Jiaxi, et al.
Veröffentlicht: (2026)
von: Li, Jiaxi, et al.
Veröffentlicht: (2026)
A Multi-Faceted Evaluation Framework for Assessing Synthetic Data Generated by Large Language Models
von: Yuan, Yefeng, et al.
Veröffentlicht: (2024)
von: Yuan, Yefeng, et al.
Veröffentlicht: (2024)
Large Language Model Distilling Medication Recommendation Model
von: Liu, Qidong, et al.
Veröffentlicht: (2024)
von: Liu, Qidong, et al.
Veröffentlicht: (2024)
GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models
von: Zhao, Pengxiang, et al.
Veröffentlicht: (2025)
von: Zhao, Pengxiang, et al.
Veröffentlicht: (2025)
Mixture of Experts in Large Language Models
von: Zhang, Danyang, et al.
Veröffentlicht: (2025)
von: Zhang, Danyang, et al.
Veröffentlicht: (2025)
Manifold-Aware Temporal Domain Generalization for Large Language Models
von: Yao, Yiheng, et al.
Veröffentlicht: (2026)
von: Yao, Yiheng, et al.
Veröffentlicht: (2026)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
von: Guo, Qingyan, et al.
Veröffentlicht: (2024)
von: Guo, Qingyan, et al.
Veröffentlicht: (2024)
Sliding Window Attention Training for Efficient Large Language Models
von: Fu, Zichuan, et al.
Veröffentlicht: (2025)
von: Fu, Zichuan, et al.
Veröffentlicht: (2025)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
von: Wu, Da, et al.
Veröffentlicht: (2023)
von: Wu, Da, et al.
Veröffentlicht: (2023)
Dispelling the Curse of Singularities in Neural Network Optimizations
von: Cao, Hengjie, et al.
Veröffentlicht: (2026)
von: Cao, Hengjie, et al.
Veröffentlicht: (2026)
Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs
von: Yin, Lu, et al.
Veröffentlicht: (2023)
von: Yin, Lu, et al.
Veröffentlicht: (2023)
One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs
von: He, Di, et al.
Veröffentlicht: (2026)
von: He, Di, et al.
Veröffentlicht: (2026)
The Blessing and Curse of Dimensionality in Safety Alignment
von: Teo, Rachel S. Y., et al.
Veröffentlicht: (2025)
von: Teo, Rachel S. Y., et al.
Veröffentlicht: (2025)
Emergent Causal-Geometric Dynamics Across Depth in Large Language Models
von: Haim, Shahar, et al.
Veröffentlicht: (2026)
von: Haim, Shahar, et al.
Veröffentlicht: (2026)
Learning to Select In-Context Demonstration Preferred by Large Language Model
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign
von: Li, Jiahui, et al.
Veröffentlicht: (2026)
von: Li, Jiahui, et al.
Veröffentlicht: (2026)
The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training
von: Cao, Hengjie, et al.
Veröffentlicht: (2026)
von: Cao, Hengjie, et al.
Veröffentlicht: (2026)
Building a Chinese Medical Dialogue System: Integrating Large-scale Corpora and Novel Models
von: Wang, Xinyuan, et al.
Veröffentlicht: (2024)
von: Wang, Xinyuan, et al.
Veröffentlicht: (2024)
Exploring Federated Pruning for Large Language Models
von: Guo, Pengxin, et al.
Veröffentlicht: (2025)
von: Guo, Pengxin, et al.
Veröffentlicht: (2025)
The Factorization Curse: Which Tokens You Predict Underlie the Reversal Curse and More
von: Kitouni, Ouail, et al.
Veröffentlicht: (2024)
von: Kitouni, Ouail, et al.
Veröffentlicht: (2024)
Matrix Sensing with Kernel Optimal Loss: Robustness and Optimization Landscape
von: Song, Xinyuan, et al.
Veröffentlicht: (2025)
von: Song, Xinyuan, et al.
Veröffentlicht: (2025)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
von: Peng, Benji, et al.
Veröffentlicht: (2024)
von: Peng, Benji, et al.
Veröffentlicht: (2024)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
von: Liu, Akide, et al.
Veröffentlicht: (2024)
von: Liu, Akide, et al.
Veröffentlicht: (2024)
ActTail: Global Activation Sparsity in Large Language Models
von: Hou, Wenwen, et al.
Veröffentlicht: (2026)
von: Hou, Wenwen, et al.
Veröffentlicht: (2026)
Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking
von: Xu, Yang, et al.
Veröffentlicht: (2026)
von: Xu, Yang, et al.
Veröffentlicht: (2026)
An Analysis and Mitigation of the Reversal Curse
von: Lv, Ang, et al.
Veröffentlicht: (2023)
von: Lv, Ang, et al.
Veröffentlicht: (2023)
Curse of Attention: A Kernel-Based Perspective for Why Transformers Fail to Generalize on Time Series Forecasting and Beyond
von: Ke, Yekun, et al.
Veröffentlicht: (2024)
von: Ke, Yekun, et al.
Veröffentlicht: (2024)
Large Language Models Explore by Latent Distilling
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2026)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2026)
How DNNs break the Curse of Dimensionality: Compositionality and Symmetry Learning
von: Jacot, Arthur, et al.
Veröffentlicht: (2024)
von: Jacot, Arthur, et al.
Veröffentlicht: (2024)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
von: Li, Pengxiang, et al.
Veröffentlicht: (2026)
von: Li, Pengxiang, et al.
Veröffentlicht: (2026)
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
von: Hu, Yuelin, et al.
Veröffentlicht: (2026)
von: Hu, Yuelin, et al.
Veröffentlicht: (2026)
Integration of Large Language Models and Federated Learning
von: Chen, Chaochao, et al.
Veröffentlicht: (2023)
von: Chen, Chaochao, et al.
Veröffentlicht: (2023)
Are Large Language Models In-Context Graph Learners?
von: Li, Jintang, et al.
Veröffentlicht: (2025)
von: Li, Jintang, et al.
Veröffentlicht: (2025)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
von: Wang, Keyu, et al.
Veröffentlicht: (2025)
von: Wang, Keyu, et al.
Veröffentlicht: (2025)
A Survey of Large Language Models for Graphs
von: Ren, Xubin, et al.
Veröffentlicht: (2024)
von: Ren, Xubin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN
von: Li, Pengxiang, et al.
Veröffentlicht: (2024) -
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
von: Li, Pengxiang, et al.
Veröffentlicht: (2024) -
Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
von: Kapl, Ferdinand, et al.
Veröffentlicht: (2025) -
Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation
von: Shang, Yingjia, et al.
Veröffentlicht: (2025) -
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
von: Li, Jiaxi, et al.
Veröffentlicht: (2026)