Universal One-third Time Scaling in Learning Peaked Distributions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yizhou, Liu, Ziming, Pehlevan, Cengiz, Gore, Jeff |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Superposition Yields Robust Neural Scaling
par: Liu, Yizhou, et autres
Publié: (2025)
par: Liu, Yizhou, et autres
Publié: (2025)
Inverse Depth Scaling From Most Layers Being Similar
par: Liu, Yizhou, et autres
Publié: (2026)
par: Liu, Yizhou, et autres
Publié: (2026)
Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
par: Halder, Indranil, et autres
Publié: (2025)
par: Halder, Indranil, et autres
Publié: (2025)
Neural Thermodynamic Laws for Large Language Model Training
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
Physics of Skill Learning
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover
par: Halder, Indranil, et autres
Publié: (2026)
par: Halder, Indranil, et autres
Publié: (2026)
A Resource Model For Neural Scaling Law
par: Song, Jinyeop, et autres
Publié: (2024)
par: Song, Jinyeop, et autres
Publié: (2024)
Error Broadcast and Decorrelation as a Potential Artificial and Natural Learning Mechanism
par: Erdogan, Mete, et autres
Publié: (2025)
par: Erdogan, Mete, et autres
Publié: (2025)
Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer
par: Lauditi, Clarissa, et autres
Publié: (2026)
par: Lauditi, Clarissa, et autres
Publié: (2026)
Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment
par: Uzun, Mustafa, et autres
Publié: (2026)
par: Uzun, Mustafa, et autres
Publié: (2026)
FOCUS: First Order Concentrated Updating Scheme
par: Liu, Yizhou, et autres
Publié: (2025)
par: Liu, Yizhou, et autres
Publié: (2025)
Superposition unifies power-law training dynamics
par: Chen, Zixin Jessie, et autres
Publié: (2026)
par: Chen, Zixin Jessie, et autres
Publié: (2026)
Boule or Baguette? A Study on Task Topology, Length Generalization, and the Benefit of Reasoning Traces
par: Tong, William L., et autres
Publié: (2026)
par: Tong, William L., et autres
Publié: (2026)
The Blessing of Dimensionality in LLM Fine-tuning: A Variance-Curvature Perspective
par: Liang, Qiyao, et autres
Publié: (2026)
par: Liang, Qiyao, et autres
Publié: (2026)
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
par: Meterez, Alexandru, et autres
Publié: (2026)
par: Meterez, Alexandru, et autres
Publié: (2026)
Pixel-Based Similarities as an Alternative to Neural Data for Improving Convolutional Neural Network Adversarial Robustness
par: Attias, Elie, et autres
Publié: (2024)
par: Attias, Elie, et autres
Publié: (2024)
Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling
par: Meterez, Alexandru, et autres
Publié: (2025)
par: Meterez, Alexandru, et autres
Publié: (2025)
Estimating the Empowerment of Language Model Agents
par: Song, Jinyeop, et autres
Publié: (2025)
par: Song, Jinyeop, et autres
Publié: (2025)
Three Mechanisms of Feature Learning in a Linear Network
par: Xu, Yizhou, et autres
Publié: (2024)
par: Xu, Yizhou, et autres
Publié: (2024)
Emergence and Effectiveness of Task Vectors in In-Context Learning: An Encoder Decoder Perspective
par: Han, Seungwook, et autres
Publié: (2024)
par: Han, Seungwook, et autres
Publié: (2024)
TimeDiT: General-purpose Diffusion Transformers for Time Series Foundation Model
par: Cao, Defu, et autres
Publié: (2024)
par: Cao, Defu, et autres
Publié: (2024)
Don't be lazy: CompleteP enables compute-efficient deep transformers
par: Dey, Nolan, et autres
Publié: (2025)
par: Dey, Nolan, et autres
Publié: (2025)
Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models
par: Ren, Zirui, et autres
Publié: (2026)
par: Ren, Zirui, et autres
Publié: (2026)
A Neural Scaling Law from Lottery Ticket Ensembling
par: Liu, Ziming, et autres
Publié: (2023)
par: Liu, Ziming, et autres
Publié: (2023)
When Does Learning Renormalize? Sufficient Conditions for Power Law Spectral Dynamics
par: Zhang, Yizhou
Publié: (2025)
par: Zhang, Yizhou
Publié: (2025)
How Feature Learning Can Improve Neural Scaling Laws
par: Bordelon, Blake, et autres
Publié: (2024)
par: Bordelon, Blake, et autres
Publié: (2024)
Theory of Scaling Laws for In-Context Regression: Depth, Width, Context and Time
par: Bordelon, Blake, et autres
Publié: (2025)
par: Bordelon, Blake, et autres
Publié: (2025)
Do Two AI Scientists Agree?
par: Fu, Xinghong, et autres
Publié: (2025)
par: Fu, Xinghong, et autres
Publié: (2025)
Disordered Dynamics in High Dimensions: Connections to Random Matrices and Machine Learning
par: Bordelon, Blake, et autres
Publié: (2026)
par: Bordelon, Blake, et autres
Publié: (2026)
DRTA: Dynamic Reward Scaling for Reinforcement Learning in Time Series Anomaly Detection
par: Golchin, Bahareh, et autres
Publié: (2025)
par: Golchin, Bahareh, et autres
Publié: (2025)
A Random Matrix Theory Perspective on the Consistency of Diffusion Models
par: Wang, Binxu, et autres
Publié: (2026)
par: Wang, Binxu, et autres
Publié: (2026)
Accelerated Online Reinforcement Learning using Auxiliary Start State Distributions
par: Mehra, Aman, et autres
Publié: (2025)
par: Mehra, Aman, et autres
Publié: (2025)
Remove Symmetries to Control Model Expressivity and Improve Optimization
par: Ziyin, Liu, et autres
Publié: (2024)
par: Ziyin, Liu, et autres
Publié: (2024)
Exploring Nutritional Impact on Alzheimer's Mortality: An Explainable AI Approach
par: Liu, Ziming, et autres
Publié: (2024)
par: Liu, Ziming, et autres
Publié: (2024)
Learning Curves for Noisy Heterogeneous Feature-Subsampled Ridge Ensembles
par: Ruben, Benjamin S., et autres
Publié: (2023)
par: Ruben, Benjamin S., et autres
Publié: (2023)
MLPs Learn In-Context on Regression and Classification Tasks
par: Tong, William L., et autres
Publié: (2024)
par: Tong, William L., et autres
Publié: (2024)
Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign
par: Li, Jiahui, et autres
Publié: (2026)
par: Li, Jiahui, et autres
Publié: (2026)
Learning richness modulates equality reasoning in neural networks
par: Tong, William L., et autres
Publié: (2025)
par: Tong, William L., et autres
Publié: (2025)
Convex Relaxation for Solving Large-Margin Classifiers in Hyperbolic Space
par: Yang, Sheng, et autres
Publié: (2024)
par: Yang, Sheng, et autres
Publié: (2024)
A Dynamical Model of Neural Scaling Laws
par: Bordelon, Blake, et autres
Publié: (2024)
par: Bordelon, Blake, et autres
Publié: (2024)
Documents similaires
-
Superposition Yields Robust Neural Scaling
par: Liu, Yizhou, et autres
Publié: (2025) -
Inverse Depth Scaling From Most Layers Being Similar
par: Liu, Yizhou, et autres
Publié: (2026) -
Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
par: Halder, Indranil, et autres
Publié: (2025) -
Neural Thermodynamic Laws for Large Language Model Training
par: Liu, Ziming, et autres
Publié: (2025) -
Physics of Skill Learning
par: Liu, Ziming, et autres
Publié: (2025)