Inverse Depth Scaling From Most Layers Being Similar
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yizhou, Kangaslahti, Sara, Liu, Ziming, Gore, Jeff |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Superposition Yields Robust Neural Scaling
par: Liu, Yizhou, et autres
Publié: (2025)
par: Liu, Yizhou, et autres
Publié: (2025)
Universal One-third Time Scaling in Learning Peaked Distributions
par: Liu, Yizhou, et autres
Publié: (2026)
par: Liu, Yizhou, et autres
Publié: (2026)
Neural Thermodynamic Laws for Large Language Model Training
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
Inverse Approximation Theory for Nonlinear Recurrent Neural Networks
par: Wang, Shida, et autres
Publié: (2023)
par: Wang, Shida, et autres
Publié: (2023)
A Resource Model For Neural Scaling Law
par: Song, Jinyeop, et autres
Publié: (2024)
par: Song, Jinyeop, et autres
Publié: (2024)
Language models as master equation solvers
par: Liu, Chuanbo, et autres
Publié: (2023)
par: Liu, Chuanbo, et autres
Publié: (2023)
Complex fractal trainability boundary can arise from trivial non-convexity
par: Liu, Yizhou
Publié: (2024)
par: Liu, Yizhou
Publié: (2024)
Manifold Trajectories in Next-Token Prediction: From Replicator Dynamics to Softmax Equilibrium
par: Lee-Jenkins, Christopher R.
Publié: (2025)
par: Lee-Jenkins, Christopher R.
Publié: (2025)
Physics of Skill Learning
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
Second Order Ensemble Langevin Method for Sampling and Inverse Problems
par: Liu, Ziming, et autres
Publié: (2022)
par: Liu, Ziming, et autres
Publié: (2022)
Horizon-Constrained Rashomon Sets for Chaotic Forecasting
par: Kale, Gauri, et autres
Publié: (2026)
par: Kale, Gauri, et autres
Publié: (2026)
True Zero-Shot Inference of Dynamical Systems Preserving Long-Term Statistics
par: Hemmer, Christoph Jürgen, et autres
Publié: (2025)
par: Hemmer, Christoph Jürgen, et autres
Publié: (2025)
Out-of-Domain Generalization in Dynamical Systems Reconstruction
par: Göring, Niclas, et autres
Publié: (2024)
par: Göring, Niclas, et autres
Publié: (2024)
Optimal Recurrent Network Topologies for Dynamical Systems Reconstruction
par: Hemmer, Christoph Jürgen, et autres
Publié: (2024)
par: Hemmer, Christoph Jürgen, et autres
Publié: (2024)
A Mathematical Conflict Framework for Contextual Data Modulation
par: Kartal, Hakan Emre
Publié: (2026)
par: Kartal, Hakan Emre
Publié: (2026)
Dynamical Systems Theory Behind a Hierarchical Reasoning Model
par: Es'kin, Vasiliy A., et autres
Publié: (2026)
par: Es'kin, Vasiliy A., et autres
Publié: (2026)
Large-Step Training Dynamics of a Two-Factor Linear Transformer Model
par: Balasubramanian, Krishnakumar
Publié: (2026)
par: Balasubramanian, Krishnakumar
Publié: (2026)
Late Fusion Neural Operators for Extrapolation Across Parameter Space in Partial Differential Equations
par: van Tegelen, Eva, et autres
Publié: (2026)
par: van Tegelen, Eva, et autres
Publié: (2026)
Position: Why a Dynamical Systems Perspective is Needed to Advance Time Series Modeling
par: Durstewitz, Daniel, et autres
Publié: (2026)
par: Durstewitz, Daniel, et autres
Publié: (2026)
A Minimal Bifurcation Model of Load Imbalance in a Softmax Mixture-of-Experts Router
par: Kiselev, O. M.
Publié: (2026)
par: Kiselev, O. M.
Publié: (2026)
A-PINN: Auxiliary Physics-informed Neural Networks for Structural Vibration Analysis in Continuous Euler-Bernoulli Beam
par: Saini, Shivani, et autres
Publié: (2025)
par: Saini, Shivani, et autres
Publié: (2025)
Identifying Equivalent Training Dynamics
par: Redman, William T., et autres
Publié: (2023)
par: Redman, William T., et autres
Publié: (2023)
Detecting Invariant Manifolds in ReLU-Based RNNs
par: Eisenmann, Lukas, et autres
Publié: (2025)
par: Eisenmann, Lukas, et autres
Publié: (2025)
Decomposing heterogeneous dynamical systems with graph neural networks
par: Allier, Cédric, et autres
Publié: (2024)
par: Allier, Cédric, et autres
Publié: (2024)
Improved deep learning of chaotic dynamical systems with multistep penalty losses
par: Chakraborty, Dibyajyoti, et autres
Publié: (2024)
par: Chakraborty, Dibyajyoti, et autres
Publié: (2024)
A Hybrid Approach of Transfer Learning and Physics-Informed Modeling: Improving Dissolved Oxygen Concentration Prediction in an Industrial Wastewater Treatment Plant
par: Koksal, Ece S., et autres
Publié: (2024)
par: Koksal, Ece S., et autres
Publié: (2024)
On the Limitations of Fractal Dimension as a Measure of Generalization
par: Tan, Charlie B., et autres
Publié: (2024)
par: Tan, Charlie B., et autres
Publié: (2024)
The Recurrent Sticky Hierarchical Dirichlet Process Hidden Markov Model
par: Słupiński, Mikołaj, et autres
Publié: (2024)
par: Słupiński, Mikołaj, et autres
Publié: (2024)
Bayesian Inference in Recurrent Explicit Duration Switching Linear Dynamical Systems
par: Słupiński, Mikołaj, et autres
Publié: (2024)
par: Słupiński, Mikołaj, et autres
Publié: (2024)
On the dimension of pullback attractors in recurrent neural networks
par: Fadera, Muhammed
Publié: (2025)
par: Fadera, Muhammed
Publié: (2025)
Confabulation dynamics in a reservoir computer: Filling in the gaps with untrained attractors
par: O'Hagan, Jack, et autres
Publié: (2025)
par: O'Hagan, Jack, et autres
Publié: (2025)
Sparse identification of nonlinear dynamics and Koopman operators with Shallow Recurrent Decoder Networks
par: Gao, Mars Liyao, et autres
Publié: (2025)
par: Gao, Mars Liyao, et autres
Publié: (2025)
Memory in Plain Sight: Surveying the Uncanny Resemblances of Associative Memories and Diffusion Models
par: Hoover, Benjamin, et autres
Publié: (2023)
par: Hoover, Benjamin, et autres
Publié: (2023)
Improving physics-informed neural network extrapolation via transfer learning and adaptive activation functions
par: Papastathopoulos-Katsaros, Athanasios, et autres
Publié: (2025)
par: Papastathopoulos-Katsaros, Athanasios, et autres
Publié: (2025)
Hybrid Energy-Based Models for Physical AI: Provably Stable Identification of Port-Hamiltonian Dynamics
par: Betteti, Simone, et autres
Publié: (2026)
par: Betteti, Simone, et autres
Publié: (2026)
Kernel Dynamics under Path Entropy Maximization
par: Das, Jnaneshwar
Publié: (2026)
par: Das, Jnaneshwar
Publié: (2026)
How to Tame Your LLM: Semantic Collapse in Continuous Systems
par: Wyss, C. M.
Publié: (2025)
par: Wyss, C. M.
Publié: (2025)
A Hybrid Adaptive Velocity Aided Navigation Filter with Application to INS/DVL Fusion
par: Or, Barak, et autres
Publié: (2022)
par: Or, Barak, et autres
Publié: (2022)
Learning Chaotic Systems and Long-Term Predictions with Neural Jump ODEs
par: Krach, Florian, et autres
Publié: (2024)
par: Krach, Florian, et autres
Publié: (2024)
FOCUS: First Order Concentrated Updating Scheme
par: Liu, Yizhou, et autres
Publié: (2025)
par: Liu, Yizhou, et autres
Publié: (2025)
Documents similaires
-
Superposition Yields Robust Neural Scaling
par: Liu, Yizhou, et autres
Publié: (2025) -
Universal One-third Time Scaling in Learning Peaked Distributions
par: Liu, Yizhou, et autres
Publié: (2026) -
Neural Thermodynamic Laws for Large Language Model Training
par: Liu, Ziming, et autres
Publié: (2025) -
Inverse Approximation Theory for Nonlinear Recurrent Neural Networks
par: Wang, Shida, et autres
Publié: (2023) -
A Resource Model For Neural Scaling Law
par: Song, Jinyeop, et autres
Publié: (2024)