Get rich quick: exact solutions reveal how unbalanced initializations promote rapid feature learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kunin, Daniel, Raventós, Allan, Dominé, Clémentine, Chen, Feng, Klindt, David, Saxe, Andrew, Ganguli, Surya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deriving Neural Scaling Laws from the statistics of natural language
di: Cagnetta, Francesco, et al.
Pubblicazione: (2026)
di: Cagnetta, Francesco, et al.
Pubblicazione: (2026)
Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks
di: Chen, Feng, et al.
Pubblicazione: (2023)
di: Chen, Feng, et al.
Pubblicazione: (2023)
Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing
di: Njaradi, Valentina, et al.
Pubblicazione: (2026)
di: Njaradi, Valentina, et al.
Pubblicazione: (2026)
From Lazy to Rich: Exact Learning Dynamics in Deep Linear Networks
di: Dominé, Clémentine C. J., et al.
Pubblicazione: (2024)
di: Dominé, Clémentine C. J., et al.
Pubblicazione: (2024)
A Theory of Initialisation's Impact on Specialisation
di: Jarvis, Devon, et al.
Pubblicazione: (2025)
di: Jarvis, Devon, et al.
Pubblicazione: (2025)
A Theory of How Pretraining Shapes Inductive Bias in Fine-Tuning
di: Anguita, Nicolas, et al.
Pubblicazione: (2026)
di: Anguita, Nicolas, et al.
Pubblicazione: (2026)
An analytic theory of creativity in convolutional diffusion models
di: Kamb, Mason, et al.
Pubblicazione: (2024)
di: Kamb, Mason, et al.
Pubblicazione: (2024)
Fooling LLM graders into giving better grades through neural activity guided adversarial prompting
di: Yamamura, Atsushi, et al.
Pubblicazione: (2024)
di: Yamamura, Atsushi, et al.
Pubblicazione: (2024)
Features are fate: a theory of transfer learning in high-dimensional regression
di: Tahir, Javan, et al.
Pubblicazione: (2024)
di: Tahir, Javan, et al.
Pubblicazione: (2024)
Early learning of the optimal constant solution in neural networks and humans
di: Rubruck, Jirko, et al.
Pubblicazione: (2024)
di: Rubruck, Jirko, et al.
Pubblicazione: (2024)
Error‐controlled feature selection for ultrahigh‐dimensional and highly correlated feature space using deep learning
di: Arkaprabha Ganguli, et al.
Pubblicazione: (2024)
di: Arkaprabha Ganguli, et al.
Pubblicazione: (2024)
Superposition disentanglement of neural representations reveals hidden alignment
di: Longon, André, et al.
Pubblicazione: (2025)
di: Longon, André, et al.
Pubblicazione: (2025)
Alternating Gradient Flows: A Theory of Feature Learning in Two-layer Neural Networks
di: Kunin, Daniel, et al.
Pubblicazione: (2025)
di: Kunin, Daniel, et al.
Pubblicazione: (2025)
The geometry and dynamics of annealed optimization in the coherent Ising machine with hidden and planted solutions
di: Ghimenti, Federico, et al.
Pubblicazione: (2025)
di: Ghimenti, Federico, et al.
Pubblicazione: (2025)
Propiedad, libertad republicana y Renta Básica de Ciudadanía
di: Daniel Raventós
Pubblicazione: (2005)
di: Daniel Raventós
Pubblicazione: (2005)
Solving adversarial examples requires solving exponential misalignment
di: Salvatore, Alessandro, et al.
Pubblicazione: (2026)
di: Salvatore, Alessandro, et al.
Pubblicazione: (2026)
Lorentz-boosted diffusion: initial value formulation and exact solutions
di: Gavassino, Lorenzo
Pubblicazione: (2026)
di: Gavassino, Lorenzo
Pubblicazione: (2026)
Machine learning reveals features of spinon Fermi surface
di: Zhang, Kevin, et al.
Pubblicazione: (2023)
di: Zhang, Kevin, et al.
Pubblicazione: (2023)
Short-term plasticity recalls forgotten memories through a trampoline mechanism
di: Del Gaudio, Martina, et al.
Pubblicazione: (2025)
di: Del Gaudio, Martina, et al.
Pubblicazione: (2025)
APUNTES SOBRE EL RAP POLÍTICO BOLIVIANO
di: Johana Kunin
Pubblicazione: (2009)
di: Johana Kunin
Pubblicazione: (2009)
Percepción social del riesgo y dinâmicas de género en la producción agrícola basada en plaguicidas en la pampa húmeda Argentina
di: Johana Kunin
Pubblicazione: (2020)
di: Johana Kunin
Pubblicazione: (2020)
Reseña de "Ciberculturas juveniles. Los jóvenes, sus prácticas y sus representaciones en la era de Internet" de Marcelo Urresti (edit.)
di: Johana Kunin
Pubblicazione: (2008)
di: Johana Kunin
Pubblicazione: (2008)
Pariendo madres: talleres de parto y de crianza en un distrito rural bonaerense
di: Johana Kunin
Pubblicazione: (2021)
di: Johana Kunin
Pubblicazione: (2021)
Los "medio putos": masculinidades subalternas y dinámicas de género alternativas en la rural Pampa húmeda argentina (2014-2017)
di: Johana Kunin
Pubblicazione: (2021)
di: Johana Kunin
Pubblicazione: (2021)
Cuando los paradigmas agroecológicos y del parto respetado no encuentran las respuestas esperadas
di: Johana Kunin
Pubblicazione: (2022)
di: Johana Kunin
Pubblicazione: (2022)
“Acá se sabe si la gente se aísla”: (anti)anonimato, cuidado y poder en localidades medianas y pequeñas en tiempos de COVID-19
di: Johana Kunin
Pubblicazione: (2021)
di: Johana Kunin
Pubblicazione: (2021)
What is the $\textit{intrinsic}$ dimension of your binary data? -- and how to compute it quickly
di: Hanika, Tom, et al.
Pubblicazione: (2024)
di: Hanika, Tom, et al.
Pubblicazione: (2024)
Contrastive Concept-Tree Search for LLM-Assisted Algorithm Discovery
di: Leleu, Timothee, et al.
Pubblicazione: (2026)
di: Leleu, Timothee, et al.
Pubblicazione: (2026)
From Kepler to Newton: Inductive Biases Guide Learned World Models in Transformers
di: Liu, Ziming, et al.
Pubblicazione: (2026)
di: Liu, Ziming, et al.
Pubblicazione: (2026)
Reshaping Global Loop Structure to Accelerate Local Optimization by Smoothing Rugged Landscapes
di: Leleu, Timothee, et al.
Pubblicazione: (2026)
di: Leleu, Timothee, et al.
Pubblicazione: (2026)
Data Whitening Improves Sparse Autoencoder Learning
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
Sea-bed photographs (benthos) along ROV profile PS12/305
di: Gutt, Julian, et al.
Pubblicazione: (2013)
di: Gutt, Julian, et al.
Pubblicazione: (2013)
Sea-bed photographs (benthos) along ROV profile PS12/308
di: Gutt, Julian, et al.
Pubblicazione: (2013)
di: Gutt, Julian, et al.
Pubblicazione: (2013)
Sea-floor videos and photographs (benthos) along 16 ROV profiles during POLARSTERN cruise ANT-VI/3, Weddell Sea
di: Gutt, Julian, et al.
Pubblicazione: (2011)
di: Gutt, Julian, et al.
Pubblicazione: (2011)
Softmax $\geq$ Linear: Transformers may learn to classify in-context by kernel gradient descent
di: Dragutinović, Sara, et al.
Pubblicazione: (2025)
di: Dragutinović, Sara, et al.
Pubblicazione: (2025)
Exact values for unbalanced Zarankiewicz numbers
di: Chen, Guangzhou, et al.
Pubblicazione: (2022)
di: Chen, Guangzhou, et al.
Pubblicazione: (2022)
Large analysis of genetic manipulations reveals an inverse correlation between initial alcohol resistance and rapid tolerance phenotypes
di: Maggie M. Chvilicek, et al.
Pubblicazione: (2024)
di: Maggie M. Chvilicek, et al.
Pubblicazione: (2024)
Lo que fue ya no es y lo nuevo aún no toma forma: elecciones 2006 en perspectiva histórica
di: Ciska Raventós
Pubblicazione: (2008)
di: Ciska Raventós
Pubblicazione: (2008)
Combo del ICE en el momento culminante De las protestas Sondeo telefónico 24-25 de marzo del 2000
di: Ciska Raventós
Pubblicazione: (2004)
di: Ciska Raventós
Pubblicazione: (2004)
Documenti analoghi
-
Deriving Neural Scaling Laws from the statistics of natural language
di: Cagnetta, Francesco, et al.
Pubblicazione: (2026) -
Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks
di: Chen, Feng, et al.
Pubblicazione: (2023) -
Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
di: Chen, Feng, et al.
Pubblicazione: (2025) -
Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing
di: Njaradi, Valentina, et al.
Pubblicazione: (2026) -
From Lazy to Rich: Exact Learning Dynamics in Deep Linear Networks
di: Dominé, Clémentine C. J., et al.
Pubblicazione: (2024)