Understanding Gradient Descent through the Training Jacobian
Fuente:
arXiv
Salvato in:
| Autori principali: | Belrose, Nora, Scherlis, Adam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Estimating the Probability of Sampling a Trained Neural Network at Random
di: Scherlis, Adam, et al.
Pubblicazione: (2025)
di: Scherlis, Adam, et al.
Pubblicazione: (2025)
Refusal in LLMs is an Affine Function
di: Marshall, Thomas, et al.
Pubblicazione: (2024)
di: Marshall, Thomas, et al.
Pubblicazione: (2024)
Sparse Autoencoders Trained on the Same Data Learn Different Features
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Balancing Label Quantity and Quality for Scalable Elicitation
di: Mallen, Alex, et al.
Pubblicazione: (2024)
di: Mallen, Alex, et al.
Pubblicazione: (2024)
Evaluating SAE interpretability without explanations
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Slowing Learning by Erasing Simple Features
di: Quirke, Lucia, et al.
Pubblicazione: (2025)
di: Quirke, Lucia, et al.
Pubblicazione: (2025)
Converting MLPs into Polynomials in Closed Form
di: Belrose, Nora, et al.
Pubblicazione: (2025)
di: Belrose, Nora, et al.
Pubblicazione: (2025)
Gradient Flossing: Improving Gradient Descent through Dynamic Control of Jacobians
di: Engelken, Rainer
Pubblicazione: (2023)
di: Engelken, Rainer
Pubblicazione: (2023)
Partially Rewriting a Transformer in Natural Language
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Examining Two Hop Reasoning Through Information Content Scaling
di: Johnston, David, et al.
Pubblicazione: (2025)
di: Johnston, David, et al.
Pubblicazione: (2025)
Binary Sparse Coding for Interpretability
di: Quirke, Lucia, et al.
Pubblicazione: (2025)
di: Quirke, Lucia, et al.
Pubblicazione: (2025)
Transcoders Beat Sparse Autoencoders for Interpretability
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Does Transformer Interpretability Transfer to RNNs?
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
Mechanistic Anomaly Detection for "Quirky" Language Models
di: Johnston, David O., et al.
Pubblicazione: (2025)
di: Johnston, David O., et al.
Pubblicazione: (2025)
Jacobian Descent for Multi-Objective Optimization
di: Quinton, Pierre, et al.
Pubblicazione: (2024)
di: Quinton, Pierre, et al.
Pubblicazione: (2024)
Automatically Interpreting Millions of Features in Large Language Models
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
Towards Understanding the Generalizability of Delayed Stochastic Gradient Descent
di: Deng, Xiaoge, et al.
Pubblicazione: (2023)
di: Deng, Xiaoge, et al.
Pubblicazione: (2023)
Training Instabilities Induce Flatness Bias in Gradient Descent
di: Wang, Lawrence, et al.
Pubblicazione: (2025)
di: Wang, Lawrence, et al.
Pubblicazione: (2025)
Neural Networks Learn Statistics of Increasing Complexity
di: Belrose, Nora, et al.
Pubblicazione: (2024)
di: Belrose, Nora, et al.
Pubblicazione: (2024)
Eliciting Latent Knowledge from Quirky Language Models
di: Mallen, Alex, et al.
Pubblicazione: (2023)
di: Mallen, Alex, et al.
Pubblicazione: (2023)
Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training
di: Zhao, Shen-Yi, et al.
Pubblicazione: (2020)
di: Zhao, Shen-Yi, et al.
Pubblicazione: (2020)
Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression
di: Jiang, Jiarui, et al.
Pubblicazione: (2025)
di: Jiang, Jiarui, et al.
Pubblicazione: (2025)
Occam Gradient Descent
di: Kausik, B. N.
Pubblicazione: (2024)
di: Kausik, B. N.
Pubblicazione: (2024)
Understanding the Implicit Regularization of Gradient Descent in Over-parameterized Models
di: Ma, Jianhao, et al.
Pubblicazione: (2025)
di: Ma, Jianhao, et al.
Pubblicazione: (2025)
Superpositional Gradient Descent: Harnessing Quantum Principles for Model Training
di: Pamuk, Ahmet Erdem, et al.
Pubblicazione: (2025)
di: Pamuk, Ahmet Erdem, et al.
Pubblicazione: (2025)
Mirror and Preconditioned Gradient Descent in Wasserstein Space
di: Bonet, Clément, et al.
Pubblicazione: (2024)
di: Bonet, Clément, et al.
Pubblicazione: (2024)
Can Stability be Detrimental? Better Generalization through Gradient Descent Instabilities
di: Wang, Lawrence, et al.
Pubblicazione: (2024)
di: Wang, Lawrence, et al.
Pubblicazione: (2024)
Improving Energy Natural Gradient Descent through Woodbury, Momentum, and Randomization
di: Guzmán-Cordero, Andrés, et al.
Pubblicazione: (2025)
di: Guzmán-Cordero, Andrés, et al.
Pubblicazione: (2025)
Step by Step: Adaptive Gradient Descent for Training L-Lipschitz Neural Networks
di: Sung, Kyle, et al.
Pubblicazione: (2025)
di: Sung, Kyle, et al.
Pubblicazione: (2025)
Stacking as Accelerated Gradient Descent
di: Agarwal, Naman, et al.
Pubblicazione: (2024)
di: Agarwal, Naman, et al.
Pubblicazione: (2024)
Polysemanticity and Capacity in Neural Networks
di: Scherlis, Adam, et al.
Pubblicazione: (2022)
di: Scherlis, Adam, et al.
Pubblicazione: (2022)
Stochastic Adaptive Gradient Descent Without Descent
di: Aujol, Jean-François, et al.
Pubblicazione: (2025)
di: Aujol, Jean-François, et al.
Pubblicazione: (2025)
Gradient Descent Robustly Learns the Intrinsic Dimension of Data in Training Convolutional Neural Networks
di: Zhang, Chenyang, et al.
Pubblicazione: (2025)
di: Zhang, Chenyang, et al.
Pubblicazione: (2025)
Corner Gradient Descent
di: Yarotsky, Dmitry
Pubblicazione: (2025)
di: Yarotsky, Dmitry
Pubblicazione: (2025)
Training on the Edge of Stability Is Caused by Layerwise Jacobian Alignment
di: Lowell, Mark, et al.
Pubblicazione: (2024)
di: Lowell, Mark, et al.
Pubblicazione: (2024)
High-Dimensional Privacy-Utility Dynamics of Noisy Stochastic Gradient Descent on Least Squares
di: Lin, Shurong, et al.
Pubblicazione: (2025)
di: Lin, Shurong, et al.
Pubblicazione: (2025)
Robust Gradient Descent for Phase Retrieval
di: Buna, Alex, et al.
Pubblicazione: (2024)
di: Buna, Alex, et al.
Pubblicazione: (2024)
Distributed Gradient Descent for Functional Learning
di: Yu, Zhan, et al.
Pubblicazione: (2023)
di: Yu, Zhan, et al.
Pubblicazione: (2023)
On the Generalization of Stochastic Gradient Descent with Momentum
di: Ramezani-Kebrya, Ali, et al.
Pubblicazione: (2018)
di: Ramezani-Kebrya, Ali, et al.
Pubblicazione: (2018)
Approximation and Gradient Descent Training with Neural Networks
di: Welper, G.
Pubblicazione: (2024)
di: Welper, G.
Pubblicazione: (2024)
Documenti analoghi
-
Estimating the Probability of Sampling a Trained Neural Network at Random
di: Scherlis, Adam, et al.
Pubblicazione: (2025) -
Refusal in LLMs is an Affine Function
di: Marshall, Thomas, et al.
Pubblicazione: (2024) -
Sparse Autoencoders Trained on the Same Data Learn Different Features
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025) -
Balancing Label Quantity and Quality for Scalable Elicitation
di: Mallen, Alex, et al.
Pubblicazione: (2024) -
Evaluating SAE interpretability without explanations
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)