Enregistré dans:
| Auteurs principaux: | Galanti, Tomer, Siegel, Zachary S., Gupte, Aparna, Poggio, Tomaso |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2206.05794 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Formation of Representations in Neural Networks
par: Ziyin, Liu, et autres
Publié: (2024)
par: Ziyin, Liu, et autres
Publié: (2024)
How Neural Networks Learn the Support is an Implicit Regularization Effect of SGD
par: Beneventano, Pierfrancesco, et autres
Publié: (2024)
par: Beneventano, Pierfrancesco, et autres
Publié: (2024)
On Generalization Bounds for Neural Networks with Low Rank Layers
par: Pinto, Andrea, et autres
Publié: (2024)
par: Pinto, Andrea, et autres
Publié: (2024)
Does Weight Decay Enhance Training Stability?
par: Saether, Marius, et autres
Publié: (2026)
par: Saether, Marius, et autres
Publié: (2026)
Tool Building as a Path to "Superintelligence"
par: Koplow, David, et autres
Publié: (2026)
par: Koplow, David, et autres
Publié: (2026)
On efficiently computable functions, deep networks and sparse compositionality
par: Poggio, Tomaso
Publié: (2025)
par: Poggio, Tomaso
Publié: (2025)
Learning Sparse Compositional Functions with Norm-Constrained Neural Networks
par: Huang, Shuo, et autres
Publié: (2026)
par: Huang, Shuo, et autres
Publié: (2026)
On the Power of Decision Trees in Auto-Regressive Language Modeling
par: Gan, Yulu, et autres
Publié: (2024)
par: Gan, Yulu, et autres
Publié: (2024)
Directional Neural Collapse Explains Few-Shot Transfer in Self-Supervised Learning
par: Luthra, Achleshwar, et autres
Publié: (2026)
par: Luthra, Achleshwar, et autres
Publié: (2026)
Ubiquity of Emergent Hebbian Dynamics in Regularized Learning
par: Koplow, David, et autres
Publié: (2025)
par: Koplow, David, et autres
Publié: (2025)
Hierarchical Reasoning Models: Perspectives and Misconceptions
par: Ge, Renee, et autres
Publié: (2025)
par: Ge, Renee, et autres
Publié: (2025)
Agentic Systems as Boosting Weak Reasoning Models
par: Sunkaraneni, Varun, et autres
Publié: (2026)
par: Sunkaraneni, Varun, et autres
Publié: (2026)
pAI/MSc: ML Theory Research with Humans on the Loop
par: Abdelmoneum, Mahmoud, et autres
Publié: (2026)
par: Abdelmoneum, Mahmoud, et autres
Publié: (2026)
On the Alignment Between Supervised and Self-Supervised Contrastive Learning
par: Luthra, Achleshwar, et autres
Publié: (2025)
par: Luthra, Achleshwar, et autres
Publié: (2025)
Scalable Principal-Agent Contract Design via Gradient-Based Optimization
par: Galanti, Tomer, et autres
Publié: (2025)
par: Galanti, Tomer, et autres
Publié: (2025)
Self-Supervised Contrastive Learning is Approximately Supervised Contrastive Learning
par: Luthra, Achleshwar, et autres
Publié: (2025)
par: Luthra, Achleshwar, et autres
Publié: (2025)
Does Feedback Alignment Work at Biological Timescales?
par: Bacvanski, Marc Gong, et autres
Publié: (2025)
par: Bacvanski, Marc Gong, et autres
Publié: (2025)
Topological Invariance and Breakdown in Learning
par: Yang, Yongyi, et autres
Publié: (2025)
par: Yang, Yongyi, et autres
Publié: (2025)
Sparse Linear Regression and Lattice Problems
par: Gupte, Aparna, et autres
Publié: (2024)
par: Gupte, Aparna, et autres
Publié: (2024)
Iterative regularization in classification via hinge loss diagonal descent
par: Apidopoulos, Vassilis, et autres
Publié: (2022)
par: Apidopoulos, Vassilis, et autres
Publié: (2022)
The Fair Language Model Paradox
par: Pinto, Andrea, et autres
Publié: (2024)
par: Pinto, Andrea, et autres
Publié: (2024)
Unraveling Syntax: How Language Models Learn Context-Free Grammars
par: Schulz, Laura Ying, et autres
Publié: (2025)
par: Schulz, Laura Ying, et autres
Publié: (2025)
Heterosynaptic Circuits Are Universal Gradient Machines
par: Ziyin, Liu, et autres
Publié: (2025)
par: Ziyin, Liu, et autres
Publié: (2025)
LLM Priors for ERM over Programs
par: Singhal, Shivam, et autres
Publié: (2025)
par: Singhal, Shivam, et autres
Publié: (2025)
Exact Mean Square Linear Stability Analysis for SGD
par: Mulayoff, Rotem, et autres
Publié: (2023)
par: Mulayoff, Rotem, et autres
Publié: (2023)
Too Sharp, Too Sure: When Calibration Follows Curvature
par: Morosini, Alessandro, et autres
Publié: (2026)
par: Morosini, Alessandro, et autres
Publié: (2026)
From SGD to Spectra: A Theory of Neural Network Weight Dynamics
par: Olsen, Brian Richard, et autres
Publié: (2025)
par: Olsen, Brian Richard, et autres
Publié: (2025)
Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias
par: Das, Mohua, et autres
Publié: (2026)
par: Das, Mohua, et autres
Publié: (2026)
Parameter Symmetry Potentially Unifies Deep Learning Theory
par: Ziyin, Liu, et autres
Publié: (2025)
par: Ziyin, Liu, et autres
Publié: (2025)
SGD as Free Energy Minimization: A Thermodynamic View on Neural Network Training
par: Sadrtdinov, Ildus, et autres
Publié: (2025)
par: Sadrtdinov, Ildus, et autres
Publié: (2025)
Learning Multi-Index Models with Hyper-Kernel Ridge Regression
par: Huang, Shuo, et autres
Publié: (2025)
par: Huang, Shuo, et autres
Publié: (2025)
Position: A Theory of Deep Learning Must Include Compositional Sparsity
par: Danhofer, David A., et autres
Publié: (2025)
par: Danhofer, David A., et autres
Publié: (2025)
Momentum Further Constrains Sharpness at the Edge of Stochastic Stability
par: Andreyev, Arseniy, et autres
Publié: (2026)
par: Andreyev, Arseniy, et autres
Publié: (2026)
The Generalized Turing Test: A Foundation for Comparing Intelligence
par: Mitropolsky, Daniel, et autres
Publié: (2026)
par: Mitropolsky, Daniel, et autres
Publié: (2026)
Same Error, Different Function: The Optimizer as an Implicit Prior in Financial Time Series
par: Cortesi, Federico Vittorio, et autres
Publié: (2026)
par: Cortesi, Federico Vittorio, et autres
Publié: (2026)
Type-II Saddles and Probabilistic Stability of Stochastic Gradient Descent
par: Ziyin, Liu, et autres
Publié: (2023)
par: Ziyin, Liu, et autres
Publié: (2023)
Information Filtering Networks: Theoretical Foundations, Generative Methodologies, and Real-World Applications
par: Aste, Tomaso
Publié: (2025)
par: Aste, Tomaso
Publié: (2025)
DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
par: Li, Gang, et autres
Publié: (2025)
par: Li, Gang, et autres
Publié: (2025)
Fast Last-Iterate Convergence of SGD in the Smooth Interpolation Regime
par: Attia, Amit, et autres
Publié: (2025)
par: Attia, Amit, et autres
Publié: (2025)
Wide Neural Networks Trained with Weight Decay Provably Exhibit Neural Collapse
par: Jacot, Arthur, et autres
Publié: (2024)
par: Jacot, Arthur, et autres
Publié: (2024)
Documents similaires
-
Formation of Representations in Neural Networks
par: Ziyin, Liu, et autres
Publié: (2024) -
How Neural Networks Learn the Support is an Implicit Regularization Effect of SGD
par: Beneventano, Pierfrancesco, et autres
Publié: (2024) -
On Generalization Bounds for Neural Networks with Low Rank Layers
par: Pinto, Andrea, et autres
Publié: (2024) -
Does Weight Decay Enhance Training Stability?
par: Saether, Marius, et autres
Publié: (2026) -
Tool Building as a Path to "Superintelligence"
par: Koplow, David, et autres
Publié: (2026)