How Does Preconditioning Guide Feature Learning in Deep Neural Networks?
Fuente:
arXiv
Salvato in:
| Autori principali: | Yoshida, Kotaro, Nitanda, Atsushi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved Particle Approximation Error for Mean Field Neural Networks
di: Nitanda, Atsushi
Pubblicazione: (2024)
di: Nitanda, Atsushi
Pubblicazione: (2024)
Towards a Unified Analysis of Neural Networks in Nonparametric Instrumental Variable Regression: Optimization and Generalization
di: Chen, Zonghao, et al.
Pubblicazione: (2025)
di: Chen, Zonghao, et al.
Pubblicazione: (2025)
Uniform convergence of the smooth calibration error and its relationship with functional gradient
di: Futami, Futoshi, et al.
Pubblicazione: (2025)
di: Futami, Futoshi, et al.
Pubblicazione: (2025)
Alternating Diffusion for Proximal Sampling with Zeroth Order Queries
di: Takagi, Hirohane, et al.
Pubblicazione: (2026)
di: Takagi, Hirohane, et al.
Pubblicazione: (2026)
Slowly Annealed Langevin Dynamics: Theory and Applications to Training-Free Guided Generation
di: Nitanda, Atsushi, et al.
Pubblicazione: (2026)
di: Nitanda, Atsushi, et al.
Pubblicazione: (2026)
Statistical Analysis of the Sinkhorn Iterations for Two-Sample Schrödinger Bridge Estimation
di: Maeda, Ibuki, et al.
Pubblicazione: (2025)
di: Maeda, Ibuki, et al.
Pubblicazione: (2025)
Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes
di: Bossens, David M., et al.
Pubblicazione: (2025)
di: Bossens, David M., et al.
Pubblicazione: (2025)
Direct Distributional Optimization for Provable Alignment of Diffusion Models
di: Kawata, Ryotaro, et al.
Pubblicazione: (2025)
di: Kawata, Ryotaro, et al.
Pubblicazione: (2025)
Why is parameter averaging beneficial in SGD? An objective smoothing perspective
di: Nitanda, Atsushi, et al.
Pubblicazione: (2023)
di: Nitanda, Atsushi, et al.
Pubblicazione: (2023)
Robust Invariant Representation Learning by Distribution Extrapolation
di: Yoshida, Kotaro, et al.
Pubblicazione: (2025)
di: Yoshida, Kotaro, et al.
Pubblicazione: (2025)
How Does Overparameterization Affect Machine Unlearning of Deep Neural Networks?
di: Alon, Gal, et al.
Pubblicazione: (2025)
di: Alon, Gal, et al.
Pubblicazione: (2025)
Intrinsic Wasserstein Rates for Score-Based Generative Models on Smooth Manifolds
di: Fu, Guoji, et al.
Pubblicazione: (2026)
di: Fu, Guoji, et al.
Pubblicazione: (2026)
How Does Gradient Descent Learn Features -- A Local Analysis for Regularized Two-Layer Neural Networks
di: Zhou, Mo, et al.
Pubblicazione: (2024)
di: Zhou, Mo, et al.
Pubblicazione: (2024)
Preconditioning for Physics-Informed Neural Networks
di: Liu, Songming, et al.
Pubblicazione: (2024)
di: Liu, Songming, et al.
Pubblicazione: (2024)
Towards Understanding Variants of Invariant Risk Minimization through the Lens of Calibration
di: Yoshida, Kotaro, et al.
Pubblicazione: (2024)
di: Yoshida, Kotaro, et al.
Pubblicazione: (2024)
On the Neural Feature Ansatz for Deep Neural Networks
di: Tansley, Edward, et al.
Pubblicazione: (2025)
di: Tansley, Edward, et al.
Pubblicazione: (2025)
Koopman-based generalization bound: New aspect for full-rank weights
di: Hashimoto, Yuka, et al.
Pubblicazione: (2023)
di: Hashimoto, Yuka, et al.
Pubblicazione: (2023)
How Does Overparameterization Affect Features?
di: Duzgun, Ahmet Cagri, et al.
Pubblicazione: (2024)
di: Duzgun, Ahmet Cagri, et al.
Pubblicazione: (2024)
Provably Transformers Harness Multi-Concept Word Semantics for Efficient In-Context Learning
di: Bu, Dake, et al.
Pubblicazione: (2024)
di: Bu, Dake, et al.
Pubblicazione: (2024)
Propagation of Chaos for Mean-Field Langevin Dynamics and its Application to Model Ensemble
di: Nitanda, Atsushi, et al.
Pubblicazione: (2025)
di: Nitanda, Atsushi, et al.
Pubblicazione: (2025)
On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning
di: Zhang, Thomas T., et al.
Pubblicazione: (2025)
di: Zhang, Thomas T., et al.
Pubblicazione: (2025)
DP-KFC: Data-Free Preconditioning for Privacy-Preserving Deep Learning
di: Bosch, Marc Molina Van den, et al.
Pubblicazione: (2026)
di: Bosch, Marc Molina Van den, et al.
Pubblicazione: (2026)
Data Diversity as Implicit Regularization: How Does Diversity Shape the Weight Space of Deep Neural Networks?
di: Ba, Yang, et al.
Pubblicazione: (2024)
di: Ba, Yang, et al.
Pubblicazione: (2024)
Preconditioned Inexact Stochastic ADMM for Deep Model
di: Zhou, Shenglong, et al.
Pubblicazione: (2025)
di: Zhou, Shenglong, et al.
Pubblicazione: (2025)
Feature-Guided Analysis of Neural Networks: A Replication Study
di: Formica, Federico, et al.
Pubblicazione: (2025)
di: Formica, Federico, et al.
Pubblicazione: (2025)
Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation
di: Hwang, Jisung, et al.
Pubblicazione: (2026)
di: Hwang, Jisung, et al.
Pubblicazione: (2026)
SPADE: Sparsity-Guided Debugging for Deep Neural Networks
di: Moakhar, Arshia Soltani, et al.
Pubblicazione: (2023)
di: Moakhar, Arshia Soltani, et al.
Pubblicazione: (2023)
How Does a Deep Neural Network Look at Lexical Stress in English Words?
di: Allouche, Itai, et al.
Pubblicazione: (2025)
di: Allouche, Itai, et al.
Pubblicazione: (2025)
Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training
di: Bu, Dake, et al.
Pubblicazione: (2025)
di: Bu, Dake, et al.
Pubblicazione: (2025)
Preconditioned Neural Posterior Estimation for Likelihood-free Inference
di: Wang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Wang, Xiaoyu, et al.
Pubblicazione: (2024)
Neighborhood Sampling Does Not Learn the Same Graph Neural Network
di: Niu, Zehao, et al.
Pubblicazione: (2025)
di: Niu, Zehao, et al.
Pubblicazione: (2025)
Slicing Input Features to Accelerate Deep Learning: A Case Study with Graph Neural Networks
di: Xu, Zhengjia, et al.
Pubblicazione: (2024)
di: Xu, Zhengjia, et al.
Pubblicazione: (2024)
A Non-Monotone Preconditioned Trust-Region Method for Neural Network Training
di: Angino, Andrea, et al.
Pubblicazione: (2026)
di: Angino, Andrea, et al.
Pubblicazione: (2026)
On the Stability of Neural Networks in Deep Learning
di: Delattre, Blaise
Pubblicazione: (2025)
di: Delattre, Blaise
Pubblicazione: (2025)
How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?
di: Cheng, Xiaoyuan, et al.
Pubblicazione: (2026)
di: Cheng, Xiaoyuan, et al.
Pubblicazione: (2026)
Does Your Neural Network Extrapolate? Feature Engineering as Identifiability Bias for OOD Generalization
di: Aguilar, Leonel, et al.
Pubblicazione: (2026)
di: Aguilar, Leonel, et al.
Pubblicazione: (2026)
Inferring Data Preconditions from Deep Learning Models for Trustworthy Prediction in Deployment
di: Ahmed, Shibbir, et al.
Pubblicazione: (2024)
di: Ahmed, Shibbir, et al.
Pubblicazione: (2024)
Data-Parallel Neural Network Training via Nonlinearly Preconditioned Trust-Region Method
di: Alegría, Samuel A. Cruz, et al.
Pubblicazione: (2025)
di: Alegría, Samuel A. Cruz, et al.
Pubblicazione: (2025)
Canonical Regularisation of Wide Feature-Learning Neural Networks
di: Whittle, George, et al.
Pubblicazione: (2026)
di: Whittle, George, et al.
Pubblicazione: (2026)
Learning with Shallow Neural Networks on Cluster-Structured Features
di: Cornacchia, Elisabetta, et al.
Pubblicazione: (2026)
di: Cornacchia, Elisabetta, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Improved Particle Approximation Error for Mean Field Neural Networks
di: Nitanda, Atsushi
Pubblicazione: (2024) -
Towards a Unified Analysis of Neural Networks in Nonparametric Instrumental Variable Regression: Optimization and Generalization
di: Chen, Zonghao, et al.
Pubblicazione: (2025) -
Uniform convergence of the smooth calibration error and its relationship with functional gradient
di: Futami, Futoshi, et al.
Pubblicazione: (2025) -
Alternating Diffusion for Proximal Sampling with Zeroth Order Queries
di: Takagi, Hirohane, et al.
Pubblicazione: (2026) -
Slowly Annealed Langevin Dynamics: Theory and Applications to Training-Free Guided Generation
di: Nitanda, Atsushi, et al.
Pubblicazione: (2026)