Class-wise Activation Unravelling the Engima of Deep Double Descent
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Gu, Yufei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unraveling the Enigma of Double Descent: An In-depth Analysis through the Lens of Learned Feature Space
par: Gu, Yufei, et autres
Publié: (2023)
par: Gu, Yufei, et autres
Publié: (2023)
Deep Exploration of Epoch-wise Double Descent in Noisy Data: Signal Separation, Large Activation, and Benign Overfitting
par: Kubo, Tomoki, et autres
Publié: (2026)
par: Kubo, Tomoki, et autres
Publié: (2026)
On the Lipschitz Constant of Deep Networks and Double Descent
par: Gamba, Matteo, et autres
Publié: (2023)
par: Gamba, Matteo, et autres
Publié: (2023)
On The Presence of Double-Descent in Deep Reinforcement Learning
par: Veselý, Viktor, et autres
Publié: (2025)
par: Veselý, Viktor, et autres
Publié: (2025)
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
par: Huang, Yufei, et autres
Publié: (2024)
par: Huang, Yufei, et autres
Publié: (2024)
Understanding the Double Descent Phenomenon in Deep Learning
par: Lafon, Marc, et autres
Publié: (2024)
par: Lafon, Marc, et autres
Publié: (2024)
Bayesian Double Descent
par: Polson, Nick, et autres
Publié: (2025)
par: Polson, Nick, et autres
Publié: (2025)
Manipulating Sparse Double Descent
par: Zhang, Ya Shi
Publié: (2024)
par: Zhang, Ya Shi
Publié: (2024)
Unraveling the Gradient Descent Dynamics of Transformers
par: Song, Bingqing, et autres
Publié: (2024)
par: Song, Bingqing, et autres
Publié: (2024)
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
par: Zhang, Chenyang, et autres
Publié: (2026)
par: Zhang, Chenyang, et autres
Publié: (2026)
Dropout Drops Double Descent
par: Yang, Tian-Le, et autres
Publié: (2023)
par: Yang, Tian-Le, et autres
Publié: (2023)
Double Descent and Other Interpolation Phenomena in GANs
par: Luzi, Lorenzo, et autres
Publié: (2021)
par: Luzi, Lorenzo, et autres
Publié: (2021)
Class-wise Generalization Error: an Information-Theoretic Analysis
par: Laakom, Firas, et autres
Publié: (2024)
par: Laakom, Firas, et autres
Publié: (2024)
Reducing Class-wise Confusion for Incremental Learning with Disentangled Manifolds
par: Chen, Huitong, et autres
Publié: (2025)
par: Chen, Huitong, et autres
Publié: (2025)
Towards Class-wise Robustness Analysis
par: Medi, Tejaswini, et autres
Publié: (2024)
par: Medi, Tejaswini, et autres
Publié: (2024)
Linear-time One-Class Classification with Repeated Element-wise Folding
par: Raitoharju, Jenni
Publié: (2024)
par: Raitoharju, Jenni
Publié: (2024)
Hypernym Bias: Unraveling Deep Classifier Training Dynamics through the Lens of Class Hierarchy
par: Malashin, Roman, et autres
Publié: (2025)
par: Malashin, Roman, et autres
Publié: (2025)
The Double Descent Behavior in Two Layer Neural Network for Binary Classification
par: Abeykoon, Chathurika S, et autres
Publié: (2025)
par: Abeykoon, Chathurika S, et autres
Publié: (2025)
Class-wise Balancing Data Replay for Federated Class-Incremental Learning
par: Qi, Zhuang, et autres
Publié: (2025)
par: Qi, Zhuang, et autres
Publié: (2025)
On Double Descent in Reinforcement Learning with LSTD and Random Features
par: Brellmann, David, et autres
Publié: (2023)
par: Brellmann, David, et autres
Publié: (2023)
Harmonized Gradient Descent for Class Imbalanced Data Stream Online Learning
par: Zhou, Han, et autres
Publié: (2025)
par: Zhou, Han, et autres
Publié: (2025)
Conformal Prediction for Class-wise Coverage via Augmented Label Rank Calibration
par: Shi, Yuanjie, et autres
Publié: (2024)
par: Shi, Yuanjie, et autres
Publié: (2024)
Towards Understanding Epoch-wise Double descent in Two-layer Linear Neural Networks
par: Olmin, Amanda, et autres
Publié: (2024)
par: Olmin, Amanda, et autres
Publié: (2024)
AWP: Activation-Aware Weight Pruning and Quantization with Projected Gradient Descent
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
Towards Fair Class-wise Robustness: Class Optimal Distribution Adversarial Training
par: Zhi, Hongxin, et autres
Publié: (2025)
par: Zhi, Hongxin, et autres
Publié: (2025)
Efficient Search for Customized Activation Functions with Gradient Descent
par: Strack, Lukas, et autres
Publié: (2024)
par: Strack, Lukas, et autres
Publié: (2024)
Class-wise Federated Unlearning: Harnessing Active Forgetting with Teacher-Student Memory Generation
par: Li, Yuyuan, et autres
Publié: (2023)
par: Li, Yuyuan, et autres
Publié: (2023)
A Characterization Theorem for Equivariant Networks with Point-wise Activations
par: Pacini, Marco, et autres
Publié: (2024)
par: Pacini, Marco, et autres
Publié: (2024)
Double Descent as a Lens for Sample Efficiency in Autoregressive vs. Discrete Diffusion Models
par: Fraij, Ahmad, et autres
Publié: (2025)
par: Fraij, Ahmad, et autres
Publié: (2025)
OUIDecay: Adaptive Layer-wise Weight Decay for CNNs Using Online Activation Patterns
par: Fernández-Hernández, Alberto, et autres
Publié: (2026)
par: Fernández-Hernández, Alberto, et autres
Publié: (2026)
Variational Stochastic Gradient Descent for Deep Neural Networks
par: Chen, Haotian, et autres
Publié: (2024)
par: Chen, Haotian, et autres
Publié: (2024)
Analog Physical Systems Can Exhibit Double Descent
par: Dillavou, Sam, et autres
Publié: (2025)
par: Dillavou, Sam, et autres
Publié: (2025)
Activation-Descent Regularization for Input Optimization of ReLU Networks
par: Yu, Hongzhan, et autres
Publié: (2024)
par: Yu, Hongzhan, et autres
Publié: (2024)
Least Squares Regression Can Exhibit Under-Parameterized Double Descent
par: Li, Xinyue, et autres
Publié: (2023)
par: Li, Xinyue, et autres
Publié: (2023)
Activation Compression of Graph Neural Networks using Block-wise Quantization with Improved Variance Minimization
par: Eliassen, Sebastian, et autres
Publié: (2023)
par: Eliassen, Sebastian, et autres
Publié: (2023)
Asymptotic Behavior of Multi--Task Learning: Implicit Regularization and Double Descent Effects
par: Alrashdi, Ayed M., et autres
Publié: (2026)
par: Alrashdi, Ayed M., et autres
Publié: (2026)
Double Descent and Overfitting under Noisy Inputs and Distribution Shift for Linear Denoisers
par: Kausik, Chinmaya, et autres
Publié: (2023)
par: Kausik, Chinmaya, et autres
Publié: (2023)
Two Speeds of Learning: A Representation-Readout Decomposition of Grokking and Double Descent
par: Chou, Chi-Ning, et autres
Publié: (2026)
par: Chou, Chi-Ning, et autres
Publié: (2026)
Changing the Kernel During Training Leads to Double Descent in Kernel Regression
par: Allerbo, Oskar
Publié: (2023)
par: Allerbo, Oskar
Publié: (2023)
Robust Predictive Uncertainty and Double Descent in Contaminated Bayesian Random Features
par: Caprio, Michele, et autres
Publié: (2026)
par: Caprio, Michele, et autres
Publié: (2026)
Documents similaires
-
Unraveling the Enigma of Double Descent: An In-depth Analysis through the Lens of Learned Feature Space
par: Gu, Yufei, et autres
Publié: (2023) -
Deep Exploration of Epoch-wise Double Descent in Noisy Data: Signal Separation, Large Activation, and Benign Overfitting
par: Kubo, Tomoki, et autres
Publié: (2026) -
On the Lipschitz Constant of Deep Networks and Double Descent
par: Gamba, Matteo, et autres
Publié: (2023) -
On The Presence of Double-Descent in Deep Reinforcement Learning
par: Veselý, Viktor, et autres
Publié: (2025) -
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
par: Huang, Yufei, et autres
Publié: (2024)