Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Moon, Chaewon, Si, Dongkuk, Yun, Chulhee |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Cost of Robustness: Tighter Bounds on Parameter Complexity for Robust Memorization in ReLU Nets
par: Kim, Yujun, et autres
Publié: (2025)
par: Kim, Yujun, et autres
Publié: (2025)
Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime
par: Baek, Beomhan, et autres
Publié: (2025)
par: Baek, Beomhan, et autres
Publié: (2025)
Implicit Bias and Loss of Plasticity in Matrix Completion: Depth Promotes Low-Rankness
par: Shin, Baekrok, et autres
Publié: (2026)
par: Shin, Baekrok, et autres
Publié: (2026)
Unpacking the Implicit Norm Dynamics of Sharpness-Aware Minimization in Tensorized Models
par: Cao, Tianxiao, et autres
Publié: (2025)
par: Cao, Tianxiao, et autres
Publié: (2025)
Provable Benefit of Cutout and CutMix for Feature Learning
par: Oh, Junsoo, et autres
Publié: (2024)
par: Oh, Junsoo, et autres
Publié: (2024)
Stability Analysis of Sharpness-Aware Minimization
par: Kim, Hoki, et autres
Publié: (2023)
par: Kim, Hoki, et autres
Publié: (2023)
Navigating Potholes with Geometry-Aware Sharpness Minimization
par: Dufort-Labbé, Simon, et autres
Publié: (2026)
par: Dufort-Labbé, Simon, et autres
Publié: (2026)
Membership Privacy Risks of Sharpness Aware Minimization
par: Kim, Young In, et autres
Publié: (2023)
par: Kim, Young In, et autres
Publié: (2023)
Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization
par: Tan, Chengli, et autres
Publié: (2025)
par: Tan, Chengli, et autres
Publié: (2025)
Revisiting Sharpness-Aware Minimization: A More Faithful and Effective Implementation
par: Chen, Jianlong, et autres
Publié: (2026)
par: Chen, Jianlong, et autres
Publié: (2026)
SAMOSA: Sharpness Aware Minimization for Open Set Active learning
par: Kim, Young In, et autres
Publié: (2025)
par: Kim, Young In, et autres
Publié: (2025)
Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count
par: Cho, Hanseul, et autres
Publié: (2024)
par: Cho, Hanseul, et autres
Publié: (2024)
DASH: Warm-Starting Neural Network Training in Stationary Settings without Loss of Plasticity
par: Shin, Baekrok, et autres
Publié: (2024)
par: Shin, Baekrok, et autres
Publié: (2024)
Lightweight Dataset Pruning without Full Training via Example Difficulty and Prediction Uncertainty
par: Cho, Yeseul, et autres
Publié: (2025)
par: Cho, Yeseul, et autres
Publié: (2025)
Scaling Laws of SignSGD in Linear Regression: When Does It Outperform SGD?
par: Kim, Jihwan, et autres
Publié: (2026)
par: Kim, Jihwan, et autres
Publié: (2026)
X-SAM: Boosting Sharpness-Aware Minimization with Dominant-Eigenvector Gradient Correction
par: Duan, Hongru, et autres
Publié: (2026)
par: Duan, Hongru, et autres
Publié: (2026)
Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization
par: Luo, Haocheng, et autres
Publié: (2026)
par: Luo, Haocheng, et autres
Publié: (2026)
FairSAM: Fair Classification on Corrupted Data Through Sharpness-Aware Minimization
par: Dai, Yucong, et autres
Publié: (2025)
par: Dai, Yucong, et autres
Publié: (2025)
Towards Understanding the Role of Sharpness-Aware Minimization Algorithms for Out-of-Distribution Generalization
par: Schapiro, Samuel, et autres
Publié: (2024)
par: Schapiro, Samuel, et autres
Publié: (2024)
Attributing Data for Sharpness-Aware Minimization
par: Ren, Chenyang, et autres
Publié: (2025)
par: Ren, Chenyang, et autres
Publié: (2025)
Fast Graph Sharpness-Aware Minimization for Enhancing and Accelerating Few-Shot Node Classification
par: Luo, Yihong, et autres
Publié: (2024)
par: Luo, Yihong, et autres
Publié: (2024)
Sharpness-Aware Minimization with Z-Score Gradient Filtering
par: Yun, Vincent-Daniel
Publié: (2025)
par: Yun, Vincent-Daniel
Publié: (2025)
Parameter Expanded Stochastic Gradient Markov Chain Monte Carlo
par: Kim, Hyunsu, et autres
Publié: (2025)
par: Kim, Hyunsu, et autres
Publié: (2025)
Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification
par: Jung, Hyunji, et autres
Publié: (2025)
par: Jung, Hyunji, et autres
Publié: (2025)
Gradient Compression May Hurt Generalization: A Remedy by Synthetic Data Guided Sharpness Aware Minimization
par: Gu, Yujie, et autres
Publié: (2026)
par: Gu, Yujie, et autres
Publié: (2026)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization
par: Xu, Le, et autres
Publié: (2025)
par: Xu, Le, et autres
Publié: (2025)
Understanding Sharpness Dynamics in NN Training with a Minimalist Example: The Effects of Dataset Difficulty, Depth, Stochasticity, and More
par: Yoo, Geonhui, et autres
Publié: (2025)
par: Yoo, Geonhui, et autres
Publié: (2025)
Through the River: Understanding the Benefit of Schedule-Free Methods for Language Model Training
par: Song, Minhak, et autres
Publié: (2025)
par: Song, Minhak, et autres
Publié: (2025)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
Stabilizing Sharpness-aware Minimization Through A Simple Renormalization Strategy
par: Tan, Chengli, et autres
Publié: (2024)
par: Tan, Chengli, et autres
Publié: (2024)
Sharpness-Aware Teleportation on Riemannian Manifolds
par: Truong, Tuan, et autres
Publié: (2023)
par: Truong, Tuan, et autres
Publié: (2023)
Sharpness-Aware Black-Box Optimization
par: Ye, Feiyang, et autres
Publié: (2024)
par: Ye, Feiyang, et autres
Publié: (2024)
Locality-Aware Redundancy Pruning for LLM Depth Compression
par: Yun, Vincent-Daniel, et autres
Publié: (2026)
par: Yun, Vincent-Daniel, et autres
Publié: (2026)
Flexible Bayesian Last Layer Models Using Implicit Priors and Diffusion Posterior Sampling
par: Xu, Jian, et autres
Publié: (2024)
par: Xu, Jian, et autres
Publié: (2024)
Disentangling Granularity: An Implicit Inductive Bias in Factorized VAEs
par: Chen, Zihao, et autres
Publié: (2025)
par: Chen, Zihao, et autres
Publié: (2025)
Correcting Performance Estimation Bias in Imbalanced Classification with Minority Subconcepts
par: Maxson, Taylor, et autres
Publié: (2026)
par: Maxson, Taylor, et autres
Publié: (2026)
Implicit Bias of the JKO Scheme
par: Halmos, Peter, et autres
Publié: (2025)
par: Halmos, Peter, et autres
Publié: (2025)
NCSAM Noise-Compensated Sharpness-Aware Minimization for Noisy Label Learning
par: Xu, Jiayu, et autres
Publié: (2026)
par: Xu, Jiayu, et autres
Publié: (2026)
Tractable Sharpness-Aware Learning of Probabilistic Circuits
par: Suresh, Hrithik, et autres
Publié: (2025)
par: Suresh, Hrithik, et autres
Publié: (2025)
Documents similaires
-
The Cost of Robustness: Tighter Bounds on Parameter Complexity for Robust Memorization in ReLU Nets
par: Kim, Yujun, et autres
Publié: (2025) -
Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime
par: Baek, Beomhan, et autres
Publié: (2025) -
Implicit Bias and Loss of Plasticity in Matrix Completion: Depth Promotes Low-Rankness
par: Shin, Baekrok, et autres
Publié: (2026) -
Unpacking the Implicit Norm Dynamics of Sharpness-Aware Minimization in Tensorized Models
par: Cao, Tianxiao, et autres
Publié: (2025) -
Provable Benefit of Cutout and CutMix for Feature Learning
par: Oh, Junsoo, et autres
Publié: (2024)