Sharpness-Aware Minimization Efficiently Selects Flatter Minima Late in Training
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Zhanpeng, Wang, Mingze, Mao, Yuchen, Li, Bingrui, Yan, Junchi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Bilateral Sharpness-Aware Minimization for Flatter Minima
by: Deng, Jiaxin, et al.
Published: (2024)
by: Deng, Jiaxin, et al.
Published: (2024)
The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training
by: Wang, Jinbo, et al.
Published: (2025)
by: Wang, Jinbo, et al.
Published: (2025)
Learning Gradient-based Mixup with Extrapolation toward Flatter Minima for Domain Generalization
by: Peng, Danni, et al.
Published: (2022)
by: Peng, Danni, et al.
Published: (2022)
Gradient Descent with Polyak's Momentum Finds Flatter Minima via Large Catapults
by: Phunyaphibarn, Prin, et al.
Published: (2023)
by: Phunyaphibarn, Prin, et al.
Published: (2023)
Efficient Hyperparameter Tuning via Trajectory Invariance Principle
by: Li, Bingrui, et al.
Published: (2025)
by: Li, Bingrui, et al.
Published: (2025)
Gradient Descent Converges Linearly to Flatter Minima than Gradient Flow in Shallow Linear Networks
by: Beneventano, Pierfrancesco, et al.
Published: (2025)
by: Beneventano, Pierfrancesco, et al.
Published: (2025)
Tilted Sharpness-Aware Minimization
by: Li, Tian, et al.
Published: (2024)
by: Li, Tian, et al.
Published: (2024)
Efficient Sharpness-Aware Minimization for Molecular Graph Transformer Models
by: Wang, Yili, et al.
Published: (2024)
by: Wang, Yili, et al.
Published: (2024)
On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD
by: Zhang, Tongcheng, et al.
Published: (2026)
by: Zhang, Tongcheng, et al.
Published: (2026)
ZO-SAM: Zero-Order Sharpness-Aware Minimization for Efficient Sparse Training
by: Ji, Jie, et al.
Published: (2026)
by: Ji, Jie, et al.
Published: (2026)
Friendly Sharpness-Aware Minimization
by: Li, Tao, et al.
Published: (2024)
by: Li, Tao, et al.
Published: (2024)
New Evidence of the Two-Phase Learning Dynamics of Neural Networks
by: Zhou, Zhanpeng, et al.
Published: (2025)
by: Zhou, Zhanpeng, et al.
Published: (2025)
Sparse Layer Sharpness-Aware Minimization for Efficient Fine-Tuning
by: Cheng, Yifei, et al.
Published: (2026)
by: Cheng, Yifei, et al.
Published: (2026)
Sharpness of Minima in Deep Matrix Factorization
by: Kamber, Anil, et al.
Published: (2025)
by: Kamber, Anil, et al.
Published: (2025)
On the Cone Effect in the Learning Dynamics
by: Zhou, Zhanpeng, et al.
Published: (2025)
by: Zhou, Zhanpeng, et al.
Published: (2025)
Agnostic Sharpness-Aware Minimization
by: Nguyen, Van-Anh, et al.
Published: (2024)
by: Nguyen, Van-Anh, et al.
Published: (2024)
Fast Catch-Up, Late Switching: Optimal Batch Size Scheduling via Functional Scaling Laws
by: Wang, Jinbo, et al.
Published: (2026)
by: Wang, Jinbo, et al.
Published: (2026)
LSAM: Asynchronous Distributed Training with Landscape-Smoothed Sharpness-Aware Minimization
by: Teng, Yunfei, et al.
Published: (2025)
by: Teng, Yunfei, et al.
Published: (2025)
Training Diagonal Linear Networks with Stochastic Sharpness-Aware Minimization
by: Clara, Gabriel, et al.
Published: (2025)
by: Clara, Gabriel, et al.
Published: (2025)
VASSO: Variance Suppression for Sharpness-Aware Minimization
by: Li, Bingcong, et al.
Published: (2025)
by: Li, Bingcong, et al.
Published: (2025)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
by: Zhang, Yihao, et al.
Published: (2024)
by: Zhang, Yihao, et al.
Published: (2024)
On the Emergence of Cross-Task Linearity in the Pretraining-Finetuning Paradigm
by: Zhou, Zhanpeng, et al.
Published: (2024)
by: Zhou, Zhanpeng, et al.
Published: (2024)
Variational Learning Finds Flatter Solutions at the Edge of Stability
by: Ghosh, Avrajit, et al.
Published: (2025)
by: Ghosh, Avrajit, et al.
Published: (2025)
Sharpness-Aware Minimization Can Hallucinate Minimizers
by: Park, Chanwoong, et al.
Published: (2025)
by: Park, Chanwoong, et al.
Published: (2025)
Sharpness-Aware Minimization for Generalized Embedding Learning in Federated Recommendation
by: Yu, Fengyuan, et al.
Published: (2026)
by: Yu, Fengyuan, et al.
Published: (2026)
Enhancing Sharpness-Aware Minimization by Learning Perturbation Radius
by: Wang, Xuehao, et al.
Published: (2024)
by: Wang, Xuehao, et al.
Published: (2024)
Sharpness-Aware Minimization Revisited: Weighted Sharpness as a Regularization Term
by: Yue, Yun, et al.
Published: (2023)
by: Yue, Yun, et al.
Published: (2023)
Taming the Long Tail: Efficient Item-wise Sharpness-Aware Minimization for LLM-based Recommender Systems
by: Zhang, Jiaming, et al.
Published: (2026)
by: Zhang, Jiaming, et al.
Published: (2026)
LightSAM: Parameter-Agnostic Sharpness-Aware Minimization
by: Cheng, Yifei, et al.
Published: (2025)
by: Cheng, Yifei, et al.
Published: (2025)
GCSAM: Gradient Centralized Sharpness Aware Minimization
by: Hassan, Mohamed, et al.
Published: (2025)
by: Hassan, Mohamed, et al.
Published: (2025)
Sharp Minima Can Generalize: A Loss Landscape Perspective On Data
by: Fan, Raymond, et al.
Published: (2025)
by: Fan, Raymond, et al.
Published: (2025)
On the Optimization and Generalization of Two-layer Transformers with Sign Gradient Descent
by: Li, Bingrui, et al.
Published: (2024)
by: Li, Bingrui, et al.
Published: (2024)
Implicit Regularization of Sharpness-Aware Minimization for Scale-Invariant Problems
by: Li, Bingcong, et al.
Published: (2024)
by: Li, Bingcong, et al.
Published: (2024)
Rethinking Graph Generalization through the Lens of Sharpness-Aware Minimization
by: Qiu, Yang, et al.
Published: (2026)
by: Qiu, Yang, et al.
Published: (2026)
Stability Analysis of Sharpness-Aware Minimization
by: Kim, Hoki, et al.
Published: (2023)
by: Kim, Hoki, et al.
Published: (2023)
Focal-SAM: Focal Sharpness-Aware Minimization for Long-Tailed Classification
by: Li, Sicong, et al.
Published: (2025)
by: Li, Sicong, et al.
Published: (2025)
Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks
by: Zou, Jinping, et al.
Published: (2024)
by: Zou, Jinping, et al.
Published: (2024)
Sharpness-Aware Parameter Selection for Machine Unlearning
by: Malekmohammadi, Saber, et al.
Published: (2025)
by: Malekmohammadi, Saber, et al.
Published: (2025)
Fast Graph Sharpness-Aware Minimization for Enhancing and Accelerating Few-Shot Node Classification
by: Luo, Yihong, et al.
Published: (2024)
by: Luo, Yihong, et al.
Published: (2024)
Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization
by: Tan, Chengli, et al.
Published: (2025)
by: Tan, Chengli, et al.
Published: (2025)
Similar Items
-
Bilateral Sharpness-Aware Minimization for Flatter Minima
by: Deng, Jiaxin, et al.
Published: (2024) -
The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training
by: Wang, Jinbo, et al.
Published: (2025) -
Learning Gradient-based Mixup with Extrapolation toward Flatter Minima for Domain Generalization
by: Peng, Danni, et al.
Published: (2022) -
Gradient Descent with Polyak's Momentum Finds Flatter Minima via Large Catapults
by: Phunyaphibarn, Prin, et al.
Published: (2023) -
Efficient Hyperparameter Tuning via Trajectory Invariance Principle
by: Li, Bingrui, et al.
Published: (2025)