Sparse Layer Sharpness-Aware Minimization for Efficient Fine-Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cheng, Yifei, Yang, Xianglin, Wang, Guoxia, Huang, Chao, Ma, Fei, Yu, Dianhai, Cao, Xiaochun, Shen, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LightSAM: Parameter-Agnostic Sharpness-Aware Minimization
von: Cheng, Yifei, et al.
Veröffentlicht: (2025)
von: Cheng, Yifei, et al.
Veröffentlicht: (2025)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
Focal-SAM: Focal Sharpness-Aware Minimization for Long-Tailed Classification
von: Li, Sicong, et al.
Veröffentlicht: (2025)
von: Li, Sicong, et al.
Veröffentlicht: (2025)
ZO-SAM: Zero-Order Sharpness-Aware Minimization for Efficient Sparse Training
von: Ji, Jie, et al.
Veröffentlicht: (2026)
von: Ji, Jie, et al.
Veröffentlicht: (2026)
AdaGC: Improving Training Stability for Large Language Model Pretraining
von: Wang, Guoxia, et al.
Veröffentlicht: (2025)
von: Wang, Guoxia, et al.
Veröffentlicht: (2025)
Friendly Sharpness-Aware Minimization
von: Li, Tao, et al.
Veröffentlicht: (2024)
von: Li, Tao, et al.
Veröffentlicht: (2024)
SeWA: Selective Weight Average via Probabilistic Masking
von: Wang, Peng, et al.
Veröffentlicht: (2025)
von: Wang, Peng, et al.
Veröffentlicht: (2025)
Tilted Sharpness-Aware Minimization
von: Li, Tian, et al.
Veröffentlicht: (2024)
von: Li, Tian, et al.
Veröffentlicht: (2024)
Fast Graph Sharpness-Aware Minimization for Enhancing and Accelerating Few-Shot Node Classification
von: Luo, Yihong, et al.
Veröffentlicht: (2024)
von: Luo, Yihong, et al.
Veröffentlicht: (2024)
FlashMask: Efficient and Rich Mask Extension of FlashAttention
von: Wang, Guoxia, et al.
Veröffentlicht: (2024)
von: Wang, Guoxia, et al.
Veröffentlicht: (2024)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
von: Kim, Kwanyoung, et al.
Veröffentlicht: (2026)
von: Kim, Kwanyoung, et al.
Veröffentlicht: (2026)
Sharpness-Aware Minimization Can Hallucinate Minimizers
von: Park, Chanwoong, et al.
Veröffentlicht: (2025)
von: Park, Chanwoong, et al.
Veröffentlicht: (2025)
Sharpness-Aware Minimization Efficiently Selects Flatter Minima Late in Training
von: Zhou, Zhanpeng, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanpeng, et al.
Veröffentlicht: (2024)
Agnostic Sharpness-Aware Minimization
von: Nguyen, Van-Anh, et al.
Veröffentlicht: (2024)
von: Nguyen, Van-Anh, et al.
Veröffentlicht: (2024)
Efficient Sharpness-Aware Minimization for Molecular Graph Transformer Models
von: Wang, Yili, et al.
Veröffentlicht: (2024)
von: Wang, Yili, et al.
Veröffentlicht: (2024)
Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities
von: Hao, Zhiwei, et al.
Veröffentlicht: (2025)
von: Hao, Zhiwei, et al.
Veröffentlicht: (2025)
VASSO: Variance Suppression for Sharpness-Aware Minimization
von: Li, Bingcong, et al.
Veröffentlicht: (2025)
von: Li, Bingcong, et al.
Veröffentlicht: (2025)
Enhancing Sharpness-Aware Minimization by Learning Perturbation Radius
von: Wang, Xuehao, et al.
Veröffentlicht: (2024)
von: Wang, Xuehao, et al.
Veröffentlicht: (2024)
Sharpness-Aware Minimization for Generalized Embedding Learning in Federated Recommendation
von: Yu, Fengyuan, et al.
Veröffentlicht: (2026)
von: Yu, Fengyuan, et al.
Veröffentlicht: (2026)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
von: Zhang, Yihao, et al.
Veröffentlicht: (2024)
von: Zhang, Yihao, et al.
Veröffentlicht: (2024)
Stability and Generalization of Push-Sum Based Decentralized Optimization over Directed Graphs
von: Liang, Yifei, et al.
Veröffentlicht: (2026)
von: Liang, Yifei, et al.
Veröffentlicht: (2026)
Simultaneous Computation and Memory Efficient Zeroth-Order Optimizer for Fine-Tuning Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
Rethinking Graph Generalization through the Lens of Sharpness-Aware Minimization
von: Qiu, Yang, et al.
Veröffentlicht: (2026)
von: Qiu, Yang, et al.
Veröffentlicht: (2026)
Sharpness-Aware Minimization Revisited: Weighted Sharpness as a Regularization Term
von: Yue, Yun, et al.
Veröffentlicht: (2023)
von: Yue, Yun, et al.
Veröffentlicht: (2023)
Unpacking the Implicit Norm Dynamics of Sharpness-Aware Minimization in Tensorized Models
von: Cao, Tianxiao, et al.
Veröffentlicht: (2025)
von: Cao, Tianxiao, et al.
Veröffentlicht: (2025)
GCSAM: Gradient Centralized Sharpness Aware Minimization
von: Hassan, Mohamed, et al.
Veröffentlicht: (2025)
von: Hassan, Mohamed, et al.
Veröffentlicht: (2025)
Bilateral Sharpness-Aware Minimization for Flatter Minima
von: Deng, Jiaxin, et al.
Veröffentlicht: (2024)
von: Deng, Jiaxin, et al.
Veröffentlicht: (2024)
Implicit Regularization of Sharpness-Aware Minimization for Scale-Invariant Problems
von: Li, Bingcong, et al.
Veröffentlicht: (2024)
von: Li, Bingcong, et al.
Veröffentlicht: (2024)
Stability Analysis of Sharpness-Aware Minimization
von: Kim, Hoki, et al.
Veröffentlicht: (2023)
von: Kim, Hoki, et al.
Veröffentlicht: (2023)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
von: Bair, Anna, et al.
Veröffentlicht: (2023)
von: Bair, Anna, et al.
Veröffentlicht: (2023)
Topology-Aware Revival for Efficient Sparse Training
von: Jin, Meiling, et al.
Veröffentlicht: (2026)
von: Jin, Meiling, et al.
Veröffentlicht: (2026)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
von: Guo, Song, et al.
Veröffentlicht: (2024)
von: Guo, Song, et al.
Veröffentlicht: (2024)
Sparse Gradient Compression for Fine-Tuning Large Language Models
von: Yang, David H., et al.
Veröffentlicht: (2025)
von: Yang, David H., et al.
Veröffentlicht: (2025)
A Universal Class of Sharpness-Aware Minimization Algorithms
von: Tahmasebi, Behrooz, et al.
Veröffentlicht: (2024)
von: Tahmasebi, Behrooz, et al.
Veröffentlicht: (2024)
Sharpness-Aware Minimization and the Edge of Stability
von: Long, Philip M., et al.
Veröffentlicht: (2023)
von: Long, Philip M., et al.
Veröffentlicht: (2023)
Sharpness-Aware Minimization in Genetic Programming
von: Bakurov, Illya, et al.
Veröffentlicht: (2024)
von: Bakurov, Illya, et al.
Veröffentlicht: (2024)
Task-Adaptive Parameter-Efficient Fine-Tuning for Weather Foundation Models
von: Cao, Shilei, et al.
Veröffentlicht: (2025)
von: Cao, Shilei, et al.
Veröffentlicht: (2025)
Mitigating Parameter Interference in Model Merging via Sharpness-Aware Fine-Tuning
von: Lee, Yeoreum, et al.
Veröffentlicht: (2025)
von: Lee, Yeoreum, et al.
Veröffentlicht: (2025)
Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization
von: Luo, Haocheng, et al.
Veröffentlicht: (2026)
von: Luo, Haocheng, et al.
Veröffentlicht: (2026)
A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Models
von: Gu, Jian, et al.
Veröffentlicht: (2024)
von: Gu, Jian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
LightSAM: Parameter-Agnostic Sharpness-Aware Minimization
von: Cheng, Yifei, et al.
Veröffentlicht: (2025) -
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
von: Liu, Yuhang, et al.
Veröffentlicht: (2025) -
Focal-SAM: Focal Sharpness-Aware Minimization for Long-Tailed Classification
von: Li, Sicong, et al.
Veröffentlicht: (2025) -
ZO-SAM: Zero-Order Sharpness-Aware Minimization for Efficient Sparse Training
von: Ji, Jie, et al.
Veröffentlicht: (2026) -
AdaGC: Improving Training Stability for Large Language Model Pretraining
von: Wang, Guoxia, et al.
Veröffentlicht: (2025)