Dynamic Scaled Gradient Descent for Stable Fine-Tuning for Classifications
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bui, Nghia, Wang, Lijing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Assessing the Macro and Micro Effects of Random Seeds on Fine-Tuning Large Language Models
par: Bui, Nghia, et autres
Publié: (2025)
par: Bui, Nghia, et autres
Publié: (2025)
Continual Fine-Tuning with Provably Accurate and Parameter-Free Task Retrieval
par: Le, Hang Thi-Thuy, et autres
Publié: (2026)
par: Le, Hang Thi-Thuy, et autres
Publié: (2026)
Stochastic Gradient Descent with Momentum is Algorithmically Stable
par: Lei, Yunwen, et autres
Publié: (2026)
par: Lei, Yunwen, et autres
Publié: (2026)
Gradient Descent with Provably Tuned Learning-rate Schedules
par: Sharma, Dravyansh
Publié: (2025)
par: Sharma, Dravyansh
Publié: (2025)
Multi-kernel Correntropy-based Orientation Estimation of IMUs: Gradient Descent Methods
par: Li, Shilei, et autres
Publié: (2023)
par: Li, Shilei, et autres
Publié: (2023)
Generalization Guarantees on Data-Driven Tuning of Gradient Descent with Langevin Updates
par: Goyal, Saumya, et autres
Publié: (2026)
par: Goyal, Saumya, et autres
Publié: (2026)
Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence
par: Nguyen, Quoc Minh, et autres
Publié: (2026)
par: Nguyen, Quoc Minh, et autres
Publié: (2026)
Unraveling the Gradient Descent Dynamics of Transformers
par: Song, Bingqing, et autres
Publié: (2024)
par: Song, Bingqing, et autres
Publié: (2024)
Optimal Rates for Generalization of Gradient Descent for Deep ReLU Classification
par: Li, Yuanfan, et autres
Publié: (2025)
par: Li, Yuanfan, et autres
Publié: (2025)
Multiclass Loss Geometry Matters for Generalization of Gradient Descent in Separable Classification
par: Schliserman, Matan, et autres
Publié: (2025)
par: Schliserman, Matan, et autres
Publié: (2025)
Auditing Information Disclosure During LLM-Scale Gradient Descent Using Gradient Uniqueness
par: Abdelghafar, Sleem, et autres
Publié: (2025)
par: Abdelghafar, Sleem, et autres
Publié: (2025)
Occam Gradient Descent
par: Kausik, B. N.
Publié: (2024)
par: Kausik, B. N.
Publié: (2024)
Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification
par: Jung, Hyunji, et autres
Publié: (2025)
par: Jung, Hyunji, et autres
Publié: (2025)
Gradient Descent Algorithm Survey
par: Fucheng, Deng, et autres
Publié: (2025)
par: Fucheng, Deng, et autres
Publié: (2025)
Scaling Law for Stochastic Gradient Descent in Quadratically Parameterized Linear Regression
par: Ding, Shihong, et autres
Publié: (2025)
par: Ding, Shihong, et autres
Publié: (2025)
Prompt Tuning for Natural Language to SQL with Embedding Fine-Tuning and RAG
par: Jang, Jisoo, et autres
Publié: (2025)
par: Jang, Jisoo, et autres
Publié: (2025)
Scaling Laws for Gradient Descent and Sign Descent for Linear Bigram Models under Zipf's Law
par: Kunstner, Frederik, et autres
Publié: (2025)
par: Kunstner, Frederik, et autres
Publié: (2025)
Save It All: Enabling Full Parameter Tuning for Federated Large Language Models via Cycle Block Gradient Descent
par: Wang, Lin, et autres
Publié: (2024)
par: Wang, Lin, et autres
Publié: (2024)
Stacking as Accelerated Gradient Descent
par: Agarwal, Naman, et autres
Publié: (2024)
par: Agarwal, Naman, et autres
Publié: (2024)
Adjacent Leader Decentralized Stochastic Gradient Descent
par: He, Haoze, et autres
Publié: (2024)
par: He, Haoze, et autres
Publié: (2024)
Curl Descent: Non-Gradient Learning Dynamics with Sign-Diverse Plasticity
par: Ninou, Hugo, et autres
Publié: (2025)
par: Ninou, Hugo, et autres
Publié: (2025)
Dynamic Decoupling of Placid Terminal Attractor-based Gradient Descent Algorithm
par: Zhao, Jinwei, et autres
Publié: (2024)
par: Zhao, Jinwei, et autres
Publié: (2024)
Stochastic Adaptive Gradient Descent Without Descent
par: Aujol, Jean-François, et autres
Publié: (2025)
par: Aujol, Jean-François, et autres
Publié: (2025)
Modified Loss of Momentum Gradient Descent: Fine-Grained Analysis
par: Cattaneo, Matias D., et autres
Publié: (2025)
par: Cattaneo, Matias D., et autres
Publié: (2025)
Turning Stale Gradients into Stable Gradients: Coherent Coordinate Descent with Implicit Landscape Smoothing for Lightweight Zeroth-Order Optimization
par: Liang, Chen, et autres
Publié: (2026)
par: Liang, Chen, et autres
Publié: (2026)
Sparse Gradient Compression for Fine-Tuning Large Language Models
par: Yang, David H., et autres
Publié: (2025)
par: Yang, David H., et autres
Publié: (2025)
Corner Gradient Descent
par: Yarotsky, Dmitry
Publié: (2025)
par: Yarotsky, Dmitry
Publié: (2025)
Training Instabilities Induce Flatness Bias in Gradient Descent
par: Wang, Lawrence, et autres
Publié: (2025)
par: Wang, Lawrence, et autres
Publié: (2025)
Stable Gradients for Stable Learning at Scale in Deep Reinforcement Learning
par: Castanyer, Roger Creus, et autres
Publié: (2025)
par: Castanyer, Roger Creus, et autres
Publié: (2025)
Limited Memory Online Gradient Descent for Kernelized Pairwise Learning with Dynamic Averaging
par: AlQuabeh, Hilal, et autres
Publié: (2024)
par: AlQuabeh, Hilal, et autres
Publié: (2024)
Distributed Gradient Descent for Functional Learning
par: Yu, Zhan, et autres
Publié: (2023)
par: Yu, Zhan, et autres
Publié: (2023)
Robust Gradient Descent for Phase Retrieval
par: Buna, Alex, et autres
Publié: (2024)
par: Buna, Alex, et autres
Publié: (2024)
On the Generalization of Stochastic Gradient Descent with Momentum
par: Ramezani-Kebrya, Ali, et autres
Publié: (2018)
par: Ramezani-Kebrya, Ali, et autres
Publié: (2018)
Grams: Gradient Descent with Adaptive Momentum Scaling
par: Cao, Yang, et autres
Publié: (2024)
par: Cao, Yang, et autres
Publié: (2024)
The Implicit Bias of Gradient Descent on Separable Multiclass Data
par: Ravi, Hrithik, et autres
Publié: (2024)
par: Ravi, Hrithik, et autres
Publié: (2024)
Parameter-Efficient Fine-Tuning of DINOv2 for Large-Scale Font Classification
par: Chen, Daniel, et autres
Publié: (2026)
par: Chen, Daniel, et autres
Publié: (2026)
Almost Bayesian: The Fractal Dynamics of Stochastic Gradient Descent
par: Hennick, Max, et autres
Publié: (2025)
par: Hennick, Max, et autres
Publié: (2025)
A Theoretical Analysis of Noise Geometry in Stochastic Gradient Descent
par: Wang, Mingze, et autres
Publié: (2023)
par: Wang, Mingze, et autres
Publié: (2023)
Cheap Bootstrap for Fast Uncertainty Quantification of Stochastic Gradient Descent
par: Lam, Henry, et autres
Publié: (2023)
par: Lam, Henry, et autres
Publié: (2023)
Generalization Guarantees of Gradient Descent for Multi-Layer Neural Networks
par: Wang, Puyu, et autres
Publié: (2023)
par: Wang, Puyu, et autres
Publié: (2023)
Documents similaires
-
Assessing the Macro and Micro Effects of Random Seeds on Fine-Tuning Large Language Models
par: Bui, Nghia, et autres
Publié: (2025) -
Continual Fine-Tuning with Provably Accurate and Parameter-Free Task Retrieval
par: Le, Hang Thi-Thuy, et autres
Publié: (2026) -
Stochastic Gradient Descent with Momentum is Algorithmically Stable
par: Lei, Yunwen, et autres
Publié: (2026) -
Gradient Descent with Provably Tuned Learning-rate Schedules
par: Sharma, Dravyansh
Publié: (2025) -
Multi-kernel Correntropy-based Orientation Estimation of IMUs: Gradient Descent Methods
par: Li, Shilei, et autres
Publié: (2023)