Can LLMs predict the convergence of Stochastic Gradient Descent?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zekri, Oussama, Benechehab, Abdelhakim, Redko, Ievgen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large Language Models as Markov Chains
par: Zekri, Oussama, et autres
Publié: (2024)
par: Zekri, Oussama, et autres
Publié: (2024)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
par: Zekri, Oussama, et autres
Publié: (2025)
par: Zekri, Oussama, et autres
Publié: (2025)
Zero-shot Model-based Reinforcement Learning using Large Language Models
par: Benechehab, Abdelhakim, et autres
Publié: (2024)
par: Benechehab, Abdelhakim, et autres
Publié: (2024)
Leveraging Ensemble Diversity for Robust Self-Training in the Presence of Sample Selection Bias
par: Odonnat, Ambroise, et autres
Publié: (2023)
par: Odonnat, Ambroise, et autres
Publié: (2023)
Leveraging Generic Time Series Foundation Models for EEG Classification
par: Gnassounou, Théo, et autres
Publié: (2025)
par: Gnassounou, Théo, et autres
Publié: (2025)
MantisV2: Closing the Zero-Shot Gap in Time Series Classification with Synthetic Data and Test-Time Strategies
par: Feofanov, Vasilii, et autres
Publié: (2026)
par: Feofanov, Vasilii, et autres
Publié: (2026)
Generalized Discrete Diffusion from Snapshots
par: Zekri, Oussama, et autres
Publié: (2026)
par: Zekri, Oussama, et autres
Publié: (2026)
TAG: A Decentralized Framework for Multi-Agent Hierarchical Reinforcement Learning
par: Paolo, Giuseppe, et autres
Publié: (2025)
par: Paolo, Giuseppe, et autres
Publié: (2025)
Adaptive Heavy-Tailed Stochastic Gradient Descent
par: Gong, Bodu, et autres
Publié: (2025)
par: Gong, Bodu, et autres
Publié: (2025)
Stochastic Gradient Descent with Momentum is Algorithmically Stable
par: Lei, Yunwen, et autres
Publié: (2026)
par: Lei, Yunwen, et autres
Publié: (2026)
CauKer: Classification Time Series Foundation Models Can Be Pretrained on Synthetic Data
par: Xie, Shifeng, et autres
Publié: (2025)
par: Xie, Shifeng, et autres
Publié: (2025)
Noise Balance and Stationary Distribution of Stochastic Gradient Descent
par: Ziyin, Liu, et autres
Publié: (2023)
par: Ziyin, Liu, et autres
Publié: (2023)
Time Series Representations for Classification Lie Hidden in Pretrained Vision Transformers
par: Roschmann, Simon, et autres
Publié: (2025)
par: Roschmann, Simon, et autres
Publié: (2025)
Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization
par: Kumar, Ramnath, et autres
Publié: (2023)
par: Kumar, Ramnath, et autres
Publié: (2023)
On the Convergence of (Stochastic) Gradient Descent for Kolmogorov--Arnold Networks
par: Gao, Yihang, et autres
Publié: (2024)
par: Gao, Yihang, et autres
Publié: (2024)
Almost Bayesian: The Fractal Dynamics of Stochastic Gradient Descent
par: Hennick, Max, et autres
Publié: (2025)
par: Hennick, Max, et autres
Publié: (2025)
PSMGD: Periodic Stochastic Multi-Gradient Descent for Fast Multi-Objective Optimization
par: Xu, Mingjing, et autres
Publié: (2024)
par: Xu, Mingjing, et autres
Publié: (2024)
Mantis: Lightweight Calibrated Foundation Model for User-Friendly Time Series Classification
par: Feofanov, Vasilii, et autres
Publié: (2025)
par: Feofanov, Vasilii, et autres
Publié: (2025)
From Alexnet to Transformers: Measuring the Non-linearity of Deep Neural Networks with Affine Optimal Transport
par: Bouniot, Quentin, et autres
Publié: (2023)
par: Bouniot, Quentin, et autres
Publié: (2023)
Can Looped Transformers Learn to Implement Multi-step Gradient Descent for In-context Learning?
par: Gatmiry, Khashayar, et autres
Publié: (2024)
par: Gatmiry, Khashayar, et autres
Publié: (2024)
Trustworthiness of Stochastic Gradient Descent in Distributed Learning
par: Li, Hongyang, et autres
Publié: (2024)
par: Li, Hongyang, et autres
Publié: (2024)
Gradient Descent Algorithm Survey
par: Fucheng, Deng, et autres
Publié: (2025)
par: Fucheng, Deng, et autres
Publié: (2025)
Weighted Low-rank Approximation via Stochastic Gradient Descent on Manifolds
par: Xu, Conglong, et autres
Publié: (2025)
par: Xu, Conglong, et autres
Publié: (2025)
Adaptive Batch Sizes Using Non-Euclidean Gradient Noise Scales for Stochastic Sign and Spectral Descent
par: Naganuma, Hiroki, et autres
Publié: (2026)
par: Naganuma, Hiroki, et autres
Publié: (2026)
Learning Associative Memories with Gradient Descent
par: Cabannes, Vivien, et autres
Publié: (2024)
par: Cabannes, Vivien, et autres
Publié: (2024)
Randomness and Interpolation Improve Gradient Descent
par: Li, Jiawen, et autres
Publié: (2025)
par: Li, Jiawen, et autres
Publié: (2025)
ONG: Orthogonal Natural Gradient Descent
par: Yadav, Yajat, et autres
Publié: (2025)
par: Yadav, Yajat, et autres
Publié: (2025)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
par: Cheng, Wenhua, et autres
Publié: (2023)
par: Cheng, Wenhua, et autres
Publié: (2023)
Vanilla Gradient Descent for Oblique Decision Trees
par: Panda, Subrat Prasad, et autres
Publié: (2024)
par: Panda, Subrat Prasad, et autres
Publié: (2024)
Deep autoregressive density nets vs neural ensembles for model-based offline reinforcement learning
par: Benechehab, Abdelhakim, et autres
Publié: (2024)
par: Benechehab, Abdelhakim, et autres
Publié: (2024)
Elastic Multi-Gradient Descent for Parallel Continual Learning
par: Lyu, Fan, et autres
Publié: (2024)
par: Lyu, Fan, et autres
Publié: (2024)
Revisiting the Initial Steps in Adaptive Gradient Descent Optimization
par: Abuduweili, Abulikemu, et autres
Publié: (2024)
par: Abuduweili, Abulikemu, et autres
Publié: (2024)
Efficient Search for Customized Activation Functions with Gradient Descent
par: Strack, Lukas, et autres
Publié: (2024)
par: Strack, Lukas, et autres
Publié: (2024)
The Initialization Determines Whether In-Context Learning Is Gradient Descent
par: Xie, Shifeng, et autres
Publié: (2025)
par: Xie, Shifeng, et autres
Publié: (2025)
Conflict-Averse Gradient Descent for Multi-task Learning
par: Liu, Bo, et autres
Publié: (2021)
par: Liu, Bo, et autres
Publié: (2021)
Enhancing Stochastic Gradient Descent: A Unified Framework and Novel Acceleration Methods for Faster Convergence
par: Deng, Yichuan, et autres
Publié: (2024)
par: Deng, Yichuan, et autres
Publié: (2024)
Gradient Descent Efficiency Index
par: Dhingra, Aviral
Publié: (2024)
par: Dhingra, Aviral
Publié: (2024)
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
par: Garg, Ishir, et autres
Publié: (2026)
par: Garg, Ishir, et autres
Publié: (2026)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Clarifying Shampoo: Adapting Spectral Descent to Stochasticity and the Parameter Trajectory
par: Eschenhagen, Runa, et autres
Publié: (2026)
par: Eschenhagen, Runa, et autres
Publié: (2026)
Documents similaires
-
Large Language Models as Markov Chains
par: Zekri, Oussama, et autres
Publié: (2024) -
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
par: Zekri, Oussama, et autres
Publié: (2025) -
Zero-shot Model-based Reinforcement Learning using Large Language Models
par: Benechehab, Abdelhakim, et autres
Publié: (2024) -
Leveraging Ensemble Diversity for Robust Self-Training in the Presence of Sample Selection Bias
par: Odonnat, Ambroise, et autres
Publié: (2023) -
Leveraging Generic Time Series Foundation Models for EEG Classification
par: Gnassounou, Théo, et autres
Publié: (2025)