Can LLMs predict the convergence of Stochastic Gradient Descent?
Fuente:
arXiv
Guardado en:
| Autores principales: | Zekri, Oussama, Benechehab, Abdelhakim, Redko, Ievgen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large Language Models as Markov Chains
por: Zekri, Oussama, et al.
Publicado: (2024)
por: Zekri, Oussama, et al.
Publicado: (2024)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
por: Zekri, Oussama, et al.
Publicado: (2025)
por: Zekri, Oussama, et al.
Publicado: (2025)
Zero-shot Model-based Reinforcement Learning using Large Language Models
por: Benechehab, Abdelhakim, et al.
Publicado: (2024)
por: Benechehab, Abdelhakim, et al.
Publicado: (2024)
Leveraging Ensemble Diversity for Robust Self-Training in the Presence of Sample Selection Bias
por: Odonnat, Ambroise, et al.
Publicado: (2023)
por: Odonnat, Ambroise, et al.
Publicado: (2023)
Leveraging Generic Time Series Foundation Models for EEG Classification
por: Gnassounou, Théo, et al.
Publicado: (2025)
por: Gnassounou, Théo, et al.
Publicado: (2025)
MantisV2: Closing the Zero-Shot Gap in Time Series Classification with Synthetic Data and Test-Time Strategies
por: Feofanov, Vasilii, et al.
Publicado: (2026)
por: Feofanov, Vasilii, et al.
Publicado: (2026)
Generalized Discrete Diffusion from Snapshots
por: Zekri, Oussama, et al.
Publicado: (2026)
por: Zekri, Oussama, et al.
Publicado: (2026)
TAG: A Decentralized Framework for Multi-Agent Hierarchical Reinforcement Learning
por: Paolo, Giuseppe, et al.
Publicado: (2025)
por: Paolo, Giuseppe, et al.
Publicado: (2025)
Adaptive Heavy-Tailed Stochastic Gradient Descent
por: Gong, Bodu, et al.
Publicado: (2025)
por: Gong, Bodu, et al.
Publicado: (2025)
Stochastic Gradient Descent with Momentum is Algorithmically Stable
por: Lei, Yunwen, et al.
Publicado: (2026)
por: Lei, Yunwen, et al.
Publicado: (2026)
CauKer: Classification Time Series Foundation Models Can Be Pretrained on Synthetic Data
por: Xie, Shifeng, et al.
Publicado: (2025)
por: Xie, Shifeng, et al.
Publicado: (2025)
Noise Balance and Stationary Distribution of Stochastic Gradient Descent
por: Ziyin, Liu, et al.
Publicado: (2023)
por: Ziyin, Liu, et al.
Publicado: (2023)
Time Series Representations for Classification Lie Hidden in Pretrained Vision Transformers
por: Roschmann, Simon, et al.
Publicado: (2025)
por: Roschmann, Simon, et al.
Publicado: (2025)
Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization
por: Kumar, Ramnath, et al.
Publicado: (2023)
por: Kumar, Ramnath, et al.
Publicado: (2023)
On the Convergence of (Stochastic) Gradient Descent for Kolmogorov--Arnold Networks
por: Gao, Yihang, et al.
Publicado: (2024)
por: Gao, Yihang, et al.
Publicado: (2024)
Almost Bayesian: The Fractal Dynamics of Stochastic Gradient Descent
por: Hennick, Max, et al.
Publicado: (2025)
por: Hennick, Max, et al.
Publicado: (2025)
PSMGD: Periodic Stochastic Multi-Gradient Descent for Fast Multi-Objective Optimization
por: Xu, Mingjing, et al.
Publicado: (2024)
por: Xu, Mingjing, et al.
Publicado: (2024)
Mantis: Lightweight Calibrated Foundation Model for User-Friendly Time Series Classification
por: Feofanov, Vasilii, et al.
Publicado: (2025)
por: Feofanov, Vasilii, et al.
Publicado: (2025)
From Alexnet to Transformers: Measuring the Non-linearity of Deep Neural Networks with Affine Optimal Transport
por: Bouniot, Quentin, et al.
Publicado: (2023)
por: Bouniot, Quentin, et al.
Publicado: (2023)
Can Looped Transformers Learn to Implement Multi-step Gradient Descent for In-context Learning?
por: Gatmiry, Khashayar, et al.
Publicado: (2024)
por: Gatmiry, Khashayar, et al.
Publicado: (2024)
Trustworthiness of Stochastic Gradient Descent in Distributed Learning
por: Li, Hongyang, et al.
Publicado: (2024)
por: Li, Hongyang, et al.
Publicado: (2024)
Gradient Descent Algorithm Survey
por: Fucheng, Deng, et al.
Publicado: (2025)
por: Fucheng, Deng, et al.
Publicado: (2025)
Weighted Low-rank Approximation via Stochastic Gradient Descent on Manifolds
por: Xu, Conglong, et al.
Publicado: (2025)
por: Xu, Conglong, et al.
Publicado: (2025)
Adaptive Batch Sizes Using Non-Euclidean Gradient Noise Scales for Stochastic Sign and Spectral Descent
por: Naganuma, Hiroki, et al.
Publicado: (2026)
por: Naganuma, Hiroki, et al.
Publicado: (2026)
Learning Associative Memories with Gradient Descent
por: Cabannes, Vivien, et al.
Publicado: (2024)
por: Cabannes, Vivien, et al.
Publicado: (2024)
Randomness and Interpolation Improve Gradient Descent
por: Li, Jiawen, et al.
Publicado: (2025)
por: Li, Jiawen, et al.
Publicado: (2025)
ONG: Orthogonal Natural Gradient Descent
por: Yadav, Yajat, et al.
Publicado: (2025)
por: Yadav, Yajat, et al.
Publicado: (2025)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
por: Cheng, Wenhua, et al.
Publicado: (2023)
por: Cheng, Wenhua, et al.
Publicado: (2023)
Vanilla Gradient Descent for Oblique Decision Trees
por: Panda, Subrat Prasad, et al.
Publicado: (2024)
por: Panda, Subrat Prasad, et al.
Publicado: (2024)
Deep autoregressive density nets vs neural ensembles for model-based offline reinforcement learning
por: Benechehab, Abdelhakim, et al.
Publicado: (2024)
por: Benechehab, Abdelhakim, et al.
Publicado: (2024)
Elastic Multi-Gradient Descent for Parallel Continual Learning
por: Lyu, Fan, et al.
Publicado: (2024)
por: Lyu, Fan, et al.
Publicado: (2024)
Revisiting the Initial Steps in Adaptive Gradient Descent Optimization
por: Abuduweili, Abulikemu, et al.
Publicado: (2024)
por: Abuduweili, Abulikemu, et al.
Publicado: (2024)
Efficient Search for Customized Activation Functions with Gradient Descent
por: Strack, Lukas, et al.
Publicado: (2024)
por: Strack, Lukas, et al.
Publicado: (2024)
The Initialization Determines Whether In-Context Learning Is Gradient Descent
por: Xie, Shifeng, et al.
Publicado: (2025)
por: Xie, Shifeng, et al.
Publicado: (2025)
Conflict-Averse Gradient Descent for Multi-task Learning
por: Liu, Bo, et al.
Publicado: (2021)
por: Liu, Bo, et al.
Publicado: (2021)
Enhancing Stochastic Gradient Descent: A Unified Framework and Novel Acceleration Methods for Faster Convergence
por: Deng, Yichuan, et al.
Publicado: (2024)
por: Deng, Yichuan, et al.
Publicado: (2024)
Gradient Descent Efficiency Index
por: Dhingra, Aviral
Publicado: (2024)
por: Dhingra, Aviral
Publicado: (2024)
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
por: Garg, Ishir, et al.
Publicado: (2026)
por: Garg, Ishir, et al.
Publicado: (2026)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
por: Liang, Zhenwen, et al.
Publicado: (2025)
por: Liang, Zhenwen, et al.
Publicado: (2025)
Clarifying Shampoo: Adapting Spectral Descent to Stochasticity and the Parameter Trajectory
por: Eschenhagen, Runa, et al.
Publicado: (2026)
por: Eschenhagen, Runa, et al.
Publicado: (2026)
Ejemplares similares
-
Large Language Models as Markov Chains
por: Zekri, Oussama, et al.
Publicado: (2024) -
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
por: Zekri, Oussama, et al.
Publicado: (2025) -
Zero-shot Model-based Reinforcement Learning using Large Language Models
por: Benechehab, Abdelhakim, et al.
Publicado: (2024) -
Leveraging Ensemble Diversity for Robust Self-Training in the Presence of Sample Selection Bias
por: Odonnat, Ambroise, et al.
Publicado: (2023) -
Leveraging Generic Time Series Foundation Models for EEG Classification
por: Gnassounou, Théo, et al.
Publicado: (2025)