Clarifying Shampoo: Adapting Spectral Descent to Stochasticity and the Parameter Trajectory
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Eschenhagen, Runa, Cai, Anna, Lee, Tsung-Hsien, Shi, Hao-Jun Michael |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner
par: Eschenhagen, Runa, et autres
Publié: (2025)
par: Eschenhagen, Runa, et autres
Publié: (2025)
Adaptive Batch Sizes Using Non-Euclidean Gradient Noise Scales for Stochastic Sign and Spectral Descent
par: Naganuma, Hiroki, et autres
Publié: (2026)
par: Naganuma, Hiroki, et autres
Publié: (2026)
Influence Functions for Scalable Data Attribution in Diffusion Models
par: Mlodozeniec, Bruno, et autres
Publié: (2024)
par: Mlodozeniec, Bruno, et autres
Publié: (2024)
Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization
par: Lin, Wu, et autres
Publié: (2025)
par: Lin, Wu, et autres
Publié: (2025)
SOAP: Improving and Stabilizing Shampoo using Adam
par: Vyas, Nikhil, et autres
Publié: (2024)
par: Vyas, Nikhil, et autres
Publié: (2024)
4-bit Shampoo for Memory-Efficient Network Training
par: Wang, Sike, et autres
Publié: (2024)
par: Wang, Sike, et autres
Publié: (2024)
Stochastic Parameter Decomposition
par: Bushnaq, Lucius, et autres
Publié: (2025)
par: Bushnaq, Lucius, et autres
Publié: (2025)
Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization
par: Sun, Ruotong, et autres
Publié: (2026)
par: Sun, Ruotong, et autres
Publié: (2026)
Stochastic Gradient Descent with Momentum is Algorithmically Stable
par: Lei, Yunwen, et autres
Publié: (2026)
par: Lei, Yunwen, et autres
Publié: (2026)
Adaptive Heavy-Tailed Stochastic Gradient Descent
par: Gong, Bodu, et autres
Publié: (2025)
par: Gong, Bodu, et autres
Publié: (2025)
Clarify: Improving Model Robustness With Natural Language Corrections
par: Lee, Yoonho, et autres
Publié: (2024)
par: Lee, Yoonho, et autres
Publié: (2024)
Noise Balance and Stationary Distribution of Stochastic Gradient Descent
par: Ziyin, Liu, et autres
Publié: (2023)
par: Ziyin, Liu, et autres
Publié: (2023)
Can LLMs predict the convergence of Stochastic Gradient Descent?
par: Zekri, Oussama, et autres
Publié: (2024)
par: Zekri, Oussama, et autres
Publié: (2024)
Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent
par: Wang, Zeyuan, et autres
Publié: (2026)
par: Wang, Zeyuan, et autres
Publié: (2026)
Weighted Low-rank Approximation via Stochastic Gradient Descent on Manifolds
par: Xu, Conglong, et autres
Publié: (2025)
par: Xu, Conglong, et autres
Publié: (2025)
FOAM: Frequency and Operator Error-Based Adaptive Damping Method for Reducing Staleness-Oriented Error for Shampoo
par: Nam, Kyunghun, et autres
Publié: (2026)
par: Nam, Kyunghun, et autres
Publié: (2026)
Parameter Expanded Stochastic Gradient Markov Chain Monte Carlo
par: Kim, Hyunsu, et autres
Publié: (2025)
par: Kim, Hyunsu, et autres
Publié: (2025)
Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization
par: Kumar, Ramnath, et autres
Publié: (2023)
par: Kumar, Ramnath, et autres
Publié: (2023)
A Universal Banach--Bregman Framework for Stochastic Iterations: Unifying Stochastic Mirror Descent, Learning and LLM Training
par: Zhang, Johnny R., et autres
Publié: (2025)
par: Zhang, Johnny R., et autres
Publié: (2025)
PSMGD: Periodic Stochastic Multi-Gradient Descent for Fast Multi-Objective Optimization
par: Xu, Mingjing, et autres
Publié: (2024)
par: Xu, Mingjing, et autres
Publié: (2024)
GCAL: Adapting Graph Models to Evolving Domain Shifts
par: Qiao, Ziyue, et autres
Publié: (2025)
par: Qiao, Ziyue, et autres
Publié: (2025)
Informed Spectral Normalized Gaussian Processes for Trajectory Prediction
par: Schlauch, Christian, et autres
Publié: (2024)
par: Schlauch, Christian, et autres
Publié: (2024)
Almost Bayesian: The Fractal Dynamics of Stochastic Gradient Descent
par: Hennick, Max, et autres
Publié: (2025)
par: Hennick, Max, et autres
Publié: (2025)
On the Convergence of (Stochastic) Gradient Descent for Kolmogorov--Arnold Networks
par: Gao, Yihang, et autres
Publié: (2024)
par: Gao, Yihang, et autres
Publié: (2024)
Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree
par: Feng, Lang, et autres
Publié: (2024)
par: Feng, Lang, et autres
Publié: (2024)
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents
par: Zhao, Jiahao, et autres
Publié: (2026)
par: Zhao, Jiahao, et autres
Publié: (2026)
The Homogeneity Trap: Spectral Collapse in Doubly-Stochastic Deep Networks
par: Liu, Yizhi
Publié: (2026)
par: Liu, Yizhi
Publié: (2026)
Clarifying Model Transparency: Interpretability versus Explainability in Deep Learning with MNIST and IMDB Examples
par: Raj, Mitali
Publié: (2025)
par: Raj, Mitali
Publié: (2025)
Quantum-Enhanced Parameter-Efficient Learning for Typhoon Trajectory Forecasting
par: Liu, Chen-Yu, et autres
Publié: (2025)
par: Liu, Chen-Yu, et autres
Publié: (2025)
Spectral Edge Dynamics of Training Trajectories: Signal--Noise Geometry Across Scales
par: Xu, Yongzhong
Publié: (2026)
par: Xu, Yongzhong
Publié: (2026)
Trustworthiness of Stochastic Gradient Descent in Distributed Learning
par: Li, Hongyang, et autres
Publié: (2024)
par: Li, Hongyang, et autres
Publié: (2024)
Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought
par: Huang, Jianhao, et autres
Publié: (2025)
par: Huang, Jianhao, et autres
Publié: (2025)
Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models
par: Bu, Dake, et autres
Publié: (2025)
par: Bu, Dake, et autres
Publié: (2025)
Resolving Intent Ambiguities by Retrieving Discriminative Clarifying Questions
par: Dhole, Kaustubh D.
Publié: (2020)
par: Dhole, Kaustubh D.
Publié: (2020)
Mechanistic Interpretability of LoRA-Adapted Language Models for Nuclear Reactor Safety Applications
par: Lee, Yoon Pyo
Publié: (2025)
par: Lee, Yoon Pyo
Publié: (2025)
Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control
par: Chittepu, Yaswanth, et autres
Publié: (2026)
par: Chittepu, Yaswanth, et autres
Publié: (2026)
MedClarify: An information-seeking AI agent for medical diagnosis with case-specific follow-up questions
par: Wong, Hui Min, et autres
Publié: (2026)
par: Wong, Hui Min, et autres
Publié: (2026)
Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
par: Baan, Joris, et autres
Publié: (2026)
par: Baan, Joris, et autres
Publié: (2026)
PXGen: A Post-hoc Explainable Method for Generative Models
par: Huang, Yen-Lung, et autres
Publié: (2025)
par: Huang, Yen-Lung, et autres
Publié: (2025)
Spectral Transformer Neural Processes
par: Chen, Xianhe, et autres
Publié: (2026)
par: Chen, Xianhe, et autres
Publié: (2026)
Documents similaires
-
Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner
par: Eschenhagen, Runa, et autres
Publié: (2025) -
Adaptive Batch Sizes Using Non-Euclidean Gradient Noise Scales for Stochastic Sign and Spectral Descent
par: Naganuma, Hiroki, et autres
Publié: (2026) -
Influence Functions for Scalable Data Attribution in Diffusion Models
par: Mlodozeniec, Bruno, et autres
Publié: (2024) -
Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization
par: Lin, Wu, et autres
Publié: (2025) -
SOAP: Improving and Stabilizing Shampoo using Adam
par: Vyas, Nikhil, et autres
Publié: (2024)