Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage
Fuente:
arXiv
Salvato in:
| Autori principali: | Milligan, Alan, Xu, Zikun, Lacoste-Julien, Simon, Dangel, Felix, Lin, Wu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization
di: Lin, Wu, et al.
Pubblicazione: (2025)
di: Lin, Wu, et al.
Pubblicazione: (2025)
SOAP: Improving and Stabilizing Shampoo using Adam
di: Vyas, Nikhil, et al.
Pubblicazione: (2024)
di: Vyas, Nikhil, et al.
Pubblicazione: (2024)
Convolutions and More as Einsum: A Tensor Network Perspective with Advances for Second-Order Methods
di: Dangel, Felix
Pubblicazione: (2023)
di: Dangel, Felix
Pubblicazione: (2023)
Lowering PyTorch's Memory Consumption for Selective Differentiation
di: Bhatia, Samarth, et al.
Pubblicazione: (2024)
di: Bhatia, Samarth, et al.
Pubblicazione: (2024)
Dual Optimistic Ascent (PI Control) is the Augmented Lagrangian Method in Disguise
di: Ramirez, Juan, et al.
Pubblicazione: (2025)
di: Ramirez, Juan, et al.
Pubblicazione: (2025)
On PI Controllers for Updating Lagrange Multipliers in Constrained Optimization
di: Sohrabi, Motahareh, et al.
Pubblicazione: (2024)
di: Sohrabi, Motahareh, et al.
Pubblicazione: (2024)
Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner
di: Eschenhagen, Runa, et al.
Pubblicazione: (2025)
di: Eschenhagen, Runa, et al.
Pubblicazione: (2025)
Efficient Bilevel Optimization with KFAC-Based Hypergradients
di: Liao, Disen, et al.
Pubblicazione: (2026)
di: Liao, Disen, et al.
Pubblicazione: (2026)
On the Disconnect Between Theory and Practice of Neural Networks: Limits of the NTK Perspective
di: Wenger, Jonathan, et al.
Pubblicazione: (2023)
di: Wenger, Jonathan, et al.
Pubblicazione: (2023)
Understanding Adam Requires Better Rotation Dependent Assumptions
di: Zhang, Tianyue H., et al.
Pubblicazione: (2024)
di: Zhang, Tianyue H., et al.
Pubblicazione: (2024)
What Does It Mean to Be a Transformer? Insights from a Theoretical Hessian Analysis
di: Ormaniec, Weronika, et al.
Pubblicazione: (2024)
di: Ormaniec, Weronika, et al.
Pubblicazione: (2024)
Position: Adopt Constraints Over Fixed Penalties in Deep Learning
di: Ramirez, Juan, et al.
Pubblicazione: (2025)
di: Ramirez, Juan, et al.
Pubblicazione: (2025)
Kronecker-Factored Approximate Curvature for Physics-Informed Neural Networks
di: Dangel, Felix, et al.
Pubblicazione: (2024)
di: Dangel, Felix, et al.
Pubblicazione: (2024)
SOLAR: Communication-Efficient Model Adaptation via Subspace-Oriented Latent Adapter Reparametrization
di: Mohammadabadi, Seyed Mahmoud Sajjadi, et al.
Pubblicazione: (2026)
di: Mohammadabadi, Seyed Mahmoud Sajjadi, et al.
Pubblicazione: (2026)
Understanding SOAP from the Perspective of Gradient Whitening
di: Lu, Yanqing, et al.
Pubblicazione: (2025)
di: Lu, Yanqing, et al.
Pubblicazione: (2025)
Weight-Sharing Regularization
di: Shakerinava, Mehran, et al.
Pubblicazione: (2023)
di: Shakerinava, Mehran, et al.
Pubblicazione: (2023)
Score Distillation via Reparametrized DDIM
di: Lukoianov, Artem, et al.
Pubblicazione: (2024)
di: Lukoianov, Artem, et al.
Pubblicazione: (2024)
Hide & Seek: Transformer Symmetries Obscure Sharpness & Riemannian Geometry Finds It
di: da Silva, Marvin F., et al.
Pubblicazione: (2025)
di: da Silva, Marvin F., et al.
Pubblicazione: (2025)
Kronecker-factored Approximate Curvature (KFAC) From Scratch
di: Dangel, Felix, et al.
Pubblicazione: (2025)
di: Dangel, Felix, et al.
Pubblicazione: (2025)
Collapsing Taylor Mode Automatic Differentiation
di: Dangel, Felix, et al.
Pubblicazione: (2025)
di: Dangel, Felix, et al.
Pubblicazione: (2025)
Skin-SOAP: A Weakly Supervised Framework for Generating Structured SOAP Notes
di: Kamal, Sadia, et al.
Pubblicazione: (2025)
di: Kamal, Sadia, et al.
Pubblicazione: (2025)
A New Perspective on Shampoo's Preconditioner
di: Morwani, Depen, et al.
Pubblicazione: (2024)
di: Morwani, Depen, et al.
Pubblicazione: (2024)
Operationalizing Quantized Disentanglement
di: Barin-Pacela, Vitoria, et al.
Pubblicazione: (2025)
di: Barin-Pacela, Vitoria, et al.
Pubblicazione: (2025)
Improving Energy Natural Gradient Descent through Woodbury, Momentum, and Randomization
di: Guzmán-Cordero, Andrés, et al.
Pubblicazione: (2025)
di: Guzmán-Cordero, Andrés, et al.
Pubblicazione: (2025)
Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator
di: Li, YuXin, et al.
Pubblicazione: (2025)
di: Li, YuXin, et al.
Pubblicazione: (2025)
Spectral-factorized Positive-definite Curvature Learning for NN Training
di: Lin, Wu, et al.
Pubblicazione: (2025)
di: Lin, Wu, et al.
Pubblicazione: (2025)
Dynamic Subspace Composition: Efficient Adaptation via Contractive Basis Expansion
di: Khasia, Vladimer
Pubblicazione: (2025)
di: Khasia, Vladimer
Pubblicazione: (2025)
Sketching Low-Rank Plus Diagonal Matrices
di: Fernandez, Andres, et al.
Pubblicazione: (2025)
di: Fernandez, Andres, et al.
Pubblicazione: (2025)
Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order Perspective
di: Lin, Wu, et al.
Pubblicazione: (2024)
di: Lin, Wu, et al.
Pubblicazione: (2024)
Structured Inverse-Free Natural Gradient: Memory-Efficient & Numerically-Stable KFAC
di: Lin, Wu, et al.
Pubblicazione: (2023)
di: Lin, Wu, et al.
Pubblicazione: (2023)
Generalizing the Geometry of Model Merging Through Frechet Averages
di: da Silva, Marvin F., et al.
Pubblicazione: (2026)
di: da Silva, Marvin F., et al.
Pubblicazione: (2026)
Bias Analysis in Unconditional Image Generative Models
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2025)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2025)
On the Identifiability of Quantized Factors
di: Barin-Pacela, Vitória, et al.
Pubblicazione: (2023)
di: Barin-Pacela, Vitória, et al.
Pubblicazione: (2023)
Cooper: A Library for Constrained Optimization in Deep Learning
di: Gallego-Posada, Jose, et al.
Pubblicazione: (2025)
di: Gallego-Posada, Jose, et al.
Pubblicazione: (2025)
4-bit Shampoo for Memory-Efficient Network Training
di: Wang, Sike, et al.
Pubblicazione: (2024)
di: Wang, Sike, et al.
Pubblicazione: (2024)
Revisiting Scalable Hessian Diagonal Approximations for Applications in Reinforcement Learning
di: Elsayed, Mohamed, et al.
Pubblicazione: (2024)
di: Elsayed, Mohamed, et al.
Pubblicazione: (2024)
Stop Probing, Start Coding: Why Linear Probes and Sparse Autoencoders Fail at Compositional Generalisation
di: Pacela, Vitória Barin, et al.
Pubblicazione: (2026)
di: Pacela, Vitória Barin, et al.
Pubblicazione: (2026)
Resolving Conflicts in Lifelong Learning via Aligning Updates in Subspaces
di: Zhou, Yueer, et al.
Pubblicazione: (2025)
di: Zhou, Yueer, et al.
Pubblicazione: (2025)
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment
di: Lu, Yunhong, et al.
Pubblicazione: (2025)
di: Lu, Yunhong, et al.
Pubblicazione: (2025)
Clarifying Shampoo: Adapting Spectral Descent to Stochasticity and the Parameter Trajectory
di: Eschenhagen, Runa, et al.
Pubblicazione: (2026)
di: Eschenhagen, Runa, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization
di: Lin, Wu, et al.
Pubblicazione: (2025) -
SOAP: Improving and Stabilizing Shampoo using Adam
di: Vyas, Nikhil, et al.
Pubblicazione: (2024) -
Convolutions and More as Einsum: A Tensor Network Perspective with Advances for Second-Order Methods
di: Dangel, Felix
Pubblicazione: (2023) -
Lowering PyTorch's Memory Consumption for Selective Differentiation
di: Bhatia, Samarth, et al.
Pubblicazione: (2024) -
Dual Optimistic Ascent (PI Control) is the Augmented Lagrangian Method in Disguise
di: Ramirez, Juan, et al.
Pubblicazione: (2025)