Enregistré dans:
| Auteurs principaux: | Dragutinović, Sara, Ranganath, Rajesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.00742 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Softmax $\geq$ Linear: Transformers may learn to classify in-context by kernel gradient descent
par: Dragutinović, Sara, et autres
Publié: (2025)
par: Dragutinović, Sara, et autres
Publié: (2025)
Preference learning made easy: Everything should be understood through win rate
par: Zhang, Lily H., et autres
Publié: (2025)
par: Zhang, Lily H., et autres
Publié: (2025)
Attention and Compression is all you need for Controllably Efficient Language Models
par: Prakash, Jatin, et autres
Publié: (2025)
par: Prakash, Jatin, et autres
Publié: (2025)
What's the score? Automated Denoising Score Matching for Nonlinear Diffusions
par: Singhal, Raghav, et autres
Publié: (2024)
par: Singhal, Raghav, et autres
Publié: (2024)
Explanations that reveal all through the definition of encoding
par: Puli, Aahlad, et autres
Publié: (2024)
par: Puli, Aahlad, et autres
Publié: (2024)
A Compression Perspective on Simplicity Bias
par: Marty, Tom, et autres
Publié: (2026)
par: Marty, Tom, et autres
Publié: (2026)
Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers
par: Ranganath, Aditya
Publié: (2026)
par: Ranganath, Aditya
Publié: (2026)
Hierarchical Simplicity Bias of Neural Networks
par: Du, Zhehang
Publié: (2023)
par: Du, Zhehang
Publié: (2023)
Simplicity Bias via Global Convergence of Sharpness Minimization
par: Gatmiry, Khashayar, et autres
Publié: (2024)
par: Gatmiry, Khashayar, et autres
Publié: (2024)
AdaMuon: Adaptive Muon Optimizer
par: Si, Chongjie, et autres
Publié: (2025)
par: Si, Chongjie, et autres
Publié: (2025)
FedMuon: Federated Learning with Bias-corrected LMO-based Optimization
par: Takezawa, Yuki, et autres
Publié: (2025)
par: Takezawa, Yuki, et autres
Publié: (2025)
Three Forms of Stochastic Injection for Improved Distribution-to-Distribution Generative Modeling
par: Su, Shiye, et autres
Publié: (2025)
par: Su, Shiye, et autres
Publié: (2025)
KL-Regularized Reinforcement Learning is Designed to Mode Collapse
par: GX-Chen, Anthony, et autres
Publié: (2025)
par: GX-Chen, Anthony, et autres
Publié: (2025)
Understanding Simplicity Bias towards Compositional Mappings via Learning Dynamics
par: Ren, Yi, et autres
Publié: (2024)
par: Ren, Yi, et autres
Publié: (2024)
Simplicity Bias of Two-Layer Networks beyond Linearly Separable Data
par: Tsoy, Nikita, et autres
Publié: (2024)
par: Tsoy, Nikita, et autres
Publié: (2024)
Do Quantum Neural Networks have Simplicity Bias?
par: Pointing, Jessica
Publié: (2024)
par: Pointing, Jessica
Publié: (2024)
Should Bias be Eliminated? A General Framework to Use Bias for OOD Generalization
par: Li, Yan, et autres
Publié: (2025)
par: Li, Yan, et autres
Publié: (2025)
Spurious Correlations in High Dimensional Regression: The Roles of Regularization, Simplicity Bias and Over-Parameterization
par: Bombari, Simone, et autres
Publié: (2025)
par: Bombari, Simone, et autres
Publié: (2025)
Saddle-to-Saddle Dynamics Explains A Simplicity Bias Across Neural Network Architectures
par: Zhang, Yedi, et autres
Publié: (2025)
par: Zhang, Yedi, et autres
Publié: (2025)
Stochastic interpolants with data-dependent couplings
par: Albergo, Michael S., et autres
Publié: (2023)
par: Albergo, Michael S., et autres
Publié: (2023)
Contrasting with Symile: Simple Model-Agnostic Representation Learning for Unlimited Modalities
par: Saporta, Adriel, et autres
Publié: (2024)
par: Saporta, Adriel, et autres
Publié: (2024)
The Implicit Bias of Adam and Muon on Smooth Homogeneous Neural Networks
par: Gronich, Eitan, et autres
Publié: (2026)
par: Gronich, Eitan, et autres
Publié: (2026)
BONSAI: Bayesian Optimization with Natural Simplicity and Interpretability
par: Daulton, Samuel, et autres
Publié: (2026)
par: Daulton, Samuel, et autres
Publié: (2026)
SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning
par: Lee, Hojoon, et autres
Publié: (2024)
par: Lee, Hojoon, et autres
Publié: (2024)
Strategy Coopetition Explains the Emergence and Transience of In-Context Learning
par: Singh, Aaditya K., et autres
Publié: (2025)
par: Singh, Aaditya K., et autres
Publié: (2025)
Nuisances via Negativa: Adjusting for Spurious Correlations via Data Augmentation
par: Puli, Aahlad, et autres
Publié: (2022)
par: Puli, Aahlad, et autres
Publié: (2022)
Masked Autoencoders that Feel the Heart: Unveiling Simplicity Bias for ECG Analyses
par: Xu, He-Yang, et autres
Publié: (2025)
par: Xu, He-Yang, et autres
Publié: (2025)
Identifying Spurious Biases Early in Training through the Lens of Simplicity Bias
par: Yang, Yu, et autres
Publié: (2023)
par: Yang, Yu, et autres
Publié: (2023)
LiMuon: Light and Fast Muon Optimizer for Large Models
par: Huang, Feihu, et autres
Publié: (2025)
par: Huang, Feihu, et autres
Publié: (2025)
SignMuon: Communication-Efficient Distributed Muon Optimization
par: Mishra, Neel, et autres
Publié: (2026)
par: Mishra, Neel, et autres
Publié: (2026)
Effective Quantization of Muon Optimizer States
par: Gupta, Aman, et autres
Publié: (2025)
par: Gupta, Aman, et autres
Publié: (2025)
A Unified Stability Analysis of SAM vs SGD: Role of Data Coherence and Emergence of Simplicity Bias
par: Chang, Wei-Kai, et autres
Publié: (2025)
par: Chang, Wei-Kai, et autres
Publié: (2025)
Where Bits Matter in World Model Planning: A Paired Mixed-Bit Study for Efficient Spatial Reasoning
par: Ranganath, Suraj, et autres
Publié: (2026)
par: Ranganath, Suraj, et autres
Publié: (2026)
Random-Matrix-Induced Simplicity Bias in Over-parameterized Variational Quantum Circuits
par: Qi, Jun, et autres
Publié: (2026)
par: Qi, Jun, et autres
Publié: (2026)
Implicit Bias of Spectral Descent and Muon on Multiclass Separable Data
par: Fan, Chen, et autres
Publié: (2025)
par: Fan, Chen, et autres
Publié: (2025)
MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization
par: Su, Yupeng, et autres
Publié: (2026)
par: Su, Yupeng, et autres
Publié: (2026)
The Newton-Muon Optimizer
par: Du, Zhehang, et autres
Publié: (2026)
par: Du, Zhehang, et autres
Publié: (2026)
Time After Time: Deep-Q Effect Estimation for Interventions on When and What to do
par: Wald, Yoav, et autres
Publié: (2025)
par: Wald, Yoav, et autres
Publié: (2025)
Do We Always Need the Simplicity Bias? Looking for Optimal Inductive Biases in the Wild
par: Teney, Damien, et autres
Publié: (2025)
par: Teney, Damien, et autres
Publié: (2025)
Muown: Row-Norm Control for Muon Optimization
par: Lion, Kai, et autres
Publié: (2026)
par: Lion, Kai, et autres
Publié: (2026)
Documents similaires
-
Softmax $\geq$ Linear: Transformers may learn to classify in-context by kernel gradient descent
par: Dragutinović, Sara, et autres
Publié: (2025) -
Preference learning made easy: Everything should be understood through win rate
par: Zhang, Lily H., et autres
Publié: (2025) -
Attention and Compression is all you need for Controllably Efficient Language Models
par: Prakash, Jatin, et autres
Publié: (2025) -
What's the score? Automated Denoising Score Matching for Nonlinear Diffusions
par: Singhal, Raghav, et autres
Publié: (2024) -
Explanations that reveal all through the definition of encoding
par: Puli, Aahlad, et autres
Publié: (2024)