Ghosts of Softmax: Complex Singularities That Limit Safe Step Sizes in Cross-Entropy
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Sao, Piyush |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Non-Linearity Perturbation Threshold: Width Scaling and Landscape Bifurcations in Deep Learning
par: Alexander, Michael
Publié: (2026)
par: Alexander, Michael
Publié: (2026)
CAO: Curvature-Adaptive Optimization via Periodic Low-Rank Hessian Sketching
par: Du, Wenzhang
Publié: (2025)
par: Du, Wenzhang
Publié: (2025)
Differentiable Optimization Layers for Guaranteed Fairness in Deep Learning
par: Troxell, David, et autres
Publié: (2026)
par: Troxell, David, et autres
Publié: (2026)
GDNSQ: Gradual Differentiable Noise Scale Quantization for Low-bit Neural Networks
par: Salishev, Sergey, et autres
Publié: (2025)
par: Salishev, Sergey, et autres
Publié: (2025)
Multi-Objective Optimization with Desirability and Morris-Mitchell Criterion
par: Bartz-Beielstein, Thomas, et autres
Publié: (2025)
par: Bartz-Beielstein, Thomas, et autres
Publié: (2025)
Local properties of neural networks through the lens of layer-wise Hessians
par: Bolshim, Maxim, et autres
Publié: (2025)
par: Bolshim, Maxim, et autres
Publié: (2025)
Inter-Layer Hessian Analysis of Neural Networks with DAG Architectures
par: Bolshim, Maxim, et autres
Publié: (2026)
par: Bolshim, Maxim, et autres
Publié: (2026)
Stochastic Estimation of the Layer-wise Hessian Trace for Monitoring Neural-network Training
par: Bolshim, Maxim, et autres
Publié: (2026)
par: Bolshim, Maxim, et autres
Publié: (2026)
Complex-valued convolutional neural network classification of hand gesture from radar images
par: Khandan, Shokooh
Publié: (2024)
par: Khandan, Shokooh
Publié: (2024)
Limitations of Scalarisation in MORL: A Comparative Study in Discrete Environments
par: Shah, Muhammad Sa'ood, et autres
Publié: (2025)
par: Shah, Muhammad Sa'ood, et autres
Publié: (2025)
Maximum Entropy Relaxation of Multi-Way Cardinality Constraints for Synthetic Population Generation
par: Pachet, François, et autres
Publié: (2026)
par: Pachet, François, et autres
Publié: (2026)
Refining Graphical Neural Network Predictions Using Flow Matching for Optimal Power Flow with Constraint-Satisfaction Guarantee
par: Khanal, Kshitiz
Publié: (2025)
par: Khanal, Kshitiz
Publié: (2025)
Stable and Convexified Information Bottleneck Optimization via Symbolic Continuation and Entropy-Regularized Trajectories
par: Alpay, Faruk
Publié: (2025)
par: Alpay, Faruk
Publié: (2025)
Bed-Attached Vibration Sensor System: A Machine Learning Approach for Fall Detection in Nursing Homes
par: Bartz-Beielstein, Thomas, et autres
Publié: (2024)
par: Bartz-Beielstein, Thomas, et autres
Publié: (2024)
Simplifying Hyperparameter Tuning in Online Machine Learning -- The spotRiverGUI
par: Bartz-Beielstein, Thomas
Publié: (2024)
par: Bartz-Beielstein, Thomas
Publié: (2024)
IGT-OMD: Implicit Gradient Transport for Decision-Focused Learning under Delayed Feedback
par: Amoh, Benjamin, et autres
Publié: (2026)
par: Amoh, Benjamin, et autres
Publié: (2026)
PyEPO: A PyTorch-based End-to-End Predict-then-Optimize Library for Linear and Integer Programming
par: Tang, Bo, et autres
Publié: (2022)
par: Tang, Bo, et autres
Publié: (2022)
Theoretical Framework for Tempered Fractional Gradient Descent: Application to Breast Cancer Classification
par: Naifar, Omar
Publié: (2025)
par: Naifar, Omar
Publié: (2025)
NeurOptimisation: The Spiking Way to Evolve
par: Cruz-Duarte, Jorge Mario, et autres
Publié: (2025)
par: Cruz-Duarte, Jorge Mario, et autres
Publié: (2025)
Interior-Point Vanishing Problem in Semidefinite Relaxations for Neural Network Verification
par: Ueda, Ryota, et autres
Publié: (2025)
par: Ueda, Ryota, et autres
Publié: (2025)
On the Convergence Behavior of Preconditioned Gradient Descent Toward the Rich Learning Regime
par: Jiang, Shuai, et autres
Publié: (2026)
par: Jiang, Shuai, et autres
Publié: (2026)
FlowAdam: Implicit Regularization via Geometry-Aware Soft Momentum Injection
par: Singh, Devender, et autres
Publié: (2026)
par: Singh, Devender, et autres
Publié: (2026)
Multi-Objective Optimization and Hyperparameter Tuning With Desirability Functions
par: Bartz-Beielstein, Thomas
Publié: (2025)
par: Bartz-Beielstein, Thomas
Publié: (2025)
Physics Informed Differentiable Solvers for Learning Parametric Solution Manifolds in Heterogeneous Physical Systems
par: Panahi, Milad, et autres
Publié: (2026)
par: Panahi, Milad, et autres
Publié: (2026)
Enhancing Model Based Derivative Free Optimization using Direct Search
par: Li, Zijun, et autres
Publié: (2026)
par: Li, Zijun, et autres
Publié: (2026)
Benchmarking Generative AI Against Bayesian Optimization for Constrained Multi-Objective Inverse Design
par: Awan, Muhammad Bilal, et autres
Publié: (2025)
par: Awan, Muhammad Bilal, et autres
Publié: (2025)
An in-depth look at approximation via deep and narrow neural networks
par: Dommel, Joris, et autres
Publié: (2025)
par: Dommel, Joris, et autres
Publié: (2025)
VORT: Adaptive Power-Law Memory for NLP Transformers
par: Mlaiki, Nabil
Publié: (2026)
par: Mlaiki, Nabil
Publié: (2026)
Machine Learning Algorithms for Improving Black Box Optimization Solvers
par: Kimiaei, Morteza, et autres
Publié: (2025)
par: Kimiaei, Morteza, et autres
Publié: (2025)
i-DEQ: A stable inertial deep equilibrium model for image restoration
par: Clerc, Antonin, et autres
Publié: (2026)
par: Clerc, Antonin, et autres
Publié: (2026)
Black-Box Uniform Stability for Non-Euclidean Empirical Risk Minimization
par: Vary, Simon, et autres
Publié: (2024)
par: Vary, Simon, et autres
Publié: (2024)
Escaping Saddle Points via Curvature-Calibrated Perturbations: A Complete Analysis with Explicit Constants and Empirical Validation
par: Alpay, Faruk, et autres
Publié: (2025)
par: Alpay, Faruk, et autres
Publié: (2025)
From Non-Identifiability to Goal-Integrated Decision-Making in Parametric Inverse Optimization
par: Ahmadi, Farzin, et autres
Publié: (2026)
par: Ahmadi, Farzin, et autres
Publié: (2026)
TOPSIS-like metaheuristic for LABS problem
par: Urbańczyk, Aleksandra, et autres
Publié: (2025)
par: Urbańczyk, Aleksandra, et autres
Publié: (2025)
J6: Jacobian-Driven Role Attribution for Multi-Objective Prompt Optimization in LLMs
par: Wu, Yao
Publié: (2025)
par: Wu, Yao
Publié: (2025)
Implicit Bias and Invariance: How Hopfield Networks Efficiently Learn Graph Orbits
par: Murray, Michael, et autres
Publié: (2025)
par: Murray, Michael, et autres
Publié: (2025)
Setwise Coordinate Descent for Dual Asynchronous Decentralized Optimization
par: Costantini, Marina, et autres
Publié: (2025)
par: Costantini, Marina, et autres
Publié: (2025)
A unified convergence theory for adaptive first-order methods in the nonconvex case, including AdaNorm, full and diagonal AdaGrad, Shampoo and Muo
par: Gratton, S., et autres
Publié: (2026)
par: Gratton, S., et autres
Publié: (2026)
Adaptive Conditional Forest Sampling for Spectral Risk Optimisation under Decision-Dependent Uncertainty
par: Kurbucz, Marcell T.
Publié: (2026)
par: Kurbucz, Marcell T.
Publié: (2026)
Pseudoconvex Problems in Operational Decision Systems: Algorithms for Joint Learning and Optimization
par: Li, Zijun, et autres
Publié: (2026)
par: Li, Zijun, et autres
Publié: (2026)
Documents similaires
-
The Non-Linearity Perturbation Threshold: Width Scaling and Landscape Bifurcations in Deep Learning
par: Alexander, Michael
Publié: (2026) -
CAO: Curvature-Adaptive Optimization via Periodic Low-Rank Hessian Sketching
par: Du, Wenzhang
Publié: (2025) -
Differentiable Optimization Layers for Guaranteed Fairness in Deep Learning
par: Troxell, David, et autres
Publié: (2026) -
GDNSQ: Gradual Differentiable Noise Scale Quantization for Low-bit Neural Networks
par: Salishev, Sergey, et autres
Publié: (2025) -
Multi-Objective Optimization with Desirability and Morris-Mitchell Criterion
par: Bartz-Beielstein, Thomas, et autres
Publié: (2025)