Spectral Alignment as Predictor of Loss Explosion in Neural Network Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Qiu, Haiquan, Wu, You, Tan, Yingjie, Wang, Yaqing, Yao, Quanming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DGNet: Discrete Green Networks for Data-Efficient Learning of Spatiotemporal PDEs
por: Tan, Yingjie, et al.
Publicado: (2026)
por: Tan, Yingjie, et al.
Publicado: (2026)
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
por: Qiu, Haiquan, et al.
Publicado: (2025)
por: Qiu, Haiquan, et al.
Publicado: (2025)
Neural Symbolic Regression of Complex Network Dynamics
por: Qiu, Haiquan, et al.
Publicado: (2024)
por: Qiu, Haiquan, et al.
Publicado: (2024)
Graph Unitary Message Passing
por: Qiu, Haiquan, et al.
Publicado: (2024)
por: Qiu, Haiquan, et al.
Publicado: (2024)
Superpose Task-specific Features for Model Merging
por: Qiu, Haiquan, et al.
Publicado: (2025)
por: Qiu, Haiquan, et al.
Publicado: (2025)
Self-Generative Adversarial Fine-Tuning for Large Language Models
por: Wu, Shiguang, et al.
Publicado: (2026)
por: Wu, Shiguang, et al.
Publicado: (2026)
PACIA: Parameter-Efficient Adapter for Few-Shot Molecular Property Prediction
por: Wu, Shiguang, et al.
Publicado: (2023)
por: Wu, Shiguang, et al.
Publicado: (2023)
Understanding Expressivity of GNN in Rule Learning
por: Qiu, Haiquan, et al.
Publicado: (2023)
por: Qiu, Haiquan, et al.
Publicado: (2023)
Learning to Learn with Contrastive Meta-Objective
por: Wu, Shiguang, et al.
Publicado: (2024)
por: Wu, Shiguang, et al.
Publicado: (2024)
Accurate and interpretable drug-drug interaction prediction enabled by knowledge subgraph learning
por: Wang, Yaqing, et al.
Publicado: (2023)
por: Wang, Yaqing, et al.
Publicado: (2023)
Loss-aware Curriculum Learning for Heterogeneous Graph Neural Networks
por: Wong, Zhen Hao, et al.
Publicado: (2024)
por: Wong, Zhen Hao, et al.
Publicado: (2024)
Beyond Scaleup: Knowledge-aware Parsimony Learning from Deep Networks
por: Yao, Quanming, et al.
Publicado: (2024)
por: Yao, Quanming, et al.
Publicado: (2024)
Attending on Multilevel Structure of Proteins enables Accurate Prediction of Cold-Start Drug-Target Interactions
por: Zhang, Ziying, et al.
Publicado: (2025)
por: Zhang, Ziying, et al.
Publicado: (2025)
SCPL: Enhancing Neural Network Training Throughput with Decoupled Local Losses and Model Parallelism
por: Ho, Ming-Yao, et al.
Publicado: (2026)
por: Ho, Ming-Yao, et al.
Publicado: (2026)
Loss Spike in Training Neural Networks
por: Li, Xiaolong, et al.
Publicado: (2023)
por: Li, Xiaolong, et al.
Publicado: (2023)
Heuristic Learning with Graph Neural Networks: A Unified Framework for Link Prediction
por: Zhang, Juzheng, et al.
Publicado: (2024)
por: Zhang, Juzheng, et al.
Publicado: (2024)
Geometric and Spectral Alignment for Deep Neural Network I
por: Liu, Ziran, et al.
Publicado: (2026)
por: Liu, Ziran, et al.
Publicado: (2026)
Geometric and Spectral Alignment for Deep Neural Network II
por: Liu, Ziran, et al.
Publicado: (2026)
por: Liu, Ziran, et al.
Publicado: (2026)
Automated Decision-Making on Networks with LLMs through Knowledge-Guided Evolution
por: Zheng, Xiaohan, et al.
Publicado: (2025)
por: Zheng, Xiaohan, et al.
Publicado: (2025)
HIGHT: Hierarchical Graph Tokenization for Molecule-Language Alignment
por: Chen, Yongqiang, et al.
Publicado: (2024)
por: Chen, Yongqiang, et al.
Publicado: (2024)
Z-Error Loss for Training Neural Networks
por: Godin, Guillaume
Publicado: (2025)
por: Godin, Guillaume
Publicado: (2025)
Language Model Networks: Supervision-Efficient Learning through Dense Communication
por: Wu, Shiguang, et al.
Publicado: (2025)
por: Wu, Shiguang, et al.
Publicado: (2025)
Sparse Spectral Training and Inference on Euclidean and Hyperbolic Neural Networks
por: Zhao, Jialin, et al.
Publicado: (2024)
por: Zhao, Jialin, et al.
Publicado: (2024)
PERSCEN: Learning Personalized Interaction Pattern and Scenario Preference for Multi-Scenario Matching
por: Du, Haotong, et al.
Publicado: (2025)
por: Du, Haotong, et al.
Publicado: (2025)
S^2-KD: Semantic-Spectral Knowledge Distillation Spatiotemporal Forecasting
por: Wang, Wenshuo, et al.
Publicado: (2025)
por: Wang, Wenshuo, et al.
Publicado: (2025)
Knowledge-Enhanced Recommendation with User-Centric Subgraph Network
por: Liu, Guangyi, et al.
Publicado: (2024)
por: Liu, Guangyi, et al.
Publicado: (2024)
Dynamic Spectral Backpropagation for Efficient Neural Network Training
por: Muthuraman, Mannmohan
Publicado: (2025)
por: Muthuraman, Mannmohan
Publicado: (2025)
Attention Sinks Induce Gradient Sinks: Massive Activations as Gradient Regulators in Transformers
por: Chen, Yihong, et al.
Publicado: (2026)
por: Chen, Yihong, et al.
Publicado: (2026)
A Model Zoo on Phase Transitions in Neural Networks
por: Schürholt, Konstantin, et al.
Publicado: (2025)
por: Schürholt, Konstantin, et al.
Publicado: (2025)
DFNN: A Deep Fréchet Neural Network Framework for Learning Metric-Space-Valued Responses
por: Kim, Kyum, et al.
Publicado: (2025)
por: Kim, Kyum, et al.
Publicado: (2025)
A Principled Loss Function for Direct Language Model Alignment
por: Tan, Yuandong
Publicado: (2025)
por: Tan, Yuandong
Publicado: (2025)
Towards Versatile Graph Learning Approach: from the Perspective of Large Language Models
por: Wei, Lanning, et al.
Publicado: (2024)
por: Wei, Lanning, et al.
Publicado: (2024)
Benchmarking drug-drug interaction prediction methods: a perspective of distribution changes
por: Shen, Zhenqian, et al.
Publicado: (2024)
por: Shen, Zhenqian, et al.
Publicado: (2024)
Convergence of SGD for Training Neural Networks with Sliced Wasserstein Losses
por: Tanguy, Eloi
Publicado: (2023)
por: Tanguy, Eloi
Publicado: (2023)
Loss Patterns of Neural Networks
por: Skorokhodov, Ivan, et al.
Publicado: (2019)
por: Skorokhodov, Ivan, et al.
Publicado: (2019)
Asymmetric Learning for Spectral Graph Neural Networks
por: Liu, Fangbing, et al.
Publicado: (2024)
por: Liu, Fangbing, et al.
Publicado: (2024)
Training Bayesian Neural Networks with Sparse Subspace Variational Inference
por: Li, Junbo, et al.
Publicado: (2024)
por: Li, Junbo, et al.
Publicado: (2024)
SELDON: Supernova Explosions Learned by Deep ODE Networks
por: Wu, Jiezhong, et al.
Publicado: (2026)
por: Wu, Jiezhong, et al.
Publicado: (2026)
Training of Spiking Neural Networks with Expectation-Propagation
por: Yao, Dan, et al.
Publicado: (2025)
por: Yao, Dan, et al.
Publicado: (2025)
Deep Neural Network Training as Random Effects: An Optimization-Inference Duality
por: Yao, Minhao, et al.
Publicado: (2026)
por: Yao, Minhao, et al.
Publicado: (2026)
Ejemplares similares
-
DGNet: Discrete Green Networks for Data-Efficient Learning of Spatiotemporal PDEs
por: Tan, Yingjie, et al.
Publicado: (2026) -
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
por: Qiu, Haiquan, et al.
Publicado: (2025) -
Neural Symbolic Regression of Complex Network Dynamics
por: Qiu, Haiquan, et al.
Publicado: (2024) -
Graph Unitary Message Passing
por: Qiu, Haiquan, et al.
Publicado: (2024) -
Superpose Task-specific Features for Model Merging
por: Qiu, Haiquan, et al.
Publicado: (2025)