BSFA: Leveraging the Subspace Dichotomy to Accelerate Neural Network Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Wenjie, Wang, Bohan, Chen, Wei, Cheng, Xueqi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training
par: Zhou, Wenjie, et autres
Publié: (2026)
par: Zhou, Wenjie, et autres
Publié: (2026)
When and Why Grouping Attention Heads Accelerates Muon Optimization
par: Zhang, Hongtao, et autres
Publié: (2026)
par: Zhang, Hongtao, et autres
Publié: (2026)
The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training
par: Zhang, Hongtao, et autres
Publié: (2026)
par: Zhang, Hongtao, et autres
Publié: (2026)
Training Bayesian Neural Networks with Sparse Subspace Variational Inference
par: Li, Junbo, et autres
Publié: (2024)
par: Li, Junbo, et autres
Publié: (2024)
Adversarial Training for Graph Neural Networks via Graph Subspace Energy Optimization
par: Liu, Ganlin, et autres
Publié: (2024)
par: Liu, Ganlin, et autres
Publié: (2024)
Why ReLU? A Bit-Model Dichotomy for Deep Network Training
par: Doron-Arad, Ilan, et autres
Publié: (2026)
par: Doron-Arad, Ilan, et autres
Publié: (2026)
Quantifying Training Difficulty and Accelerating Convergence in Neural Network-Based PDE Solvers
par: Chen, Chuqi, et autres
Publié: (2024)
par: Chen, Chuqi, et autres
Publié: (2024)
Neural Network Training Techniques Regularize Optimization Trajectory: An Empirical Study
par: Chen, Cheng, et autres
Publié: (2020)
par: Chen, Cheng, et autres
Publié: (2020)
Accelerating Data Generation for Neural Operators via Krylov Subspace Recycling
par: Wang, Hong, et autres
Publié: (2024)
par: Wang, Hong, et autres
Publié: (2024)
Accelerating Neural Network Training: An Analysis of the AlgoPerf Competition
par: Kasimbeg, Priya, et autres
Publié: (2025)
par: Kasimbeg, Priya, et autres
Publié: (2025)
Accelerating Neural Network Training Along Sharp and Flat Directions
par: Zakarin, Daniyar, et autres
Publié: (2025)
par: Zakarin, Daniyar, et autres
Publié: (2025)
ROOT: Robust Orthogonalized Optimizer for Neural Network Training
par: He, Wei, et autres
Publié: (2025)
par: He, Wei, et autres
Publié: (2025)
Leveraging Deep Neural Networks for Aspect-Based Sentiment Classification
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
Improving Generalization of Deep Neural Networks by Leveraging Margin Distribution
par: Lyu, Shen-Huan, et autres
Publié: (2018)
par: Lyu, Shen-Huan, et autres
Publié: (2018)
Subspace-Configurable Networks
par: Wang, Dong, et autres
Publié: (2023)
par: Wang, Dong, et autres
Publié: (2023)
Provable Acceleration of Nesterov's Accelerated Gradient Method over Heavy Ball Method in Training Over-Parameterized Neural Networks
par: Liu, Xin, et autres
Publié: (2022)
par: Liu, Xin, et autres
Publié: (2022)
Graph ODEs and Beyond: A Comprehensive Survey on Integrating Differential Equations with Graph Neural Networks
par: Liu, Zewen, et autres
Publié: (2025)
par: Liu, Zewen, et autres
Publié: (2025)
Stochastic Subspace Descent Accelerated via Bi-fidelity Line Search
par: Cheng, Nuojin, et autres
Publié: (2025)
par: Cheng, Nuojin, et autres
Publié: (2025)
Accelerate Neural Subspace-Based Reduced-Order Solver of Deformable Simulation by Lipschitz Optimization
par: Lyu, Aoran, et autres
Publié: (2024)
par: Lyu, Aoran, et autres
Publié: (2024)
PreNeT: Leveraging Computational Features to Predict Deep Neural Network Training Time
par: Pourali, Alireza, et autres
Publié: (2024)
par: Pourali, Alireza, et autres
Publié: (2024)
Accelerating Storage-Based Training for Graph Neural Networks
par: Jang, Myung-Hwan, et autres
Publié: (2026)
par: Jang, Myung-Hwan, et autres
Publié: (2026)
Noise-Adaptive Layerwise Learning Rates: Accelerating Geometry-Aware Optimization for Deep Neural Network Training
par: Hao, Jie, et autres
Publié: (2025)
par: Hao, Jie, et autres
Publié: (2025)
SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training
par: Refael, Yehonathan, et autres
Publié: (2025)
par: Refael, Yehonathan, et autres
Publié: (2025)
DR-CircuitGNN: Training Acceleration of Heterogeneous Circuit Graph Neural Network on GPUs
par: Luo, Yuebo, et autres
Publié: (2025)
par: Luo, Yuebo, et autres
Publié: (2025)
Leveraging Pre-Trained Neural Networks to Enhance Machine Learning with Variational Quantum Circuits
par: Qi, Jun, et autres
Publié: (2024)
par: Qi, Jun, et autres
Publié: (2024)
Low Rank Based Subspace Inference for the Laplace Approximation of Bayesian Neural Networks
par: Faller, Josua, et autres
Publié: (2025)
par: Faller, Josua, et autres
Publié: (2025)
Accelerating Eigenvalue Dataset Generation via Chebyshev Subspace Filter
par: Wang, Hong, et autres
Publié: (2025)
par: Wang, Hong, et autres
Publié: (2025)
Generalization Bounds of Stochastic Gradient Descent in Homogeneous Neural Networks
par: Ma, Wenquan, et autres
Publié: (2026)
par: Ma, Wenquan, et autres
Publié: (2026)
Leveraging Task Structures for Improved Identifiability in Neural Network Representations
par: Chen, Wenlin, et autres
Publié: (2023)
par: Chen, Wenlin, et autres
Publié: (2023)
Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent
par: Imai, Shota, et autres
Publié: (2026)
par: Imai, Shota, et autres
Publié: (2026)
BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training
par: Wu, Houming, et autres
Publié: (2024)
par: Wu, Houming, et autres
Publié: (2024)
asKAN: Active Subspace embedded Kolmogorov-Arnold Network
par: Zhou, Zhiteng, et autres
Publié: (2025)
par: Zhou, Zhiteng, et autres
Publié: (2025)
Explore and Establish Synergistic Effects Between Weight Pruning and Coreset Selection in Neural Network Training
par: Wan, Weilin, et autres
Publié: (2025)
par: Wan, Weilin, et autres
Publié: (2025)
Q-Newton: Hybrid Quantum-Classical Scheduling for Accelerating Neural Network Training with Newton's Gradient Descent
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
Leveraging Classical Algorithms for Graph Neural Networks
par: Wu, Jason, et autres
Publié: (2025)
par: Wu, Jason, et autres
Publié: (2025)
Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification
par: Duan, Zenghao, et autres
Publié: (2026)
par: Duan, Zenghao, et autres
Publié: (2026)
Biologically Plausible Training of Deep Neural Networks Using a Top-down Credit Assignment Network
par: Chen, Jian-Hui, et autres
Publié: (2022)
par: Chen, Jian-Hui, et autres
Publié: (2022)
Removing Spurious Concepts from Neural Network Representations via Joint Subspace Estimation
par: Holstege, Floris, et autres
Publié: (2023)
par: Holstege, Floris, et autres
Publié: (2023)
Revealing the Utilized Rank of Subspaces of Learning in Neural Networks
par: Garg, Isha, et autres
Publié: (2024)
par: Garg, Isha, et autres
Publié: (2024)
AA-DLADMM: An Accelerated ADMM-based Framework for Training Deep Neural Networks
par: Ebrahimi, Zeinab, et autres
Publié: (2024)
par: Ebrahimi, Zeinab, et autres
Publié: (2024)
Documents similaires
-
Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training
par: Zhou, Wenjie, et autres
Publié: (2026) -
When and Why Grouping Attention Heads Accelerates Muon Optimization
par: Zhang, Hongtao, et autres
Publié: (2026) -
The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training
par: Zhang, Hongtao, et autres
Publié: (2026) -
Training Bayesian Neural Networks with Sparse Subspace Variational Inference
par: Li, Junbo, et autres
Publié: (2024) -
Adversarial Training for Graph Neural Networks via Graph Subspace Energy Optimization
par: Liu, Ganlin, et autres
Publié: (2024)