Principled Architecture-aware Scaling of Hyperparameters
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Wuyang, Wu, Junru, Wang, Zhangyang, Hanin, Boris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hyperparameter Transfer for Dense Associative Memories
di: Holtzman, Roi, et al.
Pubblicazione: (2026)
di: Holtzman, Roi, et al.
Pubblicazione: (2026)
Hyperparameter Transfer with Mixture-of-Expert Layers
di: Jiang, Tianze, et al.
Pubblicazione: (2026)
di: Jiang, Tianze, et al.
Pubblicazione: (2026)
Bayesian Inference with Shaped Deep Non-linear MLPs
di: Hanin, Boris, et al.
Pubblicazione: (2026)
di: Hanin, Boris, et al.
Pubblicazione: (2026)
Learning Rate Transfer in Normalized Transformers
di: Shigida, Boris, et al.
Pubblicazione: (2026)
di: Shigida, Boris, et al.
Pubblicazione: (2026)
Implicit Bias of the JKO Scheme
di: Halmos, Peter, et al.
Pubblicazione: (2025)
di: Halmos, Peter, et al.
Pubblicazione: (2025)
Efficient Hyperparameter Tuning via Trajectory Invariance Principle
di: Li, Bingrui, et al.
Pubblicazione: (2025)
di: Li, Bingrui, et al.
Pubblicazione: (2025)
Bayesian Inference with Deep Weakly Nonlinear Networks
di: Hanin, Boris, et al.
Pubblicazione: (2024)
di: Hanin, Boris, et al.
Pubblicazione: (2024)
Deep Neural Nets as Hamiltonians
di: Winer, Mike, et al.
Pubblicazione: (2025)
di: Winer, Mike, et al.
Pubblicazione: (2025)
Two-stage hybrid models for enhancing forecasting accuracy on heterogeneous time series
di: Ren, Junru, et al.
Pubblicazione: (2025)
di: Ren, Junru, et al.
Pubblicazione: (2025)
RBFleX-NAS: Training-Free Neural Architecture Search Using Radial Basis Function Kernel and Hyperparameter Detection
di: Yamasaki, Tomomasa, et al.
Pubblicazione: (2025)
di: Yamasaki, Tomomasa, et al.
Pubblicazione: (2025)
DANCE: DAta-Network Co-optimization for Efficient Segmentation Model Training and Inference
di: Li, Chaojian, et al.
Pubblicazione: (2021)
di: Li, Chaojian, et al.
Pubblicazione: (2021)
AutoGAN-Distiller: Searching to Compress Generative Adversarial Networks
di: Fu, Yonggan, et al.
Pubblicazione: (2020)
di: Fu, Yonggan, et al.
Pubblicazione: (2020)
Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales
di: Qiu, Shikai, et al.
Pubblicazione: (2025)
di: Qiu, Shikai, et al.
Pubblicazione: (2025)
Deriving Hyperparameter Scaling Laws via Modern Optimization Theory
di: Shulgin, Egor, et al.
Pubblicazione: (2026)
di: Shulgin, Egor, et al.
Pubblicazione: (2026)
Why Neural Network Can Discover Symbolic Structures with Gradient-based Training: An Algebraic and Geometric Foundation for Neurosymbolic Reasoning
di: Wang, Peihao, et al.
Pubblicazione: (2025)
di: Wang, Peihao, et al.
Pubblicazione: (2025)
Tuning Algorithmic and Architectural Hyperparameters in Graph-Based Semi-Supervised Learning with Provable Guarantees
di: Du, Ally Yalei, et al.
Pubblicazione: (2025)
di: Du, Ally Yalei, et al.
Pubblicazione: (2025)
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
di: Chen, Lingjiao, et al.
Pubblicazione: (2024)
di: Chen, Lingjiao, et al.
Pubblicazione: (2024)
Quantitative CLTs in Deep Neural Networks
di: Favaro, Stefano, et al.
Pubblicazione: (2023)
di: Favaro, Stefano, et al.
Pubblicazione: (2023)
On the Learning with Augmented Class via Forests
di: Xu, Fan, et al.
Pubblicazione: (2025)
di: Xu, Fan, et al.
Pubblicazione: (2025)
Revisiting Hyperparameter Tuning with Differential Privacy
di: Ding, Youlong, et al.
Pubblicazione: (2022)
di: Ding, Youlong, et al.
Pubblicazione: (2022)
Overtuning in Hyperparameter Optimization
di: Schneider, Lennart, et al.
Pubblicazione: (2025)
di: Schneider, Lennart, et al.
Pubblicazione: (2025)
Understanding the Mechanisms of Fast Hyperparameter Transfer
di: Ghosh, Nikhil, et al.
Pubblicazione: (2025)
di: Ghosh, Nikhil, et al.
Pubblicazione: (2025)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024)
di: Razin, Noam, et al.
Pubblicazione: (2024)
Survey of Active Learning Hyperparameters: Insights from a Large-Scale Experimental Grid
di: Gonsior, Julius, et al.
Pubblicazione: (2025)
di: Gonsior, Julius, et al.
Pubblicazione: (2025)
Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
di: Lu, Jialin, et al.
Pubblicazione: (2026)
di: Lu, Jialin, et al.
Pubblicazione: (2026)
Scale-aware Message Passing For Graph Node Classification
di: Jiang, Qin, et al.
Pubblicazione: (2024)
di: Jiang, Qin, et al.
Pubblicazione: (2024)
Principles and Components of Federated Learning Architectures
di: Nasim, MD Abdullah Al, et al.
Pubblicazione: (2025)
di: Nasim, MD Abdullah Al, et al.
Pubblicazione: (2025)
Hyperparameter Transfer Laws for Non-Recurrent Multi-Path Neural Networks
di: Wu, Shenxi, et al.
Pubblicazione: (2026)
di: Wu, Shenxi, et al.
Pubblicazione: (2026)
Hyperparameter Selection in Continual Learning
di: Lee, Thomas L., et al.
Pubblicazione: (2024)
di: Lee, Thomas L., et al.
Pubblicazione: (2024)
Hyperparameter Optimization in Machine Learning
di: Franceschi, Luca, et al.
Pubblicazione: (2024)
di: Franceschi, Luca, et al.
Pubblicazione: (2024)
The Role of Hyperparameters in Predictive Multiplicity
di: Cavus, Mustafa, et al.
Pubblicazione: (2025)
di: Cavus, Mustafa, et al.
Pubblicazione: (2025)
Generalization Error Analysis for Sparse Mixture-of-Experts: A Preliminary Study
di: Zhao, Jinze, et al.
Pubblicazione: (2024)
di: Zhao, Jinze, et al.
Pubblicazione: (2024)
Recurrent Diffusion for Large-Scale Parameter Generation
di: Wang, Kai, et al.
Pubblicazione: (2025)
di: Wang, Kai, et al.
Pubblicazione: (2025)
FlexHB: a More Efficient and Flexible Framework for Hyperparameter Optimization
di: Zhang, Yang, et al.
Pubblicazione: (2024)
di: Zhang, Yang, et al.
Pubblicazione: (2024)
Design Principle Transfer in Neural Architecture Search via Large Language Models
di: Zhou, Xun, et al.
Pubblicazione: (2024)
di: Zhou, Xun, et al.
Pubblicazione: (2024)
Frequency-Based Hyperparameter Selection in Games
di: Sanyal, Aniket, et al.
Pubblicazione: (2026)
di: Sanyal, Aniket, et al.
Pubblicazione: (2026)
Exploring the Optimized Value of Each Hyperparameter in Various Gradient Descent Algorithms
di: Chen, Abel C. H.
Pubblicazione: (2022)
di: Chen, Abel C. H.
Pubblicazione: (2022)
Generative Bayesian Hyperparameter Tuning
di: Lopes, Hedibert, et al.
Pubblicazione: (2025)
di: Lopes, Hedibert, et al.
Pubblicazione: (2025)
Selecting Hyperparameters for Tree-Boosting
di: Koster, Floris Jan, et al.
Pubblicazione: (2026)
di: Koster, Floris Jan, et al.
Pubblicazione: (2026)
Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning
di: Wang, Yiran, et al.
Pubblicazione: (2024)
di: Wang, Yiran, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hyperparameter Transfer for Dense Associative Memories
di: Holtzman, Roi, et al.
Pubblicazione: (2026) -
Hyperparameter Transfer with Mixture-of-Expert Layers
di: Jiang, Tianze, et al.
Pubblicazione: (2026) -
Bayesian Inference with Shaped Deep Non-linear MLPs
di: Hanin, Boris, et al.
Pubblicazione: (2026) -
Learning Rate Transfer in Normalized Transformers
di: Shigida, Boris, et al.
Pubblicazione: (2026) -
Implicit Bias of the JKO Scheme
di: Halmos, Peter, et al.
Pubblicazione: (2025)