Salvato in:
| Autori principali: | Anson, Ben, Milsom, Edward, Aitchison, Laurence |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.06525 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Convolutional Deep Kernel Machines
di: Milsom, Edward, et al.
Pubblicazione: (2023)
di: Milsom, Edward, et al.
Pubblicazione: (2023)
Stochastic Kernel Regularisation Improves Generalisation in Deep Kernel Machines
di: Milsom, Edward, et al.
Pubblicazione: (2024)
di: Milsom, Edward, et al.
Pubblicazione: (2024)
Function-Space Learning Rates
di: Milsom, Edward, et al.
Pubblicazione: (2025)
di: Milsom, Edward, et al.
Pubblicazione: (2025)
Controlling changes to attention logits
di: Anson, Ben, et al.
Pubblicazione: (2025)
di: Anson, Ben, et al.
Pubblicazione: (2025)
Scale-invariant Attention
di: Anson, Ben, et al.
Pubblicazione: (2025)
di: Anson, Ben, et al.
Pubblicazione: (2025)
Channel Estimation by Infinite Width Convolutional Networks
di: Mallik, Mohammed, et al.
Pubblicazione: (2025)
di: Mallik, Mohammed, et al.
Pubblicazione: (2025)
Using Neural Networks for Data Cleaning in Weather Datasets
di: Hanslope, Jack R. P., et al.
Pubblicazione: (2024)
di: Hanslope, Jack R. P., et al.
Pubblicazione: (2024)
Why you don't overfit, and don't need Bayes if you only train for one epoch
di: Aitchison, Laurence
Pubblicazione: (2024)
di: Aitchison, Laurence
Pubblicazione: (2024)
Infinite Width Limits of Self Supervised Neural Networks
di: Fleissner, Maximilian, et al.
Pubblicazione: (2024)
di: Fleissner, Maximilian, et al.
Pubblicazione: (2024)
Depth Separation in Norm-Bounded Infinite-Width Neural Networks
di: Parkinson, Suzanna, et al.
Pubblicazione: (2024)
di: Parkinson, Suzanna, et al.
Pubblicazione: (2024)
Batch size invariant Adam
di: Wang, Xi, et al.
Pubblicazione: (2024)
di: Wang, Xi, et al.
Pubblicazione: (2024)
An Infinite-Width Analysis on the Jacobian-Regularised Training of a Neural Network
di: Kim, Taeyoung, et al.
Pubblicazione: (2023)
di: Kim, Taeyoung, et al.
Pubblicazione: (2023)
How to set AdamW's weight decay as you scale model and dataset size
di: Wang, Xi, et al.
Pubblicazione: (2024)
di: Wang, Xi, et al.
Pubblicazione: (2024)
Learning to Skip the Middle Layers of Transformers
di: Lawson, Tim, et al.
Pubblicazione: (2025)
di: Lawson, Tim, et al.
Pubblicazione: (2025)
Massively Parallel Expectation Maximization For Approximate Posteriors
di: Heap, Thomas, et al.
Pubblicazione: (2025)
di: Heap, Thomas, et al.
Pubblicazione: (2025)
The Graphon Limit Hypothesis: Understanding Neural Network Pruning via Infinite Width Analysis
di: Pham, Hoang, et al.
Pubblicazione: (2025)
di: Pham, Hoang, et al.
Pubblicazione: (2025)
Mathematical Foundations of Neural Tangents and Infinite-Width Networks
di: Mysore, Rachana, et al.
Pubblicazione: (2025)
di: Mysore, Rachana, et al.
Pubblicazione: (2025)
Review of blockchain application with Graph Neural Networks, Graph Convolutional Networks and Convolutional Neural Networks
di: Ancelotti, Amy, et al.
Pubblicazione: (2024)
di: Ancelotti, Amy, et al.
Pubblicazione: (2024)
Transfer Learning in Infinite Width Feature Learning Networks
di: Lauditi, Clarissa, et al.
Pubblicazione: (2025)
di: Lauditi, Clarissa, et al.
Pubblicazione: (2025)
Homotopy Relaxation Training Algorithms for Infinite-Width Two-Layer ReLU Neural Networks
di: Yang, Yahong, et al.
Pubblicazione: (2023)
di: Yang, Yahong, et al.
Pubblicazione: (2023)
Spatio-Temporal Graph Convolutional Networks: Optimised Temporal Architecture
di: Turner, Edward
Pubblicazione: (2025)
di: Turner, Edward
Pubblicazione: (2025)
Position: Don't Use the CLT in LLM Evals With Fewer Than a Few Hundred Datapoints
di: Bowyer, Sam, et al.
Pubblicazione: (2025)
di: Bowyer, Sam, et al.
Pubblicazione: (2025)
Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers
di: Heap, Thomas, et al.
Pubblicazione: (2025)
di: Heap, Thomas, et al.
Pubblicazione: (2025)
MONGOOSE: Path-wise Smooth Bayesian Optimisation via Meta-learning
di: Yang, Adam X., et al.
Pubblicazione: (2023)
di: Yang, Adam X., et al.
Pubblicazione: (2023)
Statistical Physics of Deep Neural Networks: Generalization Capability, Beyond the Infinite Width, and Feature Learning
di: Ariosto, Sebastiano
Pubblicazione: (2025)
di: Ariosto, Sebastiano
Pubblicazione: (2025)
Adaptive Width Neural Networks
di: Errica, Federico, et al.
Pubblicazione: (2025)
di: Errica, Federico, et al.
Pubblicazione: (2025)
Variational Graph Convolutional Neural Networks
di: Oleksiienko, Illia, et al.
Pubblicazione: (2025)
di: Oleksiienko, Illia, et al.
Pubblicazione: (2025)
On the Infinite Width and Depth Limits of Predictive Coding Networks
di: Innocenti, Francesco, et al.
Pubblicazione: (2026)
di: Innocenti, Francesco, et al.
Pubblicazione: (2026)
Network Degeneracy as an Indicator of Training Performance: Comparing Finite and Infinite Width Angle Predictions
di: Jakub, Cameron, et al.
Pubblicazione: (2023)
di: Jakub, Cameron, et al.
Pubblicazione: (2023)
Bayesian Low-rank Adaptation for Large Language Models
di: Yang, Adam X., et al.
Pubblicazione: (2023)
di: Yang, Adam X., et al.
Pubblicazione: (2023)
Residual Stream Analysis with Multi-Layer SAEs
di: Lawson, Tim, et al.
Pubblicazione: (2024)
di: Lawson, Tim, et al.
Pubblicazione: (2024)
On the Parameterization of Second-Order Optimization Effective Towards the Infinite Width
di: Ishikawa, Satoki, et al.
Pubblicazione: (2023)
di: Ishikawa, Satoki, et al.
Pubblicazione: (2023)
Quantized Convolutional Neural Networks Through the Lens of Partial Differential Equations
di: Ben-Yair, Ido, et al.
Pubblicazione: (2021)
di: Ben-Yair, Ido, et al.
Pubblicazione: (2021)
Inverse-Free Sparse Variational Gaussian Processes
di: Cortinovis, Stefano, et al.
Pubblicazione: (2026)
di: Cortinovis, Stefano, et al.
Pubblicazione: (2026)
Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations
di: Farnik, Lucy, et al.
Pubblicazione: (2025)
di: Farnik, Lucy, et al.
Pubblicazione: (2025)
Global Convergence and Rich Feature Learning in $L$-Layer Infinite-Width Neural Networks under $μ$P Parametrization
di: Chen, Zixiang, et al.
Pubblicazione: (2025)
di: Chen, Zixiang, et al.
Pubblicazione: (2025)
Transfer Entropy in Graph Convolutional Neural Networks
di: Moldovan, Adrian, et al.
Pubblicazione: (2024)
di: Moldovan, Adrian, et al.
Pubblicazione: (2024)
Graph Neural Networks vs Convolutional Neural Networks for Graph Domination Number Prediction
di: Davila, Randy, et al.
Pubblicazione: (2025)
di: Davila, Randy, et al.
Pubblicazione: (2025)
Evaluating the effects of Data Sparsity on the Link-level Bicycling Volume Estimation: A Graph Convolutional Neural Network Approach
di: Gupta, Mohit, et al.
Pubblicazione: (2024)
di: Gupta, Mohit, et al.
Pubblicazione: (2024)
Local Loss Optimization in the Infinite Width: Stable Parameterization of Predictive Coding Networks and Target Propagation
di: Ishikawa, Satoki, et al.
Pubblicazione: (2024)
di: Ishikawa, Satoki, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Convolutional Deep Kernel Machines
di: Milsom, Edward, et al.
Pubblicazione: (2023) -
Stochastic Kernel Regularisation Improves Generalisation in Deep Kernel Machines
di: Milsom, Edward, et al.
Pubblicazione: (2024) -
Function-Space Learning Rates
di: Milsom, Edward, et al.
Pubblicazione: (2025) -
Controlling changes to attention logits
di: Anson, Ben, et al.
Pubblicazione: (2025) -
Scale-invariant Attention
di: Anson, Ben, et al.
Pubblicazione: (2025)