Learning in Compact Spaces with Approximately Normalized Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Franke, Jörg K. H., Spiegelhalter, Urs, Nezhurina, Marianna, Jitsev, Jenia, Hutter, Frank, Hefenbrock, Michael |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities
par: Spiegelhalter, Urs, et autres
Publié: (2025)
par: Spiegelhalter, Urs, et autres
Publié: (2025)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
par: Nezhurina, Marianna, et autres
Publié: (2024)
par: Nezhurina, Marianna, et autres
Publié: (2024)
Improving Deep Learning Optimization through Constrained Parameter Regularization
par: Franke, Jörg K. H., et autres
Publié: (2023)
par: Franke, Jörg K. H., et autres
Publié: (2023)
Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison
par: Nezhurina, Marianna, et autres
Publié: (2025)
par: Nezhurina, Marianna, et autres
Publié: (2025)
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
par: Cipolina-Kun, Lucia, et autres
Publié: (2025)
par: Cipolina-Kun, Lucia, et autres
Publié: (2025)
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
par: Nezhurina, Marianna, et autres
Publié: (2025)
par: Nezhurina, Marianna, et autres
Publié: (2025)
Rethinking Performance Measures of RNA Secondary Structure Problems
par: Runge, Frederic, et autres
Publié: (2023)
par: Runge, Frederic, et autres
Publié: (2023)
Increasing LLM Coding Capabilities through Diverse Synthetic Coding Tasks
par: Abed, Amal, et autres
Publié: (2025)
par: Abed, Amal, et autres
Publié: (2025)
Resolving Discrepancies in Compute-Optimal Scaling of Language Models
par: Porian, Tomer, et autres
Publié: (2024)
par: Porian, Tomer, et autres
Publié: (2024)
Towards Scaling Laws for Symbolic Regression
par: Otte, David, et autres
Publié: (2025)
par: Otte, David, et autres
Publié: (2025)
Transfer Learning for Finetuning Large Language Models
par: Strangmann, Tobias, et autres
Publié: (2024)
par: Strangmann, Tobias, et autres
Publié: (2024)
Inverse Deep Learning Ray Tracing for Heliostat Surface Prediction
par: Lewen, Jan, et autres
Publié: (2024)
par: Lewen, Jan, et autres
Publié: (2024)
Tiny Deep Ensemble: Uncertainty Estimation in Edge AI Accelerators via Ensembling Normalization Layers with Shared Weights
par: Ahmed, Soyed Tuhin, et autres
Publié: (2024)
par: Ahmed, Soyed Tuhin, et autres
Publié: (2024)
Fast Optimizer Benchmark
par: Blauth, Simon, et autres
Publié: (2024)
par: Blauth, Simon, et autres
Publié: (2024)
Embedding Hardware Approximations in Discrete Genetic-based Training for Printed MLPs
par: Afentaki, Florentia, et autres
Publié: (2024)
par: Afentaki, Florentia, et autres
Publié: (2024)
Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues
par: Grazzi, Riccardo, et autres
Publié: (2024)
par: Grazzi, Riccardo, et autres
Publié: (2024)
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
par: Nguyen, Huu, et autres
Publié: (2025)
par: Nguyen, Huu, et autres
Publié: (2025)
Scalable heliostat surface predictions from focal spots: Sim-to-Real transfer of inverse Deep Learning Raytracing
par: Lewen, Jan, et autres
Publié: (2025)
par: Lewen, Jan, et autres
Publié: (2025)
Practitioner Motives to Use Different Hyperparameter Optimization Methods
par: Kannengießer, Niclas, et autres
Publié: (2022)
par: Kannengießer, Niclas, et autres
Publié: (2022)
Early Stopping Tabular In-Context Learning
par: Küken, Jaris, et autres
Publié: (2025)
par: Küken, Jaris, et autres
Publié: (2025)
Bayes' Power for Explaining In-Context Learning Generalizations
par: Müller, Samuel, et autres
Publié: (2024)
par: Müller, Samuel, et autres
Publié: (2024)
Reproducible scaling laws for contrastive language-image learning
par: Cherti, Mehdi, et autres
Publié: (2022)
par: Cherti, Mehdi, et autres
Publié: (2022)
Concept-Aware Batch Sampling Improves Language-Image Pretraining
par: Ghosh, Adhiraj, et autres
Publié: (2025)
par: Ghosh, Adhiraj, et autres
Publié: (2025)
HW-GPT-Bench: Hardware-Aware Architecture Benchmark for Language Models
par: Sukthanker, Rhea Sanjay, et autres
Publié: (2024)
par: Sukthanker, Rhea Sanjay, et autres
Publié: (2024)
Function Spaces Without Kernels: Learning Compact Hilbert Space Representations
par: Low, Su Ann, et autres
Publié: (2025)
par: Low, Su Ann, et autres
Publié: (2025)
Transformers Can Do Bayesian Inference
par: Müller, Samuel, et autres
Publié: (2021)
par: Müller, Samuel, et autres
Publié: (2021)
TransAxx: Efficient Transformers with Approximate Computing
par: Danopoulos, Dimitrios, et autres
Publié: (2024)
par: Danopoulos, Dimitrios, et autres
Publié: (2024)
In-Context Learning of Linear Dynamical Systems with Transformers: Approximation Bounds and Depth-Separation
par: Cole, Frank, et autres
Publié: (2025)
par: Cole, Frank, et autres
Publié: (2025)
Language models scale reliably with over-training and on downstream tasks
par: Gadre, Samir Yitzhak, et autres
Publié: (2024)
par: Gadre, Samir Yitzhak, et autres
Publié: (2024)
Parallel Layer Normalization for Universal Approximation
par: Ni, Yunhao, et autres
Publié: (2025)
par: Ni, Yunhao, et autres
Publié: (2025)
EquiTabPFN: A Target-Permutation Equivariant Prior Fitted Networks
par: Arbel, Michael, et autres
Publié: (2025)
par: Arbel, Michael, et autres
Publié: (2025)
Self-Correcting Bayesian Optimization through Bayesian Active Learning
par: Hvarfner, Carl, et autres
Publié: (2023)
par: Hvarfner, Carl, et autres
Publié: (2023)
Testing Spintronics Implemented Monte Carlo Dropout-Based Bayesian Neural Networks
par: Ahmed, Soyed Tuhin, et autres
Publié: (2024)
par: Ahmed, Soyed Tuhin, et autres
Publié: (2024)
Next-Latent Prediction Transformers Learn Compact World Models
par: Teoh, Jayden, et autres
Publié: (2025)
par: Teoh, Jayden, et autres
Publié: (2025)
c-TPE: Tree-structured Parzen Estimator with Inequality Constraints for Expensive Hyperparameter Optimization
par: Watanabe, Shuhei, et autres
Publié: (2022)
par: Watanabe, Shuhei, et autres
Publié: (2022)
FairPFN: Transformers Can do Counterfactual Fairness
par: Robertson, Jake, et autres
Publié: (2024)
par: Robertson, Jake, et autres
Publié: (2024)
Learning Rate Transfer in Normalized Transformers
par: Shigida, Boris, et autres
Publié: (2026)
par: Shigida, Boris, et autres
Publié: (2026)
Is Mamba Capable of In-Context Learning?
par: Grazzi, Riccardo, et autres
Publié: (2024)
par: Grazzi, Riccardo, et autres
Publié: (2024)
A General Framework for User-Guided Bayesian Optimization
par: Hvarfner, Carl, et autres
Publié: (2023)
par: Hvarfner, Carl, et autres
Publié: (2023)
Causal Data Augmentation for Robust Fine-Tuning of Tabular Foundation Models
par: Bühler, Magnus, et autres
Publié: (2026)
par: Bühler, Magnus, et autres
Publié: (2026)
Documents similaires
-
Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities
par: Spiegelhalter, Urs, et autres
Publié: (2025) -
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
par: Nezhurina, Marianna, et autres
Publié: (2024) -
Improving Deep Learning Optimization through Constrained Parameter Regularization
par: Franke, Jörg K. H., et autres
Publié: (2023) -
Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison
par: Nezhurina, Marianna, et autres
Publié: (2025) -
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
par: Cipolina-Kun, Lucia, et autres
Publié: (2025)