Trapped by simplicity: When Transformers fail to learn from noisy features
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peters, Evan, Deng, Ando, Zambianco, Matheus H., Blankespoor, Devin, Kempf, Achim |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Feature contamination: Neural networks learn uncorrelated features and fail to generalize
par: Zhang, Tianren, et autres
Publié: (2024)
par: Zhang, Tianren, et autres
Publié: (2024)
Negation Neglect: When models fail to learn negations in training
par: Mayne, Harry, et autres
Publié: (2026)
par: Mayne, Harry, et autres
Publié: (2026)
When does Gaussian equivalence fail and how to fix it: Non-universal behavior of random features with quadratic scaling
par: Wen, Garrett G., et autres
Publié: (2025)
par: Wen, Garrett G., et autres
Publié: (2025)
Online learning with noisy side observations
par: Kocák, Tomáš, et autres
Publié: (2026)
par: Kocák, Tomáš, et autres
Publié: (2026)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
par: Schrodi, Simon, et autres
Publié: (2025)
par: Schrodi, Simon, et autres
Publié: (2025)
Deep learning with noisy labels in medical prediction problems: a scoping review
par: Wei, Yishu, et autres
Publié: (2024)
par: Wei, Yishu, et autres
Publié: (2024)
When and How Does CLIP Enable Domain and Compositional Generalization?
par: Kempf, Elias, et autres
Publié: (2025)
par: Kempf, Elias, et autres
Publié: (2025)
Spectral methods: crucial for machine learning, natural for quantum computers?
par: Belis, Vasilis, et autres
Publié: (2026)
par: Belis, Vasilis, et autres
Publié: (2026)
Machine learning of network inference enhancement from noisy measurements
par: Wu, Kai, et autres
Publié: (2023)
par: Wu, Kai, et autres
Publié: (2023)
Hybrid least squares for learning functions from highly noisy data
par: Adcock, Ben, et autres
Publié: (2025)
par: Adcock, Ben, et autres
Publié: (2025)
Distributional simplicity bias and effective convexity in Energy Based Models
par: Decelle, Aurélien, et autres
Publié: (2026)
par: Decelle, Aurélien, et autres
Publié: (2026)
Spike-timing-dependent Hebbian learning as noisy gradient descent
par: Dexheimer, Niklas, et autres
Publié: (2025)
par: Dexheimer, Niklas, et autres
Publié: (2025)
Brezzi--Douglas--Marini interpolation on anisotropic simplices and prisms
par: Kempf, Volker
Publié: (2022)
par: Kempf, Volker
Publié: (2022)
Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers
par: Barron, Joshua, et autres
Publié: (2025)
par: Barron, Joshua, et autres
Publié: (2025)
Reconstructing Richtmyer-Meshkov instabilities from noisy radiographs using low dimensional features and attention-based neural networks
par: Serino, Daniel A., et autres
Publié: (2024)
par: Serino, Daniel A., et autres
Publié: (2024)
The Twin Paradox in Quantum Field Theory
par: Zambianco, Matheus H., et autres
Publié: (2025)
par: Zambianco, Matheus H., et autres
Publié: (2025)
The Reversal Curse: LLMs trained on "A is B" fail to learn "B is A"
par: Berglund, Lukas, et autres
Publié: (2023)
par: Berglund, Lukas, et autres
Publié: (2023)
Benchmarking noisy label detection methods
par: Pickler, Henrique, et autres
Publié: (2025)
par: Pickler, Henrique, et autres
Publié: (2025)
How does feature learning reshape the function space?
par: Lobo, João, et autres
Publié: (2026)
par: Lobo, João, et autres
Publié: (2026)
A simple mean field model of feature learning
par: Göring, Niclas, et autres
Publié: (2025)
par: Göring, Niclas, et autres
Publié: (2025)
The When and How of Target Variable Transformations
par: Nuyts, Loren, et autres
Publié: (2025)
par: Nuyts, Loren, et autres
Publié: (2025)
Why does in-context learning fail sometimes? Evaluating in-context learning on open and closed questions
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
One-layer transformers fail to solve the induction heads task
par: Sanford, Clayton, et autres
Publié: (2024)
par: Sanford, Clayton, et autres
Publié: (2024)
Robust Infidelity: When Faithfulness Measures on Masked Language Models Are Misleading
par: Crothers, Evan, et autres
Publié: (2023)
par: Crothers, Evan, et autres
Publié: (2023)
A survey of Monte Carlo methods for noisy and costly densities with application to reinforcement learning and ABC
par: Llorente, F., et autres
Publié: (2021)
par: Llorente, F., et autres
Publié: (2021)
Unfolding AIS transmission behavior for vessel movement modeling on noisy data leveraging machine learning
par: Spadon, Gabriel, et autres
Publié: (2022)
par: Spadon, Gabriel, et autres
Publié: (2022)
When resampling/reweighting improves feature learning in imbalanced classification?: A toy-model study
par: Obuchi, Tomoyuki, et autres
Publié: (2024)
par: Obuchi, Tomoyuki, et autres
Publié: (2024)
When LRP Diverges from Leave-One-Out in Transformers
par: You, Weiqiu, et autres
Publié: (2025)
par: You, Weiqiu, et autres
Publié: (2025)
Physics-constrained robust learning of open-form partial differential equations from limited and noisy data
par: Du, Mengge, et autres
Publié: (2023)
par: Du, Mengge, et autres
Publié: (2023)
When to retrain a machine learning model
par: Florence, Regol, et autres
Publié: (2025)
par: Florence, Regol, et autres
Publié: (2025)
Heterogeneous transfer learning for high-dimensional regression with feature mismatch
par: Chang, Jae Ho, et autres
Publié: (2024)
par: Chang, Jae Ho, et autres
Publié: (2024)
On Quasi-Localized Dual Pairs in Reproducing Kernel Hilbert Spaces
par: Harbrecht, Helmut, et autres
Publié: (2024)
par: Harbrecht, Helmut, et autres
Publié: (2024)
Bayesian uncertainty-aware deep learning with noisy labels: Tackling annotation ambiguity in EEG seizure detection
par: Shama, Deeksha M., et autres
Publié: (2024)
par: Shama, Deeksha M., et autres
Publié: (2024)
Black-box optimization of noisy functions with unknown smoothness
par: Grill, Jean-Bastien, et autres
Publié: (2026)
par: Grill, Jean-Bastien, et autres
Publié: (2026)
Improving clustering quality evaluation in noisy Gaussian mixtures
par: de Amorim, Renato Cordeiro, et autres
Publié: (2025)
par: de Amorim, Renato Cordeiro, et autres
Publié: (2025)
Comparing noisy neural population dynamics using optimal transport distances
par: Nejatbakhsh, Amin, et autres
Publié: (2024)
par: Nejatbakhsh, Amin, et autres
Publié: (2024)
From drift to adaptation to the failed ml model: Transfer Learning in Industrial MLOps
par: Ashraf, Waqar Muhammad, et autres
Publié: (2026)
par: Ashraf, Waqar Muhammad, et autres
Publié: (2026)
When GNNs meet symmetry in ILPs: an orbit-based feature augmentation approach
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
Gradient Guided Hypotheses: A unified solution to enable machine learning models on scarce and noisy data regimes
par: Neves, Paulo, et autres
Publié: (2024)
par: Neves, Paulo, et autres
Publié: (2024)
Exploring the cloud of feature interaction scores in a Rashomon set
par: Li, Sichao, et autres
Publié: (2023)
par: Li, Sichao, et autres
Publié: (2023)
Documents similaires
-
Feature contamination: Neural networks learn uncorrelated features and fail to generalize
par: Zhang, Tianren, et autres
Publié: (2024) -
Negation Neglect: When models fail to learn negations in training
par: Mayne, Harry, et autres
Publié: (2026) -
When does Gaussian equivalence fail and how to fix it: Non-universal behavior of random features with quadratic scaling
par: Wen, Garrett G., et autres
Publié: (2025) -
Online learning with noisy side observations
par: Kocák, Tomáš, et autres
Publié: (2026) -
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
par: Schrodi, Simon, et autres
Publié: (2025)