Concise One-Layer Transformers Can Do Function Evaluation (Sometimes)
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Strobl, Lena, Angluin, Dana, Frank, Robert |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Formal Languages Can Transformers Express? A Survey
par: Strobl, Lena, et autres
Publié: (2023)
par: Strobl, Lena, et autres
Publié: (2023)
Transformers as Transducers
par: Strobl, Lena, et autres
Publié: (2024)
par: Strobl, Lena, et autres
Publié: (2024)
Simulating Hard Attention Using Soft Attention
par: Yang, Andy, et autres
Publié: (2024)
par: Yang, Andy, et autres
Publié: (2024)
Constructing Concise Characteristic Samples for Acceptors of Omega Regular Languages
par: Angluin, Dana, et autres
Publié: (2022)
par: Angluin, Dana, et autres
Publié: (2022)
Masked Hard-Attention Transformers Recognize Exactly the Star-Free Languages
par: Yang, Andy, et autres
Publié: (2023)
par: Yang, Andy, et autres
Publié: (2023)
Transformers Can Do Bayesian Inference
par: Müller, Samuel, et autres
Publié: (2021)
par: Müller, Samuel, et autres
Publié: (2021)
Can GNNs Learn Link Heuristics? A Concise Review and Evaluation of Link Prediction Methods
par: Liang, Shuming, et autres
Publié: (2024)
par: Liang, Shuming, et autres
Publié: (2024)
Reasoning Models Sometimes Output Illegible Chains of Thought
par: Jose, Arun
Publié: (2025)
par: Jose, Arun
Publié: (2025)
Can Transformers Do Enumerative Geometry?
par: Hashemi, Baran, et autres
Publié: (2024)
par: Hashemi, Baran, et autres
Publié: (2024)
Why Less is More (Sometimes): A Theory of Data Curation
par: Dohmatob, Elvis, et autres
Publié: (2025)
par: Dohmatob, Elvis, et autres
Publié: (2025)
Transformers Can Do Arithmetic with the Right Embeddings
par: McLeish, Sean, et autres
Publié: (2024)
par: McLeish, Sean, et autres
Publié: (2024)
A Single-Layer Model Can Do Language Modeling
par: Wang, Zanmin
Publié: (2026)
par: Wang, Zanmin
Publié: (2026)
(Sometimes) Less is More: Mitigating the Complexity of Rule-based Representation for Interpretable Classification
par: Bergamin, Luca, et autres
Publié: (2025)
par: Bergamin, Luca, et autres
Publié: (2025)
Provable Knowledge Acquisition and Extraction in One-Layer Transformers
par: Xu, Ruichen, et autres
Publié: (2025)
par: Xu, Ruichen, et autres
Publié: (2025)
What One Cannot, Two Can: Two-Layer Transformers Provably Represent Induction Heads on Any-Order Markov Chains
par: Ekbote, Chanakya, et autres
Publié: (2025)
par: Ekbote, Chanakya, et autres
Publié: (2025)
Learning Causally Predictable Outcomes from Psychiatric Longitudinal Data
par: Strobl, Eric V.
Publié: (2025)
par: Strobl, Eric V.
Publié: (2025)
Global Interpretability via Automated Preprocessing: A Framework Inspired by Psychiatric Questionnaires
par: Strobl, Eric V.
Publié: (2026)
par: Strobl, Eric V.
Publié: (2026)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
par: Li, Zihao, et autres
Publié: (2024)
par: Li, Zihao, et autres
Publié: (2024)
Probabilistic Graphical Models: A Concise Tutorial
par: Maasch, Jacqueline, et autres
Publié: (2025)
par: Maasch, Jacqueline, et autres
Publié: (2025)
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
par: Kim, Jeonghye, et autres
Publié: (2026)
par: Kim, Jeonghye, et autres
Publié: (2026)
Sometimes I am a Tree: Data Drives Unstable Hierarchical Generalization
par: Qin, Tian, et autres
Publié: (2024)
par: Qin, Tian, et autres
Publié: (2024)
Alternative Loss Function in Evaluation of Transformer Models
par: Michańków, Jakub, et autres
Publié: (2025)
par: Michańków, Jakub, et autres
Publié: (2025)
LayerMatch: Do Pseudo-labels Benefit All Layers?
par: Liang, Chaoqi, et autres
Publié: (2024)
par: Liang, Chaoqi, et autres
Publié: (2024)
Diversity of Transformer Layers: One Aspect of Parameter Scaling Laws
par: Kamigaito, Hidetaka, et autres
Publié: (2025)
par: Kamigaito, Hidetaka, et autres
Publié: (2025)
A Concise Review of Hallucinations in LLMs and their Mitigation
par: Pulkundwar, Parth, et autres
Publié: (2025)
par: Pulkundwar, Parth, et autres
Publié: (2025)
Multi-Layer Transformers Gradient Can be Approximated in Almost Linear Time
par: Liang, Yingyu, et autres
Publié: (2024)
par: Liang, Yingyu, et autres
Publié: (2024)
Probabilistic Robustness in Deep Learning: A Concise yet Comprehensive Guide
par: Zhao, Xingyu
Publié: (2025)
par: Zhao, Xingyu
Publié: (2025)
mlr3summary: Concise and interpretable summaries for machine learning models
par: Dandl, Susanne, et autres
Publié: (2024)
par: Dandl, Susanne, et autres
Publié: (2024)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
par: Öncel, Fırat, et autres
Publié: (2024)
par: Öncel, Fırat, et autres
Publié: (2024)
Model Checking for Reinforcement Learning in Autonomous Driving: One Can Do More Than You Think!
par: Gu, Rong
Publié: (2024)
par: Gu, Rong
Publié: (2024)
HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization
par: Huang, Feihu, et autres
Publié: (2026)
par: Huang, Feihu, et autres
Publié: (2026)
SIMformer: Single-Layer Vanilla Transformer Can Learn Free-Space Trajectory Similarity
par: Yang, Chuang, et autres
Publié: (2024)
par: Yang, Chuang, et autres
Publié: (2024)
Tabular Foundation Models Can Do Survival Analysis
par: Kim, Da In, et autres
Publié: (2026)
par: Kim, Da In, et autres
Publié: (2026)
FairPFN: Transformers Can do Counterfactual Fairness
par: Robertson, Jake, et autres
Publié: (2024)
par: Robertson, Jake, et autres
Publié: (2024)
Just One Layer Norm Guarantees Stable Extrapolation
par: Ziomek, Juliusz, et autres
Publié: (2025)
par: Ziomek, Juliusz, et autres
Publié: (2025)
Metacognitive Reuse: Turning Recurring LLM Reasoning Into Concise Behaviors
par: Didolkar, Aniket, et autres
Publié: (2025)
par: Didolkar, Aniket, et autres
Publié: (2025)
A Concise Mathematical Description of Active Inference in Discrete Time
par: van Oostrum, Jesse, et autres
Publié: (2024)
par: van Oostrum, Jesse, et autres
Publié: (2024)
MAUNet-Light: A Concise MAUNet Architecture for Bias Correction and Downscaling of Precipitation Estimates
par: Sharma, Sumanta Chandra Mishra, et autres
Publié: (2026)
par: Sharma, Sumanta Chandra Mishra, et autres
Publié: (2026)
Can Transformers Smell Like Humans?
par: Taleb, Farzaneh, et autres
Publié: (2024)
par: Taleb, Farzaneh, et autres
Publié: (2024)
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
Documents similaires
-
What Formal Languages Can Transformers Express? A Survey
par: Strobl, Lena, et autres
Publié: (2023) -
Transformers as Transducers
par: Strobl, Lena, et autres
Publié: (2024) -
Simulating Hard Attention Using Soft Attention
par: Yang, Andy, et autres
Publié: (2024) -
Constructing Concise Characteristic Samples for Acceptors of Omega Regular Languages
par: Angluin, Dana, et autres
Publié: (2022) -
Masked Hard-Attention Transformers Recognize Exactly the Star-Free Languages
par: Yang, Andy, et autres
Publié: (2023)