A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Brinkmann, Jannik, Sheshadri, Abhay, Levoso, Victor, Swoboda, Paul, Bartelt, Christian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training
par: Shah, Avidan, et autres
Publié: (2026)
par: Shah, Avidan, et autres
Publié: (2026)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024)
par: Guo, Phillip, et autres
Publié: (2024)
DOGE-Train: Discrete Optimization on GPU with End-to-end Training
par: Abbas, Ahmed, et autres
Publié: (2022)
par: Abbas, Ahmed, et autres
Publié: (2022)
Normalized Matching Transformer
par: Pourhadi, Abtin, et autres
Publié: (2025)
par: Pourhadi, Abtin, et autres
Publié: (2025)
NSA: Neuro-symbolic ARC Challenge
par: Batorski, Paweł, et autres
Publié: (2025)
par: Batorski, Paweł, et autres
Publié: (2025)
Jailbreak Transferability Emerges from Shared Representations
par: Angell, Rico, et autres
Publié: (2025)
par: Angell, Rico, et autres
Publié: (2025)
Transcoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic Training
par: Dratschuk, Daniel, et autres
Publié: (2026)
par: Dratschuk, Daniel, et autres
Publié: (2026)
Do Latent-CoT Models Think Step-by-Step? A Mechanistic Study on Sequential Reasoning Tasks
par: Liang, Jia, et autres
Publié: (2026)
par: Liang, Jia, et autres
Publié: (2026)
Shedding Light in Task Decomposition in Program Synthesis: The Driving Force of the Synthesizer Model
par: Zenkner, Janis, et autres
Publié: (2025)
par: Zenkner, Janis, et autres
Publié: (2025)
Beyond Either-Or Reasoning: Transduction and Induction as Cooperative Problem-Solving Paradigms
par: Zenkner, Janis, et autres
Publié: (2025)
par: Zenkner, Janis, et autres
Publié: (2025)
PLR: Plackett-Luce for Reordering In-Context Learning Examples
par: Batorski, Pawel, et autres
Publié: (2026)
par: Batorski, Pawel, et autres
Publié: (2026)
Why Do Some Language Models Fake Alignment While Others Don't?
par: Sheshadri, Abhay, et autres
Publié: (2025)
par: Sheshadri, Abhay, et autres
Publié: (2025)
The Quest for the Right Mediator: Surveying Mechanistic Interpretability Through the Lens of Causal Mediation Analysis
par: Mueller, Aaron, et autres
Publié: (2024)
par: Mueller, Aaron, et autres
Publié: (2024)
EvoMU: Evolutionary Machine Unlearning
par: Batorski, Pawel, et autres
Publié: (2026)
par: Batorski, Pawel, et autres
Publié: (2026)
Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse Languages
par: Brinkmann, Jannik, et autres
Publié: (2025)
par: Brinkmann, Jannik, et autres
Publié: (2025)
Contextual Counting: A Mechanistic Study of Transformers on a Quantitative Task
par: Golkar, Siavash, et autres
Publié: (2024)
par: Golkar, Siavash, et autres
Publié: (2024)
Explaining Neural Networks without Access to Training Data
par: Marton, Sascha, et autres
Publié: (2022)
par: Marton, Sascha, et autres
Publié: (2022)
In-Context Algebra
par: Todd, Eric, et autres
Publié: (2025)
par: Todd, Eric, et autres
Publié: (2025)
$μ$nit Scaling: Simple and Scalable FP8 LLM Training
par: Narayan, Saaketh, et autres
Publié: (2025)
par: Narayan, Saaketh, et autres
Publié: (2025)
GRANDE: Gradient-Based Decision Tree Ensembles for Tabular Data
par: Marton, Sascha, et autres
Publié: (2023)
par: Marton, Sascha, et autres
Publié: (2023)
Distributed Sign Momentum with Local Steps for Training Transformers
par: Yu, Shuhua, et autres
Publié: (2024)
par: Yu, Shuhua, et autres
Publié: (2024)
A Mechanistic Analysis of Looped Reasoning Language Models
par: Blayney, Hugh, et autres
Publié: (2026)
par: Blayney, Hugh, et autres
Publié: (2026)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
par: Zhou, Yifei, et autres
Publié: (2025)
par: Zhou, Yifei, et autres
Publié: (2025)
Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
par: Dhayalkar, Sahil Rajesh
Publié: (2025)
par: Dhayalkar, Sahil Rajesh
Publié: (2025)
A Symbolic Framework for Evaluating Mathematical Reasoning and Generalisation with Transformers
par: Meadows, Jordan, et autres
Publié: (2023)
par: Meadows, Jordan, et autres
Publié: (2023)
Enabling Mixed Effects Neural Networks for Diverse, Clustered Data Using Monte Carlo Methods
par: Tschalzev, Andrej, et autres
Publié: (2024)
par: Tschalzev, Andrej, et autres
Publié: (2024)
Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models
par: Ren, Zirui, et autres
Publié: (2026)
par: Ren, Zirui, et autres
Publié: (2026)
Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanism
par: Wang, Zhiwei, et autres
Publié: (2024)
par: Wang, Zhiwei, et autres
Publié: (2024)
A Mechanistic Analysis of Transformers for Dynamical Systems
par: Duthé, Gregory, et autres
Publié: (2025)
par: Duthé, Gregory, et autres
Publié: (2025)
Semantic Step Prediction: Multi-Step Latent Forecasting in LLM Reasoning Trajectories via Step Sampling
par: Yuan, Yidi
Publié: (2026)
par: Yuan, Yidi
Publié: (2026)
REBEL: Hidden Knowledge Recovery via Evolutionary-Based Evaluation Loop
par: Rybak, Patryk, et autres
Publié: (2026)
par: Rybak, Patryk, et autres
Publié: (2026)
Interpreting Outliers in Time Series Data through Decoding Autoencoder
par: Knab, Patrick, et autres
Publié: (2024)
par: Knab, Patrick, et autres
Publié: (2024)
Which LIME should I trust? Concepts, Challenges, and Solutions
par: Knab, Patrick, et autres
Publié: (2025)
par: Knab, Patrick, et autres
Publié: (2025)
GradTree: Learning Axis-Aligned Decision Trees with Gradient Descent
par: Marton, Sascha, et autres
Publié: (2023)
par: Marton, Sascha, et autres
Publié: (2023)
MAUSAM: An Observations-focused assessment of Global AI Weather Prediction Models During the South Asian Monsoon
par: Gupta, Aman, et autres
Publié: (2025)
par: Gupta, Aman, et autres
Publié: (2025)
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
par: Kapoor, Vansh, et autres
Publié: (2026)
par: Kapoor, Vansh, et autres
Publié: (2026)
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
par: Sheshadri, Abhay, et autres
Publié: (2024)
par: Sheshadri, Abhay, et autres
Publié: (2024)
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
par: Burghouts, Gertjan, et autres
Publié: (2024)
par: Burghouts, Gertjan, et autres
Publié: (2024)
Obfuscated Activations Bypass LLM Latent-Space Defenses
par: Bailey, Luke, et autres
Publié: (2024)
par: Bailey, Luke, et autres
Publié: (2024)
Transformers Can Navigate Mazes With Multi-Step Prediction
par: Nolte, Niklas, et autres
Publié: (2024)
par: Nolte, Niklas, et autres
Publié: (2024)
Documents similaires
-
Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training
par: Shah, Avidan, et autres
Publié: (2026) -
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024) -
DOGE-Train: Discrete Optimization on GPU with End-to-end Training
par: Abbas, Ahmed, et autres
Publié: (2022) -
Normalized Matching Transformer
par: Pourhadi, Abtin, et autres
Publié: (2025) -
NSA: Neuro-symbolic ARC Challenge
par: Batorski, Paweł, et autres
Publié: (2025)