Tracking Equivalent Mechanistic Interpretations Across Neural Networks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Alan, Toneva, Mariya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Perturbed examples reveal invariances shared by language models
par: Rawal, Ruchit, et autres
Publié: (2023)
par: Rawal, Ruchit, et autres
Publié: (2023)
Speech language models lack important brain-relevant semantics
par: Oota, Subba Reddy, et autres
Publié: (2023)
par: Oota, Subba Reddy, et autres
Publié: (2023)
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
par: Merlin, Gabriele, et autres
Publié: (2026)
par: Merlin, Gabriele, et autres
Publié: (2026)
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
par: Moussa, Omer, et autres
Publié: (2025)
par: Moussa, Omer, et autres
Publié: (2025)
Mechanistic Interpretability of Binary and Ternary Transformers
par: Li, Jason
Publié: (2024)
par: Li, Jason
Publié: (2024)
Triangulation as an Acceptance Rule for Multilingual Mechanistic Interpretability
par: Long, Yanan
Publié: (2025)
par: Long, Yanan
Publié: (2025)
Language models and brains align due to more than next-word prediction and word-level information
par: Merlin, Gabriele, et autres
Publié: (2022)
par: Merlin, Gabriele, et autres
Publié: (2022)
HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
Tracking the Feature Dynamics in LLM Training: A Mechanistic Study
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
MIB: A Mechanistic Interpretability Benchmark
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research
par: Bai, Xiaoyan, et autres
Publié: (2026)
par: Bai, Xiaoyan, et autres
Publié: (2026)
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
par: Moussa, Omer, et autres
Publié: (2025)
par: Moussa, Omer, et autres
Publié: (2025)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
par: Proietti, Michela, et autres
Publié: (2025)
par: Proietti, Michela, et autres
Publié: (2025)
Mechanistic Interpretability of GPT-like Models on Summarization Tasks
par: Mishra, Anurag
Publié: (2025)
par: Mishra, Anurag
Publié: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
par: Cho, Hakaze, et autres
Publié: (2025)
par: Cho, Hakaze, et autres
Publié: (2025)
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
par: Méloux, Maxime, et autres
Publié: (2025)
par: Méloux, Maxime, et autres
Publié: (2025)
Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
par: Méloux, Maxime, et autres
Publié: (2025)
par: Méloux, Maxime, et autres
Publié: (2025)
Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State Tracking
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability
par: Im, Shawn, et autres
Publié: (2026)
par: Im, Shawn, et autres
Publié: (2026)
Assessing Episodic Memory in LLMs with Sequence Order Recall Tasks
par: Pink, Mathis, et autres
Publié: (2024)
par: Pink, Mathis, et autres
Publié: (2024)
Missed Causes and Ambiguous Effects: Counterfactuals Pose Challenges for Interpreting Neural Networks
par: Mueller, Aaron
Publié: (2024)
par: Mueller, Aaron
Publié: (2024)
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
par: Song, Xiangchen, et autres
Publié: (2025)
par: Song, Xiangchen, et autres
Publié: (2025)
Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability
par: García-Carrasco, Jorge, et autres
Publié: (2024)
par: García-Carrasco, Jorge, et autres
Publié: (2024)
Beyond Transcription: Mechanistic Interpretability in ASR
par: Glazer, Neta, et autres
Publié: (2025)
par: Glazer, Neta, et autres
Publié: (2025)
Improving Semantic Understanding in Speech Language Models via Brain-tuning
par: Moussa, Omer, et autres
Publié: (2024)
par: Moussa, Omer, et autres
Publié: (2024)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
par: Chen, Jianhui, et autres
Publié: (2026)
par: Chen, Jianhui, et autres
Publié: (2026)
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
par: Kim, Geonhee, et autres
Publié: (2024)
par: Kim, Geonhee, et autres
Publié: (2024)
Transferring Linear Features Across Language Models With Model Stitching
par: Chen, Alan, et autres
Publié: (2025)
par: Chen, Alan, et autres
Publié: (2025)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability
par: Lee, Yu-Ting, et autres
Publié: (2025)
par: Lee, Yu-Ting, et autres
Publié: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024)
par: Guo, Phillip, et autres
Publié: (2024)
Beyond Accuracy: Introducing a Symbolic-Mechanistic Approach to Interpretable Evaluation
par: Habibi, Reza, et autres
Publié: (2026)
par: Habibi, Reza, et autres
Publié: (2026)
How do Large Language Models Understand Relevance? A Mechanistic Interpretability Perspective
par: Liu, Qi, et autres
Publié: (2025)
par: Liu, Qi, et autres
Publié: (2025)
A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i
par: Ayonrinde, Kola, et autres
Publié: (2025)
par: Ayonrinde, Kola, et autres
Publié: (2025)
Adaptive Circuit Behavior and Generalization in Mechanistic Interpretability
par: Nainani, Jatin, et autres
Publié: (2024)
par: Nainani, Jatin, et autres
Publié: (2024)
Positional Biases Shift as Inputs Approach Context Window Limits
par: Veseli, Blerta, et autres
Publié: (2025)
par: Veseli, Blerta, et autres
Publié: (2025)
Atlas-Alignment: Making Interpretability Transferable Across Language Models
par: Puri, Bruno, et autres
Publié: (2025)
par: Puri, Bruno, et autres
Publié: (2025)
On Mechanistic Circuits for Extractive Question-Answering
par: Basu, Samyadeep, et autres
Publié: (2025)
par: Basu, Samyadeep, et autres
Publié: (2025)
Mechanistic?
par: Saphra, Naomi, et autres
Publié: (2024)
par: Saphra, Naomi, et autres
Publié: (2024)
Large Language Models as Model Organisms for Human Associative Learning
par: Kolling, Camila, et autres
Publié: (2025)
par: Kolling, Camila, et autres
Publié: (2025)
Documents similaires
-
Perturbed examples reveal invariances shared by language models
par: Rawal, Ruchit, et autres
Publié: (2023) -
Speech language models lack important brain-relevant semantics
par: Oota, Subba Reddy, et autres
Publié: (2023) -
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
par: Merlin, Gabriele, et autres
Publié: (2026) -
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
par: Moussa, Omer, et autres
Publié: (2025) -
Mechanistic Interpretability of Binary and Ternary Transformers
par: Li, Jason
Publié: (2024)