Does Transformer Interpretability Transfer to RNNs?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Paulo, Gonçalo, Marshall, Thomas, Belrose, Nora |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Partially Rewriting a Transformer in Natural Language
par: Paulo, Gonçalo, et autres
Publié: (2025)
par: Paulo, Gonçalo, et autres
Publié: (2025)
Automatically Interpreting Millions of Features in Large Language Models
par: Paulo, Gonçalo, et autres
Publié: (2024)
par: Paulo, Gonçalo, et autres
Publié: (2024)
Eliciting Latent Knowledge from Quirky Language Models
par: Mallen, Alex, et autres
Publié: (2023)
par: Mallen, Alex, et autres
Publié: (2023)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
par: Yehudai, Gilad, et autres
Publié: (2025)
par: Yehudai, Gilad, et autres
Publié: (2025)
Refusal in LLMs is an Affine Function
par: Marshall, Thomas, et autres
Publié: (2024)
par: Marshall, Thomas, et autres
Publié: (2024)
Transcoders Beat Sparse Autoencoders for Interpretability
par: Paulo, Gonçalo, et autres
Publié: (2025)
par: Paulo, Gonçalo, et autres
Publié: (2025)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
par: Sun, Yu, et autres
Publié: (2024)
par: Sun, Yu, et autres
Publié: (2024)
Evaluating SAE interpretability without explanations
par: Paulo, Gonçalo, et autres
Publié: (2025)
par: Paulo, Gonçalo, et autres
Publié: (2025)
Sparse Autoencoders Trained on the Same Data Learn Different Features
par: Paulo, Gonçalo, et autres
Publié: (2025)
par: Paulo, Gonçalo, et autres
Publié: (2025)
Examining Two Hop Reasoning Through Information Content Scaling
par: Johnston, David, et autres
Publié: (2025)
par: Johnston, David, et autres
Publié: (2025)
Enhancing Transformer RNNs with Multiple Temporal Perspectives
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
Atlas-Alignment: Making Interpretability Transferable Across Language Models
par: Puri, Bruno, et autres
Publié: (2025)
par: Puri, Bruno, et autres
Publié: (2025)
Discovering Interpretable Algorithms by Decompiling Transformers to RASP
par: Huang, Xinting, et autres
Publié: (2026)
par: Huang, Xinting, et autres
Publié: (2026)
Beyond Components: Singular Vector-Based Interpretability of Transformer Circuits
par: Ahmad, Areeb, et autres
Publié: (2025)
par: Ahmad, Areeb, et autres
Publié: (2025)
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
par: Kerce, J. Clayton, et autres
Publié: (2026)
par: Kerce, J. Clayton, et autres
Publié: (2026)
Multi-Target Cross-Lingual Summarization: a novel task and a language-neutral approach
par: Pernes, Diogo, et autres
Publié: (2024)
par: Pernes, Diogo, et autres
Publié: (2024)
Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models
par: Lv, Ang, et autres
Publié: (2024)
par: Lv, Ang, et autres
Publié: (2024)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
par: Neo, Clement, et autres
Publié: (2024)
par: Neo, Clement, et autres
Publié: (2024)
Cross-Architecture Transfer Learning for Linear-Cost Inference Transformers
par: Choi, Sehyun
Publié: (2024)
par: Choi, Sehyun
Publié: (2024)
Contrast-CAT: Contrasting Activations for Enhanced Interpretability in Transformer-based Text Classifiers
par: Han, Sungmin, et autres
Publié: (2025)
par: Han, Sungmin, et autres
Publié: (2025)
Uncovering the Computational Roles of Nonlinearity in Sequence Modeling Using Almost-Linear RNNs
par: Brenner, Manuel, et autres
Publié: (2025)
par: Brenner, Manuel, et autres
Publié: (2025)
Mechanistic Anomaly Detection for "Quirky" Language Models
par: Johnston, David O., et autres
Publié: (2025)
par: Johnston, David O., et autres
Publié: (2025)
Sparse Autoencoder Features for Classifications and Transferability
par: Gallifant, Jack, et autres
Publié: (2025)
par: Gallifant, Jack, et autres
Publié: (2025)
Why Don't Prompt-Based Fairness Metrics Correlate?
par: Zayed, Abdelrahman, et autres
Publié: (2024)
par: Zayed, Abdelrahman, et autres
Publié: (2024)
Should We Attend More or Less? Modulating Attention for Fairness
par: Zayed, Abdelrahman, et autres
Publié: (2023)
par: Zayed, Abdelrahman, et autres
Publié: (2023)
A Reply to Makelov et al. (2023)'s "Interpretability Illusion" Arguments
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
An evolutionary perspective on modes of learning in Transformers
par: Ku, Alexander Y., et autres
Publié: (2025)
par: Ku, Alexander Y., et autres
Publié: (2025)
Does Machine Unlearning Truly Remove Knowledge?
par: Chen, Haokun, et autres
Publié: (2025)
par: Chen, Haokun, et autres
Publié: (2025)
Interpreting the Effects of Quantization on LLMs
par: Singh, Manpreet, et autres
Publié: (2025)
par: Singh, Manpreet, et autres
Publié: (2025)
Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs
par: Pepper, Keenan, et autres
Publié: (2026)
par: Pepper, Keenan, et autres
Publié: (2026)
Does Biomedical Training Lead to Better Medical Performance?
par: Dada, Amin, et autres
Publié: (2024)
par: Dada, Amin, et autres
Publié: (2024)
Does Refusal Training in LLMs Generalize to the Past Tense?
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Instruction Fine-Tuning: Does Prompt Loss Matter?
par: Huerta-Enochian, Mathew, et autres
Publié: (2024)
par: Huerta-Enochian, Mathew, et autres
Publié: (2024)
Interpretable classification of wiki-review streams
par: Méndez, Silvia García, et autres
Publié: (2024)
par: Méndez, Silvia García, et autres
Publié: (2024)
Interpretable Question Answering with Knowledge Graphs
par: Aneja, Kartikeya, et autres
Publié: (2025)
par: Aneja, Kartikeya, et autres
Publié: (2025)
MIB: A Mechanistic Interpretability Benchmark
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
Does Differential Privacy Impact Bias in Pretrained NLP Models?
par: Islam, Md. Khairul, et autres
Publié: (2024)
par: Islam, Md. Khairul, et autres
Publié: (2024)
How Does Response Length Affect Long-Form Factuality
par: Zhao, James Xu, et autres
Publié: (2025)
par: Zhao, James Xu, et autres
Publié: (2025)
When Does Multimodality Lead to Better Time Series Forecasting?
par: Zhang, Xiyuan, et autres
Publié: (2025)
par: Zhang, Xiyuan, et autres
Publié: (2025)
Does Training on Synthetic Data Make Models Less Robust?
par: Zhang, Lingze, et autres
Publié: (2025)
par: Zhang, Lingze, et autres
Publié: (2025)
Documents similaires
-
Partially Rewriting a Transformer in Natural Language
par: Paulo, Gonçalo, et autres
Publié: (2025) -
Automatically Interpreting Millions of Features in Large Language Models
par: Paulo, Gonçalo, et autres
Publié: (2024) -
Eliciting Latent Knowledge from Quirky Language Models
par: Mallen, Alex, et autres
Publié: (2023) -
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
par: Yehudai, Gilad, et autres
Publié: (2025) -
Refusal in LLMs is an Affine Function
par: Marshall, Thomas, et autres
Publié: (2024)