Transformer Key-Value Memories Are Nearly as Interpretable as Sparse Autoencoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Mengyu, Suzuki, Jun, Inaba, Tatsuro, Kuribayashi, Tatsuki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Input Attributions Explain Inductive Reasoning in In-Context Learning?
par: Ye, Mengyu, et autres
Publié: (2024)
par: Ye, Mengyu, et autres
Publié: (2024)
How a Bilingual LM Becomes Bilingual: Tracing Internal Representations with Sparse Autoencoders
par: Inaba, Tatsuro, et autres
Publié: (2025)
par: Inaba, Tatsuro, et autres
Publié: (2025)
Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders
par: Ma, Qingsen, et autres
Publié: (2025)
par: Ma, Qingsen, et autres
Publié: (2025)
Transcoders Beat Sparse Autoencoders for Interpretability
par: Paulo, Gonçalo, et autres
Publié: (2025)
par: Paulo, Gonçalo, et autres
Publié: (2025)
Interpretable Reward Model via Sparse Autoencoder
par: Zhang, Shuyi, et autres
Publié: (2025)
par: Zhang, Shuyi, et autres
Publié: (2025)
Interpreting Attention Layer Outputs with Sparse Autoencoders
par: Kissane, Connor, et autres
Publié: (2024)
par: Kissane, Connor, et autres
Publié: (2024)
Route Sparse Autoencoder to Interpret Large Language Models
par: Shi, Wei, et autres
Publié: (2025)
par: Shi, Wei, et autres
Publié: (2025)
Step-Level Sparse Autoencoder for Reasoning Process Interpretation
par: Yang, Xuan, et autres
Publié: (2026)
par: Yang, Xuan, et autres
Publié: (2026)
Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control
par: Makelov, Aleksandar, et autres
Publié: (2024)
par: Makelov, Aleksandar, et autres
Publié: (2024)
Group Equivariance Meets Mechanistic Interpretability: Equivariant Sparse Autoencoders
par: Erdogan, Ege, et autres
Publié: (2025)
par: Erdogan, Ege, et autres
Publié: (2025)
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
par: Marks, Luke, et autres
Publié: (2024)
par: Marks, Luke, et autres
Publié: (2024)
MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding
par: Zuhri, Zayd Muhammad Kawakibi, et autres
Publié: (2024)
par: Zuhri, Zayd Muhammad Kawakibi, et autres
Publié: (2024)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
par: Ye, Mengyu, et autres
Publié: (2026)
par: Ye, Mengyu, et autres
Publié: (2026)
Interpretable Company Similarity with Sparse Autoencoders
par: Molinari, Marco, et autres
Publié: (2024)
par: Molinari, Marco, et autres
Publié: (2024)
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
par: Kurochkin, Vadim, et autres
Publié: (2025)
par: Kurochkin, Vadim, et autres
Publié: (2025)
Can Language Models Learn Typologically Implausible Languages?
par: Xu, Tianyang, et autres
Publié: (2025)
par: Xu, Tianyang, et autres
Publié: (2025)
Disentangling Dense Embeddings with Sparse Autoencoders
par: O'Neill, Charles, et autres
Publié: (2024)
par: O'Neill, Charles, et autres
Publié: (2024)
Interpreting and Steering Protein Language Models through Sparse Autoencoders
par: Garcia, Edith Natalia Villegas, et autres
Publié: (2025)
par: Garcia, Edith Natalia Villegas, et autres
Publié: (2025)
Interpreting CLIP with Hierarchical Sparse Autoencoders
par: Zaigrajew, Vladimir, et autres
Publié: (2025)
par: Zaigrajew, Vladimir, et autres
Publié: (2025)
Interpreting CFD Surrogates through Sparse Autoencoders
par: Hu, Yeping, et autres
Publié: (2025)
par: Hu, Yeping, et autres
Publié: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
par: Tolooshams, Bahareh, et autres
Publié: (2025)
par: Tolooshams, Bahareh, et autres
Publié: (2025)
Interpretable and Steerable Concept Bottleneck Sparse Autoencoders
par: Kulkarni, Akshay, et autres
Publié: (2025)
par: Kulkarni, Akshay, et autres
Publié: (2025)
Resurrecting the Salmon: Rethinking Mechanistic Interpretability with Domain-Specific Sparse Autoencoders
par: O'Neill, Charles, et autres
Publié: (2025)
par: O'Neill, Charles, et autres
Publié: (2025)
XNNTab -- Interpretable Neural Networks for Tabular Data using Sparse Autoencoders
par: Elhadri, Khawla, et autres
Publié: (2025)
par: Elhadri, Khawla, et autres
Publié: (2025)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
par: Parsan, Nithin, et autres
Publié: (2025)
par: Parsan, Nithin, et autres
Publié: (2025)
Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders
par: Tahimic, Kriz, et autres
Publié: (2025)
par: Tahimic, Kriz, et autres
Publié: (2025)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
par: Jiang, Nick, et autres
Publié: (2025)
par: Jiang, Nick, et autres
Publié: (2025)
Learning Interpretable Features in Audio Latent Spaces via Sparse Autoencoders
par: Paek, Nathan, et autres
Publié: (2025)
par: Paek, Nathan, et autres
Publié: (2025)
AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model Representations
par: Yao, Yifei, et autres
Publié: (2025)
par: Yao, Yifei, et autres
Publié: (2025)
Sparse Autoencoders for Interpretable Medical Image Representation Learning
par: Wesp, Philipp, et autres
Publié: (2026)
par: Wesp, Philipp, et autres
Publié: (2026)
Decoding Dense Embeddings: Sparse Autoencoders for Interpreting and Discretizing Dense Retrieval
par: Park, Seongwan, et autres
Publié: (2025)
par: Park, Seongwan, et autres
Publié: (2025)
SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders
par: Cywiński, Bartosz, et autres
Publié: (2025)
par: Cywiński, Bartosz, et autres
Publié: (2025)
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
Ensembling Sparse Autoencoders
par: Gadgil, Soham, et autres
Publié: (2025)
par: Gadgil, Soham, et autres
Publié: (2025)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
Sparse Autoencoders for Sequential Recommendation Models: Interpretation and Flexible Control
par: Klenitskiy, Anton, et autres
Publié: (2025)
par: Klenitskiy, Anton, et autres
Publié: (2025)
Universal Sparse Autoencoders: Interpretable Cross-Model Concept Alignment
par: Thasarathan, Harrish, et autres
Publié: (2025)
par: Thasarathan, Harrish, et autres
Publié: (2025)
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
par: Yeung, Calvin, et autres
Publié: (2026)
par: Yeung, Calvin, et autres
Publié: (2026)
Interdomain Attention: Beyond Token-Level Key-Value Memory
par: Kiyohara, Naoki, et autres
Publié: (2026)
par: Kiyohara, Naoki, et autres
Publié: (2026)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
par: Zhao, Daniel, et autres
Publié: (2025)
par: Zhao, Daniel, et autres
Publié: (2025)
Documents similaires
-
Can Input Attributions Explain Inductive Reasoning in In-Context Learning?
par: Ye, Mengyu, et autres
Publié: (2024) -
How a Bilingual LM Becomes Bilingual: Tracing Internal Representations with Sparse Autoencoders
par: Inaba, Tatsuro, et autres
Publié: (2025) -
Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders
par: Ma, Qingsen, et autres
Publié: (2025) -
Transcoders Beat Sparse Autoencoders for Interpretability
par: Paulo, Gonçalo, et autres
Publié: (2025) -
Interpretable Reward Model via Sparse Autoencoder
par: Zhang, Shuyi, et autres
Publié: (2025)