Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control
Fuente:
arXiv
Salvato in:
| Autori principali: | Makelov, Aleksandar, Lange, George, Nanda, Neel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Interpreting Attention Layer Outputs with Sparse Autoencoders
di: Kissane, Connor, et al.
Pubblicazione: (2024)
di: Kissane, Connor, et al.
Pubblicazione: (2024)
Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
di: Jiang, Nick, et al.
Pubblicazione: (2025)
di: Jiang, Nick, et al.
Pubblicazione: (2025)
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
Improving Dictionary Learning with Gated Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
Sparse Autoencoders Do Not Find Canonical Units of Analysis
di: Leask, Patrick, et al.
Pubblicazione: (2025)
di: Leask, Patrick, et al.
Pubblicazione: (2025)
Transcoders Find Interpretable LLM Feature Circuits
di: Dunefsky, Jacob, et al.
Pubblicazione: (2024)
di: Dunefsky, Jacob, et al.
Pubblicazione: (2024)
Fast Dual-Regularized Autoencoder for Sparse Biological Data
di: Poleksic, Aleksandar
Pubblicazione: (2024)
di: Poleksic, Aleksandar
Pubblicazione: (2024)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
di: Zhang, Fred, et al.
Pubblicazione: (2023)
di: Zhang, Fred, et al.
Pubblicazione: (2023)
Inference-Time Decomposition of Activations (ITDA): A Scalable Approach to Interpreting Large Language Models
di: Leask, Patrick, et al.
Pubblicazione: (2025)
di: Leask, Patrick, et al.
Pubblicazione: (2025)
Difficulties with Evaluating a Deception Detector for AIs
di: Smith, Lewis, et al.
Pubblicazione: (2025)
di: Smith, Lewis, et al.
Pubblicazione: (2025)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
How to use and interpret activation patching
di: Heimersheim, Stefan, et al.
Pubblicazione: (2024)
di: Heimersheim, Stefan, et al.
Pubblicazione: (2024)
Transcoders Beat Sparse Autoencoders for Interpretability
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Towards eliciting latent knowledge from LLMs with mechanistic interpretability
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
Interpretable Reward Model via Sparse Autoencoder
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
Toward Identifiable Sparse Autoencoders
di: Nelson, Walter, et al.
Pubblicazione: (2026)
di: Nelson, Walter, et al.
Pubblicazione: (2026)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
ReSAE: Residualized Sparse Autoencoders for Multi-Layer Transformer Interventions
di: Poduval, Prathyush, et al.
Pubblicazione: (2026)
di: Poduval, Prathyush, et al.
Pubblicazione: (2026)
Sparse Autoencoders for Sequential Recommendation Models: Interpretation and Flexible Control
di: Klenitskiy, Anton, et al.
Pubblicazione: (2025)
di: Klenitskiy, Anton, et al.
Pubblicazione: (2025)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
Step-Level Sparse Autoencoder for Reasoning Process Interpretation
di: Yang, Xuan, et al.
Pubblicazione: (2026)
di: Yang, Xuan, et al.
Pubblicazione: (2026)
Route Sparse Autoencoder to Interpret Large Language Models
di: Shi, Wei, et al.
Pubblicazione: (2025)
di: Shi, Wei, et al.
Pubblicazione: (2025)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025)
di: Macar, Uzay, et al.
Pubblicazione: (2025)
Explorations of Self-Repair in Language Models
di: Rushing, Cody, et al.
Pubblicazione: (2024)
di: Rushing, Cody, et al.
Pubblicazione: (2024)
Evaluating Sparse Autoencoders for Monosemantic Representation
di: Fereidouni, Moghis, et al.
Pubblicazione: (2025)
di: Fereidouni, Moghis, et al.
Pubblicazione: (2025)
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
di: Marks, Luke, et al.
Pubblicazione: (2024)
di: Marks, Luke, et al.
Pubblicazione: (2024)
Group Equivariance Meets Mechanistic Interpretability: Equivariant Sparse Autoencoders
di: Erdogan, Ege, et al.
Pubblicazione: (2025)
di: Erdogan, Ege, et al.
Pubblicazione: (2025)
Transformer Key-Value Memories Are Nearly as Interpretable as Sparse Autoencoders
di: Ye, Mengyu, et al.
Pubblicazione: (2025)
di: Ye, Mengyu, et al.
Pubblicazione: (2025)
Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning
di: Minder, Julian, et al.
Pubblicazione: (2025)
di: Minder, Julian, et al.
Pubblicazione: (2025)
Interpretable Company Similarity with Sparse Autoencoders
di: Molinari, Marco, et al.
Pubblicazione: (2024)
di: Molinari, Marco, et al.
Pubblicazione: (2024)
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
di: Kurochkin, Vadim, et al.
Pubblicazione: (2025)
di: Kurochkin, Vadim, et al.
Pubblicazione: (2025)
Interpreting CLIP with Hierarchical Sparse Autoencoders
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
Interpreting and Steering Protein Language Models through Sparse Autoencoders
di: Garcia, Edith Natalia Villegas, et al.
Pubblicazione: (2025)
di: Garcia, Edith Natalia Villegas, et al.
Pubblicazione: (2025)
Interpreting CFD Surrogates through Sparse Autoencoders
di: Hu, Yeping, et al.
Pubblicazione: (2025)
di: Hu, Yeping, et al.
Pubblicazione: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Interpreting Attention Layer Outputs with Sparse Autoencoders
di: Kissane, Connor, et al.
Pubblicazione: (2024) -
Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks
di: Karvonen, Adam, et al.
Pubblicazione: (2024) -
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024) -
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
di: Jiang, Nick, et al.
Pubblicazione: (2025) -
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025)