Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Nick, Sun, Xiaoqing, Dunlap, Lisa, Smith, Lewis, Nanda, Neel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
Improving Dictionary Learning with Gated Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
Sparse Autoencoders Do Not Find Canonical Units of Analysis
di: Leask, Patrick, et al.
Pubblicazione: (2025)
di: Leask, Patrick, et al.
Pubblicazione: (2025)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control
di: Makelov, Aleksandar, et al.
Pubblicazione: (2024)
di: Makelov, Aleksandar, et al.
Pubblicazione: (2024)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026)
di: Li, Yuhan, et al.
Pubblicazione: (2026)
ReSAE: Residualized Sparse Autoencoders for Multi-Layer Transformer Interventions
di: Poduval, Prathyush, et al.
Pubblicazione: (2026)
di: Poduval, Prathyush, et al.
Pubblicazione: (2026)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025)
di: Macar, Uzay, et al.
Pubblicazione: (2025)
The Geometry of Concepts: Sparse Autoencoder Feature Structure
di: Li, Yuxiao, et al.
Pubblicazione: (2024)
di: Li, Yuxiao, et al.
Pubblicazione: (2024)
Explorations of Self-Repair in Language Models
di: Rushing, Cody, et al.
Pubblicazione: (2024)
di: Rushing, Cody, et al.
Pubblicazione: (2024)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
di: Zhang, Fred, et al.
Pubblicazione: (2023)
di: Zhang, Fred, et al.
Pubblicazione: (2023)
Interpreting Attention Layer Outputs with Sparse Autoencoders
di: Kissane, Connor, et al.
Pubblicazione: (2024)
di: Kissane, Connor, et al.
Pubblicazione: (2024)
Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning
di: Minder, Julian, et al.
Pubblicazione: (2025)
di: Minder, Julian, et al.
Pubblicazione: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2024)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2024)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
Quanda: An Interpretability Toolkit for Training Data Attribution Evaluation and Beyond
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
Data Whitening Improves Sparse Autoencoder Learning
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
di: Wang, Xu, et al.
Pubblicazione: (2026)
di: Wang, Xu, et al.
Pubblicazione: (2026)
Interpreting CLIP with Hierarchical Sparse Autoencoders
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
FedNAMs: Performing Interpretability Analysis in Federated Learning Context
di: Nanda, Amitash, et al.
Pubblicazione: (2025)
di: Nanda, Amitash, et al.
Pubblicazione: (2025)
Convergent Linear Representations of Emergent Misalignment
di: Soligo, Anna, et al.
Pubblicazione: (2025)
di: Soligo, Anna, et al.
Pubblicazione: (2025)
Sparse Autoencoders, Again?
di: Lu, Yin, et al.
Pubblicazione: (2025)
di: Lu, Yin, et al.
Pubblicazione: (2025)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
di: Bhalla, Usha, et al.
Pubblicazione: (2025)
di: Bhalla, Usha, et al.
Pubblicazione: (2025)
Sparse Autoencoders for Sequential Recommendation Models: Interpretation and Flexible Control
di: Klenitskiy, Anton, et al.
Pubblicazione: (2025)
di: Klenitskiy, Anton, et al.
Pubblicazione: (2025)
Are Sparse Autoencoder Benchmarks Reliable?
di: Chanin, David
Pubblicazione: (2026)
di: Chanin, David
Pubblicazione: (2026)
Interpreting Outliers in Time Series Data through Decoding Autoencoder
di: Knab, Patrick, et al.
Pubblicazione: (2024)
di: Knab, Patrick, et al.
Pubblicazione: (2024)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
DreamReader: An Interpretability Toolkit for Text-to-Image Models
di: Prakash, Nirmalendu, et al.
Pubblicazione: (2026)
di: Prakash, Nirmalendu, et al.
Pubblicazione: (2026)
SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
di: Chanin, David, et al.
Pubblicazione: (2026)
di: Chanin, David, et al.
Pubblicazione: (2026)
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
di: Yeung, Calvin, et al.
Pubblicazione: (2026)
di: Yeung, Calvin, et al.
Pubblicazione: (2026)
Model Organisms for Emergent Misalignment
di: Turner, Edward, et al.
Pubblicazione: (2025)
di: Turner, Edward, et al.
Pubblicazione: (2025)
Understanding Reasoning in Thinking Language Models via Steering Vectors
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
Base Models Know How to Reason, Thinking Models Learn When
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024) -
Improving Dictionary Learning with Gated Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024) -
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025) -
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025) -
Sparse Autoencoders Do Not Find Canonical Units of Analysis
di: Leask, Patrick, et al.
Pubblicazione: (2025)