Adaptive Sparse Allocation with Mutual Choice & Feature Choice Sparse Autoencoders
Fuente:
arXiv
Salvato in:
| Autore principale: | Ayonrinde, Kola |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i
di: Ayonrinde, Kola, et al.
Pubblicazione: (2025)
di: Ayonrinde, Kola, et al.
Pubblicazione: (2025)
Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii
di: Ayonrinde, Kola, et al.
Pubblicazione: (2025)
di: Ayonrinde, Kola, et al.
Pubblicazione: (2025)
Interpretability as Compression: Reconsidering SAE Explanations of Neural Activations with MDL-SAEs
di: Ayonrinde, Kola, et al.
Pubblicazione: (2024)
di: Ayonrinde, Kola, et al.
Pubblicazione: (2024)
Sparse Autoencoder Features for Classifications and Transferability
di: Gallifant, Jack, et al.
Pubblicazione: (2025)
di: Gallifant, Jack, et al.
Pubblicazione: (2025)
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
Sparse Autoencoders, Again?
di: Lu, Yin, et al.
Pubblicazione: (2025)
di: Lu, Yin, et al.
Pubblicazione: (2025)
The Geometry of Concepts: Sparse Autoencoder Feature Structure
di: Li, Yuxiao, et al.
Pubblicazione: (2024)
di: Li, Yuxiao, et al.
Pubblicazione: (2024)
Feature Starvation as Geometric Instability in Sparse Autoencoders
di: Chaudhry, Faris, et al.
Pubblicazione: (2026)
di: Chaudhry, Faris, et al.
Pubblicazione: (2026)
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Semantic Optimal Transport for Sparse Autoencoder Feature Matching and Circuit Compression
di: Cao, Tue M., et al.
Pubblicazione: (2026)
di: Cao, Tue M., et al.
Pubblicazione: (2026)
Are Sparse Autoencoder Benchmarks Reliable?
di: Chanin, David
Pubblicazione: (2026)
di: Chanin, David
Pubblicazione: (2026)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training
di: Li, T. Ed, et al.
Pubblicazione: (2025)
di: Li, T. Ed, et al.
Pubblicazione: (2025)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
Improving Sparse Autoencoder with Dynamic Attention
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features
di: Zhu, Xudong, et al.
Pubblicazione: (2025)
di: Zhu, Xudong, et al.
Pubblicazione: (2025)
Rethinking Sparse Autoencoders: Select-and-Project for Fairness and Control from Encoder Features Alone
di: Bărbălau, Antonio, et al.
Pubblicazione: (2025)
di: Bărbălau, Antonio, et al.
Pubblicazione: (2025)
Improving Dictionary Learning with Gated Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
Empirical Evaluation of Progressive Coding for Sparse Autoencoders
di: Peter, Hans, et al.
Pubblicazione: (2025)
di: Peter, Hans, et al.
Pubblicazione: (2025)
Do Sparse Autoencoders Capture Concept Manifolds?
di: Bhalla, Usha, et al.
Pubblicazione: (2026)
di: Bhalla, Usha, et al.
Pubblicazione: (2026)
On the transferability of Sparse Autoencoders for interpreting compressed models
di: Gupte, Suchit, et al.
Pubblicazione: (2025)
di: Gupte, Suchit, et al.
Pubblicazione: (2025)
Data Whitening Improves Sparse Autoencoder Learning
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
Improving Robustness In Sparse Autoencoders via Masked Regularization
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
Sparse Autoencoders Do Not Find Canonical Units of Analysis
di: Leask, Patrick, et al.
Pubblicazione: (2025)
di: Leask, Patrick, et al.
Pubblicazione: (2025)
Evaluating and Designing Sparse Autoencoders by Approximating Quasi-Orthogonality
di: Lee, Sewoong, et al.
Pubblicazione: (2025)
di: Lee, Sewoong, et al.
Pubblicazione: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
di: Yeon, Jehyeok, et al.
Pubblicazione: (2025)
di: Yeon, Jehyeok, et al.
Pubblicazione: (2025)
Feature Distillation is the Better Choice for Model-Heterogeneous Federated Learning
di: Li, Yichen, et al.
Pubblicazione: (2025)
di: Li, Yichen, et al.
Pubblicazione: (2025)
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
di: Pach, Mateusz, et al.
Pubblicazione: (2025)
di: Pach, Mateusz, et al.
Pubblicazione: (2025)
Learning Retrieval Models with Sparse Autoencoders
di: Formal, Thibault, et al.
Pubblicazione: (2026)
di: Formal, Thibault, et al.
Pubblicazione: (2026)
Finding Belief Geometries with Sparse Autoencoders
di: Levinson, Matthew
Pubblicazione: (2026)
di: Levinson, Matthew
Pubblicazione: (2026)
Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder
di: Xu, Zhen, et al.
Pubblicazione: (2025)
di: Xu, Zhen, et al.
Pubblicazione: (2025)
Projecting Assumptions: The Duality Between Sparse Autoencoders and Concept Geometry
di: Hindupur, Sai Sumedh R., et al.
Pubblicazione: (2025)
di: Hindupur, Sai Sumedh R., et al.
Pubblicazione: (2025)
Don't Forget It! Conditional Sparse Autoencoder Clamping Works for Unlearning
di: Khoriaty, Matthew, et al.
Pubblicazione: (2025)
di: Khoriaty, Matthew, et al.
Pubblicazione: (2025)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
di: Jiang, Nick, et al.
Pubblicazione: (2025)
di: Jiang, Nick, et al.
Pubblicazione: (2025)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
di: Lan, Michael, et al.
Pubblicazione: (2024)
di: Lan, Michael, et al.
Pubblicazione: (2024)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
Incorporating Hierarchical Semantics in Sparse Autoencoder Architectures
di: Muchane, Mark, et al.
Pubblicazione: (2025)
di: Muchane, Mark, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i
di: Ayonrinde, Kola, et al.
Pubblicazione: (2025) -
Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii
di: Ayonrinde, Kola, et al.
Pubblicazione: (2025) -
Interpretability as Compression: Reconsidering SAE Explanations of Neural Activations with MDL-SAEs
di: Ayonrinde, Kola, et al.
Pubblicazione: (2024) -
Sparse Autoencoder Features for Classifications and Transferability
di: Gallifant, Jack, et al.
Pubblicazione: (2025) -
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025)