AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Xudong, Khalili, Mohammad Mahdi, Zhu, Zhihui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
par: Zhu, Xudong, et autres
Publié: (2025)
par: Zhu, Xudong, et autres
Publié: (2025)
Sparse Autoencoder Features for Classifications and Transferability
par: Gallifant, Jack, et autres
Publié: (2025)
par: Gallifant, Jack, et autres
Publié: (2025)
On the transferability of Sparse Autoencoders for interpreting compressed models
par: Gupte, Suchit, et autres
Publié: (2025)
par: Gupte, Suchit, et autres
Publié: (2025)
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
par: Minegishi, Gouki, et autres
Publié: (2025)
par: Minegishi, Gouki, et autres
Publié: (2025)
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
par: Chanin, David, et autres
Publié: (2025)
par: Chanin, David, et autres
Publié: (2025)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
par: Chanin, David, et autres
Publié: (2025)
par: Chanin, David, et autres
Publié: (2025)
BatchTopK Sparse Autoencoders
par: Bussmann, Bart, et autres
Publié: (2024)
par: Bussmann, Bart, et autres
Publié: (2024)
Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training
par: Li, T. Ed, et autres
Publié: (2025)
par: Li, T. Ed, et autres
Publié: (2025)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
par: Lan, Michael, et autres
Publié: (2024)
par: Lan, Michael, et autres
Publié: (2024)
FaithfulSAE: Towards Capturing Faithful Features with Sparse Autoencoders without External Dataset Dependencies
par: Cho, Seonglae, et autres
Publié: (2025)
par: Cho, Seonglae, et autres
Publié: (2025)
Dissecting Chronos: Sparse Autoencoders Reveal Causal Feature Hierarchies in Time Series Foundation Models
par: Mishra, Anurag
Publié: (2026)
par: Mishra, Anurag
Publié: (2026)
Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction
par: Sainsbury, Chris, et autres
Publié: (2026)
par: Sainsbury, Chris, et autres
Publié: (2026)
Incorporating Hierarchical Semantics in Sparse Autoencoder Architectures
par: Muchane, Mark, et autres
Publié: (2025)
par: Muchane, Mark, et autres
Publié: (2025)
Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations
par: Farnik, Lucy, et autres
Publié: (2025)
par: Farnik, Lucy, et autres
Publié: (2025)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)
par: Li, Aaron J., et autres
Publié: (2025)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines
par: Jørgensen, Mikkel Godsk, et autres
Publié: (2026)
par: Jørgensen, Mikkel Godsk, et autres
Publié: (2026)
From Compression to Expression: A Layerwise Analysis of In-Context Learning
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
Accelerating Prefilling for Long-Context LLMs via Sparse Pattern Sharing
par: Peng, Dan, et autres
Publié: (2025)
par: Peng, Dan, et autres
Publié: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
par: Yang, Xianjun, et autres
Publié: (2025)
par: Yang, Xianjun, et autres
Publié: (2025)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
par: Joshi, Shruti, et autres
Publié: (2025)
par: Joshi, Shruti, et autres
Publié: (2025)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
par: Lieberum, Tom, et autres
Publié: (2024)
par: Lieberum, Tom, et autres
Publié: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Towards Understanding the Robustness of Sparse Autoencoders
par: Saiyed, Ahson, et autres
Publié: (2026)
par: Saiyed, Ahson, et autres
Publié: (2026)
Post-processing for Fair Regression via Explainable SVD
par: Zuo, Zhiqun, et autres
Publié: (2025)
par: Zuo, Zhiqun, et autres
Publié: (2025)
An Efficient Training Algorithm for Models with Block-wise Sparsity
par: Zhu, Ding, et autres
Publié: (2025)
par: Zhu, Ding, et autres
Publié: (2025)
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
par: He, Zirui, et autres
Publié: (2025)
par: He, Zirui, et autres
Publié: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024)
par: Muhamed, Aashiq, et autres
Publié: (2024)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
par: Jing, Yi, et autres
Publié: (2026)
par: Jing, Yi, et autres
Publié: (2026)
Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data
par: Kwak, Minseo, et autres
Publié: (2026)
par: Kwak, Minseo, et autres
Publié: (2026)
Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models
par: Pan, Bowen, et autres
Publié: (2024)
par: Pan, Bowen, et autres
Publié: (2024)
Use Sparse Autoencoders to Discover Unknown Concepts, Not to Act on Known Concepts
par: Peng, Kenny, et autres
Publié: (2025)
par: Peng, Kenny, et autres
Publié: (2025)
Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object Identification
par: Chhabra, Vishnu Kabir, et autres
Publié: (2025)
par: Chhabra, Vishnu Kabir, et autres
Publié: (2025)
Attention Mechanisms Don't Learn Additive Models: Rethinking Feature Importance for Transformers
par: Leemann, Tobias, et autres
Publié: (2024)
par: Leemann, Tobias, et autres
Publié: (2024)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
par: Weng, Jiaqi, et autres
Publié: (2025)
par: Weng, Jiaqi, et autres
Publié: (2025)
Documents similaires
-
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
par: Zhu, Xudong, et autres
Publié: (2025) -
Sparse Autoencoder Features for Classifications and Transferability
par: Gallifant, Jack, et autres
Publié: (2025) -
On the transferability of Sparse Autoencoders for interpreting compressed models
par: Gupte, Suchit, et autres
Publié: (2025) -
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
par: Minegishi, Gouki, et autres
Publié: (2025) -
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
par: Chanin, David, et autres
Publié: (2025)