Sparse Autoencoder Features for Classifications and Transferability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gallifant, Jack, Chen, Shan, Sasse, Kuleen, Aerts, Hugo, Hartvigsen, Thomas, Bitterman, Danielle S. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KScope: A Framework for Characterizing the Knowledge Status of Language Models
par: Xiao, Yuxin, et autres
Publié: (2025)
par: Xiao, Yuxin, et autres
Publié: (2025)
Wait, but Tylenol is Acetaminophen... Investigating and Improving Language Models' Ability to Resist Requests for Misinformation
par: Chen, Shan, et autres
Publié: (2024)
par: Chen, Shan, et autres
Publié: (2024)
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
par: Chanin, David, et autres
Publié: (2025)
par: Chanin, David, et autres
Publié: (2025)
debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias
par: Sasse, Kuleen, et autres
Publié: (2024)
par: Sasse, Kuleen, et autres
Publié: (2024)
Evaluation of ChatGPT Family of Models for Biomedical Reasoning and Classification
par: Chen, Shan, et autres
Publié: (2023)
par: Chen, Shan, et autres
Publié: (2023)
MedBrowseComp: Benchmarking Medical Deep Research and Computer Use
par: Chen, Shan, et autres
Publié: (2025)
par: Chen, Shan, et autres
Publié: (2025)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
par: Chanin, David, et autres
Publié: (2025)
par: Chanin, David, et autres
Publié: (2025)
AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features
par: Zhu, Xudong, et autres
Publié: (2025)
par: Zhu, Xudong, et autres
Publié: (2025)
When Raw Data Prevails: Are Large Language Model Embeddings Effective in Numerical Data Representation for Medical Machine Learning Applications?
par: Gao, Yanjun, et autres
Publié: (2024)
par: Gao, Yanjun, et autres
Publié: (2024)
Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training
par: Li, T. Ed, et autres
Publié: (2025)
par: Li, T. Ed, et autres
Publié: (2025)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
par: Lan, Michael, et autres
Publié: (2024)
par: Lan, Michael, et autres
Publié: (2024)
FaithfulSAE: Towards Capturing Faithful Features with Sparse Autoencoders without External Dataset Dependencies
par: Cho, Seonglae, et autres
Publié: (2025)
par: Cho, Seonglae, et autres
Publié: (2025)
Dissecting Chronos: Sparse Autoencoders Reveal Causal Feature Hierarchies in Time Series Foundation Models
par: Mishra, Anurag
Publié: (2026)
par: Mishra, Anurag
Publié: (2026)
Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction
par: Sainsbury, Chris, et autres
Publié: (2026)
par: Sainsbury, Chris, et autres
Publié: (2026)
Incorporating Hierarchical Semantics in Sparse Autoencoder Architectures
par: Muchane, Mark, et autres
Publié: (2025)
par: Muchane, Mark, et autres
Publié: (2025)
Language Models are Surprisingly Fragile to Drug Names in Biomedical Benchmarks
par: Gallifant, Jack, et autres
Publié: (2024)
par: Gallifant, Jack, et autres
Publié: (2024)
Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations
par: Farnik, Lucy, et autres
Publié: (2025)
par: Farnik, Lucy, et autres
Publié: (2025)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)
par: Li, Aaron J., et autres
Publié: (2025)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
par: Minegishi, Gouki, et autres
Publié: (2025)
par: Minegishi, Gouki, et autres
Publié: (2025)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines
par: Jørgensen, Mikkel Godsk, et autres
Publié: (2026)
par: Jørgensen, Mikkel Godsk, et autres
Publié: (2026)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
par: Yang, Xianjun, et autres
Publié: (2025)
par: Yang, Xianjun, et autres
Publié: (2025)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
par: Joshi, Shruti, et autres
Publié: (2025)
par: Joshi, Shruti, et autres
Publié: (2025)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
par: Lieberum, Tom, et autres
Publié: (2024)
par: Lieberum, Tom, et autres
Publié: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Towards Understanding the Robustness of Sparse Autoencoders
par: Saiyed, Ahson, et autres
Publié: (2026)
par: Saiyed, Ahson, et autres
Publié: (2026)
Lifelong Knowledge Editing requires Better Regularization
par: Gupta, Akshat, et autres
Publié: (2025)
par: Gupta, Akshat, et autres
Publié: (2025)
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
par: He, Zirui, et autres
Publié: (2025)
par: He, Zirui, et autres
Publié: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024)
par: Muhamed, Aashiq, et autres
Publié: (2024)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
par: Jing, Yi, et autres
Publié: (2026)
par: Jing, Yi, et autres
Publié: (2026)
Use Sparse Autoencoders to Discover Unknown Concepts, Not to Act on Known Concepts
par: Peng, Kenny, et autres
Publié: (2025)
par: Peng, Kenny, et autres
Publié: (2025)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
par: Weng, Jiaqi, et autres
Publié: (2025)
par: Weng, Jiaqi, et autres
Publié: (2025)
ReAGent: A Model-agnostic Feature Attribution Method for Generative Language Models
par: Zhao, Zhixue, et autres
Publié: (2024)
par: Zhao, Zhixue, et autres
Publié: (2024)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
par: Hua, Zhenglin, et autres
Publié: (2025)
par: Hua, Zhenglin, et autres
Publié: (2025)
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025)
par: Butler, Landon, et autres
Publié: (2025)
Documents similaires
-
KScope: A Framework for Characterizing the Knowledge Status of Language Models
par: Xiao, Yuxin, et autres
Publié: (2025) -
Wait, but Tylenol is Acetaminophen... Investigating and Improving Language Models' Ability to Resist Requests for Misinformation
par: Chen, Shan, et autres
Publié: (2024) -
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
par: Chanin, David, et autres
Publié: (2025) -
debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias
par: Sasse, Kuleen, et autres
Publié: (2024) -
Evaluation of ChatGPT Family of Models for Biomedical Reasoning and Classification
par: Chen, Shan, et autres
Publié: (2023)