SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cywiński, Bartosz, Deja, Kamil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GUIDE: Guidance-based Incremental Learning with Diffusion Models
par: Cywiński, Bartosz, et autres
Publié: (2024)
par: Cywiński, Bartosz, et autres
Publié: (2024)
Don't Forget It! Conditional Sparse Autoencoder Clamping Works for Unlearning
par: Khoriaty, Matthew, et autres
Publié: (2025)
par: Khoriaty, Matthew, et autres
Publié: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024)
par: Muhamed, Aashiq, et autres
Publié: (2024)
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
par: Yeung, Calvin, et autres
Publié: (2026)
par: Yeung, Calvin, et autres
Publié: (2026)
Do Sparse Autoencoders Capture Concept Manifolds?
par: Bhalla, Usha, et autres
Publié: (2026)
par: Bhalla, Usha, et autres
Publié: (2026)
Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning
par: Kim, Hyeonjin, et autres
Publié: (2026)
par: Kim, Hyeonjin, et autres
Publié: (2026)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Projecting Assumptions: The Duality Between Sparse Autoencoders and Concept Geometry
par: Hindupur, Sai Sumedh R., et autres
Publié: (2025)
par: Hindupur, Sai Sumedh R., et autres
Publié: (2025)
The Geometry of Concepts: Sparse Autoencoder Feature Structure
par: Li, Yuxiao, et autres
Publié: (2024)
par: Li, Yuxiao, et autres
Publié: (2024)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
par: Jiang, Nick, et autres
Publié: (2025)
par: Jiang, Nick, et autres
Publié: (2025)
Sparse Autoencoders for Sequential Recommendation Models: Interpretation and Flexible Control
par: Klenitskiy, Anton, et autres
Publié: (2025)
par: Klenitskiy, Anton, et autres
Publié: (2025)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
par: Parsan, Nithin, et autres
Publié: (2025)
par: Parsan, Nithin, et autres
Publié: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
par: Tolooshams, Bahareh, et autres
Publié: (2025)
par: Tolooshams, Bahareh, et autres
Publié: (2025)
Deep Generative Models for Proton Zero Degree Calorimeter Simulations in ALICE, CERN
par: Będkowski, Patryk, et autres
Publié: (2024)
par: Będkowski, Patryk, et autres
Publié: (2024)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)
par: Li, Aaron J., et autres
Publié: (2025)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
par: Joshi, Shruti, et autres
Publié: (2025)
par: Joshi, Shruti, et autres
Publié: (2025)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
par: Zhao, Daniel, et autres
Publié: (2025)
par: Zhao, Daniel, et autres
Publié: (2025)
Interpreting CLIP with Hierarchical Sparse Autoencoders
par: Zaigrajew, Vladimir, et autres
Publié: (2025)
par: Zaigrajew, Vladimir, et autres
Publié: (2025)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Unlearning via Sparse Representations
par: Shah, Vedant, et autres
Publié: (2023)
par: Shah, Vedant, et autres
Publié: (2023)
ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition
par: Lin, Shen, et autres
Publié: (2026)
par: Lin, Shen, et autres
Publié: (2026)
Sparse Autoencoders, Again?
par: Lu, Yin, et autres
Publié: (2025)
par: Lu, Yin, et autres
Publié: (2025)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
par: Balagansky, Nikita, et autres
Publié: (2025)
par: Balagansky, Nikita, et autres
Publié: (2025)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
par: Li, Yuhan, et autres
Publié: (2026)
par: Li, Yuhan, et autres
Publié: (2026)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
Use Sparse Autoencoders to Discover Unknown Concepts, Not to Act on Known Concepts
par: Peng, Kenny, et autres
Publié: (2025)
par: Peng, Kenny, et autres
Publié: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
par: He, Zirui, et autres
Publié: (2025)
par: He, Zirui, et autres
Publié: (2025)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
par: Casademunt, Helena, et autres
Publié: (2026)
par: Casademunt, Helena, et autres
Publié: (2026)
The Right to be Forgotten in Pruning: Unveil Machine Unlearning on Sparse Models
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Are Sparse Autoencoder Benchmarks Reliable?
par: Chanin, David
Publié: (2026)
par: Chanin, David
Publié: (2026)
Leakage and Interpretability in Concept-Based Models
par: Parisini, Enrico, et autres
Publié: (2025)
par: Parisini, Enrico, et autres
Publié: (2025)
Hierarchical Concept-based Interpretable Models
par: Hill, Oscar, et autres
Publié: (2026)
par: Hill, Oscar, et autres
Publié: (2026)
Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models
par: Moon, Saemi, et autres
Publié: (2026)
par: Moon, Saemi, et autres
Publié: (2026)
BatchTopK Sparse Autoencoders
par: Bussmann, Bart, et autres
Publié: (2024)
par: Bussmann, Bart, et autres
Publié: (2024)
Improving Sparse Autoencoder with Dynamic Attention
par: Wang, Dongsheng, et autres
Publié: (2026)
par: Wang, Dongsheng, et autres
Publié: (2026)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
par: Kantamneni, Subhash, et autres
Publié: (2025)
par: Kantamneni, Subhash, et autres
Publié: (2025)
InterPLM: Discovering Interpretable Features in Protein Language Models via Sparse Autoencoders
par: Simon, Elana, et autres
Publié: (2024)
par: Simon, Elana, et autres
Publié: (2024)
Learning Retrieval Models with Sparse Autoencoders
par: Formal, Thibault, et autres
Publié: (2026)
par: Formal, Thibault, et autres
Publié: (2026)
Few-Shot Concept Unlearning with Low Rank Adaptation
par: Shreyas, Udaya, et autres
Publié: (2025)
par: Shreyas, Udaya, et autres
Publié: (2025)
Documents similaires
-
GUIDE: Guidance-based Incremental Learning with Diffusion Models
par: Cywiński, Bartosz, et autres
Publié: (2024) -
Don't Forget It! Conditional Sparse Autoencoder Clamping Works for Unlearning
par: Khoriaty, Matthew, et autres
Publié: (2025) -
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024) -
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
par: Yeung, Calvin, et autres
Publié: (2026) -
Do Sparse Autoencoders Capture Concept Manifolds?
par: Bhalla, Usha, et autres
Publié: (2026)