Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Carolina, Beltran-Velez, Nicolas, Karlekar, Sweta, Shi, Claudia, Nazaret, Achille, Mallik, Asif, Feder, Amir, Blei, David M. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-environment Topic Models
by: Sobhani, Dominic, et al.
Published: (2024)
by: Sobhani, Dominic, et al.
Published: (2024)
Extremely Greedy Equivalence Search
by: Nazaret, Achille, et al.
Published: (2025)
by: Nazaret, Achille, et al.
Published: (2025)
Treeffuser: Probabilistic Predictions via Conditional Diffusions with Gradient-Boosted Trees
by: Beltran-Velez, Nicolas, et al.
Published: (2024)
by: Beltran-Velez, Nicolas, et al.
Published: (2024)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
by: Karlekar, Sweta, et al.
Published: (2026)
by: Karlekar, Sweta, et al.
Published: (2026)
Hypothesis Testing the Circuit Hypothesis in LLMs
by: Shi, Claudia, et al.
Published: (2024)
by: Shi, Claudia, et al.
Published: (2024)
Stable Differentiable Causal Discovery
by: Nazaret, Achille, et al.
Published: (2023)
by: Nazaret, Achille, et al.
Published: (2023)
Data Augmentations for Improved (Large) Language Model Generalization
by: Feder, Amir, et al.
Published: (2023)
by: Feder, Amir, et al.
Published: (2023)
Estimating the Hallucination Rate of Generative AI
by: Jesson, Andrew, et al.
Published: (2024)
by: Jesson, Andrew, et al.
Published: (2024)
Can Generative AI Solve Your In-Context Learning Problem? A Martingale Perspective
by: Jesson, Andrew, et al.
Published: (2024)
by: Jesson, Andrew, et al.
Published: (2024)
Sparse Autoencoders are Topic Models
by: Girrbach, Leander, et al.
Published: (2025)
by: Girrbach, Leander, et al.
Published: (2025)
Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders
by: Lehn-Schiøler, William, et al.
Published: (2026)
by: Lehn-Schiøler, William, et al.
Published: (2026)
Enabling Precise Topic Alignment in Large Language Models Via Sparse Autoencoders
by: Joshi, Ananya, et al.
Published: (2025)
by: Joshi, Ananya, et al.
Published: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
by: Tolooshams, Bahareh, et al.
Published: (2025)
by: Tolooshams, Bahareh, et al.
Published: (2025)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
by: Wang, Xu, et al.
Published: (2026)
by: Wang, Xu, et al.
Published: (2026)
Identifiable Deep Generative Models via Sparse Decoding
by: Moran, Gemma E., et al.
Published: (2021)
by: Moran, Gemma E., et al.
Published: (2021)
Estimating Wage Disparities Using Foundation Models
by: Vafa, Keyon, et al.
Published: (2024)
by: Vafa, Keyon, et al.
Published: (2024)
Mechanistic Interpretability of ASR models using Sparse Autoencoders
by: Pluth, Dan, et al.
Published: (2026)
by: Pluth, Dan, et al.
Published: (2026)
Exploring the Learning Capabilities of Language Models using LEVERWORLDS
by: Wagner, Eitan, et al.
Published: (2024)
by: Wagner, Eitan, et al.
Published: (2024)
Enhancing Modern Supervised Word Sense Disambiguation Models by Semantic Lexical Resources
by: Melacci, Stefano, et al.
Published: (2024)
by: Melacci, Stefano, et al.
Published: (2024)
Group Equivariance Meets Mechanistic Interpretability: Equivariant Sparse Autoencoders
by: Erdogan, Ege, et al.
Published: (2025)
by: Erdogan, Ege, et al.
Published: (2025)
Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders
by: Tahimic, Kriz, et al.
Published: (2025)
by: Tahimic, Kriz, et al.
Published: (2025)
Robust Representation Learning through Explicit Environment Modeling
by: Slavutsky, Yuli, et al.
Published: (2026)
by: Slavutsky, Yuli, et al.
Published: (2026)
Systems Toxicology of Bisphenol A: Mechanistic Overlap in Metabolic and Reproductive Disruption
by: Sweta Bhardwaj, et al.
Published: (2026)
by: Sweta Bhardwaj, et al.
Published: (2026)
A Bayesian Model of Underreporting for Sexual Assault on College Campuses
by: Bradshaw, Casey, et al.
Published: (2024)
by: Bradshaw, Casey, et al.
Published: (2024)
Interpretable Reward Model via Sparse Autoencoder
by: Zhang, Shuyi, et al.
Published: (2025)
by: Zhang, Shuyi, et al.
Published: (2025)
Hierarchical Causal Models
by: Weinstein, Eli N., et al.
Published: (2024)
by: Weinstein, Eli N., et al.
Published: (2024)
Sparse Autoencoders Bridge The Deep Learning Model and The Brain
by: Mao, Ziming, et al.
Published: (2025)
by: Mao, Ziming, et al.
Published: (2025)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
by: Shi, Wei, et al.
Published: (2025)
by: Shi, Wei, et al.
Published: (2025)
CWTM: Leveraging Contextualized Word Embeddings from BERT for Neural Topic Modeling
by: Fang, Zheng, et al.
Published: (2023)
by: Fang, Zheng, et al.
Published: (2023)
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
by: Minegishi, Gouki, et al.
Published: (2025)
by: Minegishi, Gouki, et al.
Published: (2025)
Resurrecting the Salmon: Rethinking Mechanistic Interpretability with Domain-Specific Sparse Autoencoders
by: O'Neill, Charles, et al.
Published: (2025)
by: O'Neill, Charles, et al.
Published: (2025)
Sparse Autoencoders Make Audio Foundation Models more Explainable
by: Mariotte, Théo, et al.
Published: (2025)
by: Mariotte, Théo, et al.
Published: (2025)
Route Sparse Autoencoder to Interpret Large Language Models
by: Shi, Wei, et al.
Published: (2025)
by: Shi, Wei, et al.
Published: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
by: Cho, Hakaze, et al.
Published: (2025)
by: Cho, Hakaze, et al.
Published: (2025)
Topic Modeling and Word Sense Disambiguation on the Ancora corpus
by: Rubén Izquierdo
Published: (2015)
by: Rubén Izquierdo
Published: (2015)
Steering Language Model Refusal with Sparse Autoencoders
by: O'Brien, Kyle, et al.
Published: (2024)
by: O'Brien, Kyle, et al.
Published: (2024)
SALVE: Sparse Autoencoder-Latent Vector Editing for Mechanistic Control of Neural Networks
by: Flovik, Vegard
Published: (2025)
by: Flovik, Vegard
Published: (2025)
Input Adaptive Bayesian Model Averaging
by: Slavutsky, Yuli, et al.
Published: (2025)
by: Slavutsky, Yuli, et al.
Published: (2025)
Neural Generalized Mixed-Effects Models
by: Slavutsky, Yuli, et al.
Published: (2026)
by: Slavutsky, Yuli, et al.
Published: (2026)
Wrist Photoplethysmography Predicts Dietary Information
by: Verrier, Kyle, et al.
Published: (2025)
by: Verrier, Kyle, et al.
Published: (2025)
Similar Items
-
Multi-environment Topic Models
by: Sobhani, Dominic, et al.
Published: (2024) -
Extremely Greedy Equivalence Search
by: Nazaret, Achille, et al.
Published: (2025) -
Treeffuser: Probabilistic Predictions via Conditional Diffusions with Gradient-Boosted Trees
by: Beltran-Velez, Nicolas, et al.
Published: (2024) -
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
by: Karlekar, Sweta, et al.
Published: (2026) -
Hypothesis Testing the Circuit Hypothesis in LLMs
by: Shi, Claudia, et al.
Published: (2024)