Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Simbeck, Katharina, Mahran, Mariam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models
por: Mahran, Mariam, et al.
Publicado: (2025)
por: Mahran, Mariam, et al.
Publicado: (2025)
Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs
por: Mahran, Mariam, et al.
Publicado: (2025)
por: Mahran, Mariam, et al.
Publicado: (2025)
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
por: Song, Xiangchen, et al.
Publicado: (2025)
por: Song, Xiangchen, et al.
Publicado: (2025)
The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research
por: Bai, Xiaoyan, et al.
Publicado: (2026)
por: Bai, Xiaoyan, et al.
Publicado: (2026)
Interpretable Graph-Language Modeling for Detecting Youth Illicit Drug Use
por: Li, Yiyang, et al.
Publicado: (2025)
por: Li, Yiyang, et al.
Publicado: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2025)
por: Cho, Hakaze, et al.
Publicado: (2025)
Regulation of Language Models With Interpretability Will Likely Result In A Performance Trade-Off
por: Kenny, Eoin M., et al.
Publicado: (2024)
por: Kenny, Eoin M., et al.
Publicado: (2024)
Resa: Transparent Reasoning Models via SAEs
por: Wang, Shangshang, et al.
Publicado: (2025)
por: Wang, Shangshang, et al.
Publicado: (2025)
Defining and Evaluating Physical Safety for Large Language Models
por: Tang, Yung-Chen, et al.
Publicado: (2024)
por: Tang, Yung-Chen, et al.
Publicado: (2024)
Building Interpretable Models for Moral Decision-Making
por: Goel, Mayank, et al.
Publicado: (2026)
por: Goel, Mayank, et al.
Publicado: (2026)
Evaluating Large Language Models for Fair and Reliable Organ Allocation
por: Kim, Brian Hyeongseok, et al.
Publicado: (2025)
por: Kim, Brian Hyeongseok, et al.
Publicado: (2025)
Existential Conversations with Large Language Models: Content, Community, and Culture
por: Shanahan, Murray, et al.
Publicado: (2024)
por: Shanahan, Murray, et al.
Publicado: (2024)
Leveraging Large Language Models for Tacit Knowledge Discovery in Organizational Contexts
por: Zuin, Gianlucca, et al.
Publicado: (2025)
por: Zuin, Gianlucca, et al.
Publicado: (2025)
Participatory Assessment of Large Language Model Applications in an Academic Medical Center
por: Carra, Giorgia, et al.
Publicado: (2024)
por: Carra, Giorgia, et al.
Publicado: (2024)
The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models
por: Ensign, Danielle, et al.
Publicado: (2025)
por: Ensign, Danielle, et al.
Publicado: (2025)
Correlated Errors in Large Language Models
por: Kim, Elliot, et al.
Publicado: (2025)
por: Kim, Elliot, et al.
Publicado: (2025)
Harnessing Large Language Models for Mental Health: Opportunities, Challenges, and Ethical Considerations
por: Pandey, Hari Mohan
Publicado: (2024)
por: Pandey, Hari Mohan
Publicado: (2024)
Hypothesis Generation with Large Language Models
por: Zhou, Yangqiaoyu, et al.
Publicado: (2024)
por: Zhou, Yangqiaoyu, et al.
Publicado: (2024)
Large Language Models are Geographically Biased
por: Manvi, Rohin, et al.
Publicado: (2024)
por: Manvi, Rohin, et al.
Publicado: (2024)
Machine Learners Should Acknowledge the Legal Implications of Large Language Models as Personal Data
por: Nolte, Henrik, et al.
Publicado: (2025)
por: Nolte, Henrik, et al.
Publicado: (2025)
Fairness-Aware Interpretable Modeling (FAIM) for Trustworthy Machine Learning in Healthcare
por: Liu, Mingxuan, et al.
Publicado: (2024)
por: Liu, Mingxuan, et al.
Publicado: (2024)
Interpretable Recognition of Cognitive Distortions in Natural Language Texts
por: Kolonin, Anton, et al.
Publicado: (2025)
por: Kolonin, Anton, et al.
Publicado: (2025)
Psychological Counseling Ability of Large Language Models
por: Peng, Fangyu, et al.
Publicado: (2025)
por: Peng, Fangyu, et al.
Publicado: (2025)
Assessing Large Language Models on Climate Information
por: Bulian, Jannis, et al.
Publicado: (2023)
por: Bulian, Jannis, et al.
Publicado: (2023)
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
por: Sehwag, Udari Madhushani, et al.
Publicado: (2025)
por: Sehwag, Udari Madhushani, et al.
Publicado: (2025)
Evaluating Retrieval-Augmented Generation Strategies for Large Language Models in Travel Mode Choice Prediction
por: Xu, Yiming, et al.
Publicado: (2025)
por: Xu, Yiming, et al.
Publicado: (2025)
Assessing Social Alignment: Do Personality-Prompted Large Language Models Behave Like Humans?
por: Zakazov, Ivan, et al.
Publicado: (2024)
por: Zakazov, Ivan, et al.
Publicado: (2024)
Survey on Plagiarism Detection in Large Language Models: The Impact of ChatGPT and Gemini on Academic Integrity
por: Pudasaini, Shushanta, et al.
Publicado: (2024)
por: Pudasaini, Shushanta, et al.
Publicado: (2024)
KnowledgeVIS: Interpreting Language Models by Comparing Fill-in-the-Blank Prompts
por: Coscia, Adam, et al.
Publicado: (2024)
por: Coscia, Adam, et al.
Publicado: (2024)
A Taxonomy of Stereotype Content in Large Language Models
por: Nicolas, Gandalf, et al.
Publicado: (2024)
por: Nicolas, Gandalf, et al.
Publicado: (2024)
Bias and Fairness in Large Language Models: A Survey
por: Gallegos, Isabel O., et al.
Publicado: (2023)
por: Gallegos, Isabel O., et al.
Publicado: (2023)
Transforming Agency. On the mode of existence of Large Language Models
por: Barandiaran, Xabier E., et al.
Publicado: (2024)
por: Barandiaran, Xabier E., et al.
Publicado: (2024)
LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models
por: Faiz, Ahmad, et al.
Publicado: (2023)
por: Faiz, Ahmad, et al.
Publicado: (2023)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
por: Heakl, Ahmed, et al.
Publicado: (2024)
por: Heakl, Ahmed, et al.
Publicado: (2024)
Transparent AI: The Case for Interpretability and Explainability
por: Ramachandram, Dhanesh, et al.
Publicado: (2025)
por: Ramachandram, Dhanesh, et al.
Publicado: (2025)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
por: Anwar, Usman, et al.
Publicado: (2024)
por: Anwar, Usman, et al.
Publicado: (2024)
Exploring Accuracy-Fairness Trade-off in Large Language Models
por: Zhang, Qingquan, et al.
Publicado: (2024)
por: Zhang, Qingquan, et al.
Publicado: (2024)
Are Large Language Models Chameleons? An Attempt to Simulate Social Surveys
por: Geng, Mingmeng, et al.
Publicado: (2024)
por: Geng, Mingmeng, et al.
Publicado: (2024)
iScore: Visual Analytics for Interpreting How Language Models Automatically Score Summaries
por: Coscia, Adam, et al.
Publicado: (2024)
por: Coscia, Adam, et al.
Publicado: (2024)
SAEs Are Good for Steering -- If You Select the Right Features
por: Arad, Dana, et al.
Publicado: (2025)
por: Arad, Dana, et al.
Publicado: (2025)
Ejemplares similares
-
GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models
por: Mahran, Mariam, et al.
Publicado: (2025) -
Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs
por: Mahran, Mariam, et al.
Publicado: (2025) -
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
por: Song, Xiangchen, et al.
Publicado: (2025) -
The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research
por: Bai, Xiaoyan, et al.
Publicado: (2026) -
Interpretable Graph-Language Modeling for Detecting Youth Illicit Drug Use
por: Li, Yiyang, et al.
Publicado: (2025)