RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Jing, Wu, Zhengxuan, Potts, Christopher, Geva, Mor, Geiger, Atticus |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Constructing Interpretable Features from Compositional Neuron Groups
por: Shafran, Or, et al.
Publicado: (2025)
por: Shafran, Or, et al.
Publicado: (2025)
ReFT: Representation Finetuning for Language Models
por: Wu, Zhengxuan, et al.
Publicado: (2024)
por: Wu, Zhengxuan, et al.
Publicado: (2024)
A Reply to Makelov et al. (2023)'s "Interpretability Illusion" Arguments
por: Wu, Zhengxuan, et al.
Publicado: (2024)
por: Wu, Zhengxuan, et al.
Publicado: (2024)
pyvene: A Library for Understanding and Improving PyTorch Models via Interventions
por: Wu, Zhengxuan, et al.
Publicado: (2024)
por: Wu, Zhengxuan, et al.
Publicado: (2024)
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context
por: Gur-Arieh, Yoav, et al.
Publicado: (2025)
por: Gur-Arieh, Yoav, et al.
Publicado: (2025)
ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning
por: She, Jingyuan Selena, et al.
Publicado: (2023)
por: She, Jingyuan Selena, et al.
Publicado: (2023)
Interpretability at Scale: Identifying Causal Mechanisms in Alpaca
por: Wu, Zhengxuan, et al.
Publicado: (2023)
por: Wu, Zhengxuan, et al.
Publicado: (2023)
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders
por: Wu, Zhengxuan, et al.
Publicado: (2025)
por: Wu, Zhengxuan, et al.
Publicado: (2025)
HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Enhancing Automated Interpretability with Output-Centric Feature Descriptions
por: Gur-Arieh, Yoav, et al.
Publicado: (2025)
por: Gur-Arieh, Yoav, et al.
Publicado: (2025)
From Directions to Regions: Decomposing Activations in Language Models via Local Geometry
por: Shafran, Or, et al.
Publicado: (2026)
por: Shafran, Or, et al.
Publicado: (2026)
Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
por: Ghandeharioun, Asma, et al.
Publicado: (2024)
por: Ghandeharioun, Asma, et al.
Publicado: (2024)
How Do Transformers Learn Variable Binding in Symbolic Programs?
por: Wu, Yiwei, et al.
Publicado: (2025)
por: Wu, Yiwei, et al.
Publicado: (2025)
Evaluating Open-Source Sparse Autoencoders on Disentangling Factual Knowledge in GPT-2 Small
por: Chaudhary, Maheep, et al.
Publicado: (2024)
por: Chaudhary, Maheep, et al.
Publicado: (2024)
Demystifying Verbatim Memorization in Large Language Models
por: Huang, Jing, et al.
Publicado: (2024)
por: Huang, Jing, et al.
Publicado: (2024)
Backward Lens: Projecting Language Model Gradients into the Vocabulary Space
por: Katz, Shahar, et al.
Publicado: (2024)
por: Katz, Shahar, et al.
Publicado: (2024)
Routers Learn the Geometry of Their Experts: Geometric Coupling in Sparse Mixture-of-Experts
por: Ahrac, Sagi, et al.
Publicado: (2026)
por: Ahrac, Sagi, et al.
Publicado: (2026)
Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations
por: Csordás, Róbert, et al.
Publicado: (2024)
por: Csordás, Róbert, et al.
Publicado: (2024)
Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
por: Boppana, Siddharth, et al.
Publicado: (2026)
por: Boppana, Siddharth, et al.
Publicado: (2026)
How Causal Abstraction Underpins Computational Explanation
por: Geiger, Atticus, et al.
Publicado: (2025)
por: Geiger, Atticus, et al.
Publicado: (2025)
ReCOGS: How Incidental Details of a Logical Form Overshadow an Evaluation of Semantic Interpretation
por: Wu, Zhengxuan, et al.
Publicado: (2023)
por: Wu, Zhengxuan, et al.
Publicado: (2023)
Improved Representation Steering for Language Models
por: Wu, Zhengxuan, et al.
Publicado: (2025)
por: Wu, Zhengxuan, et al.
Publicado: (2025)
Language Models Encode Numbers Using Digit Representations in Base 10
por: Levy, Amit Arnold, et al.
Publicado: (2024)
por: Levy, Amit Arnold, et al.
Publicado: (2024)
Activation Steering via Generative Causal Mediation
por: Sankaranarayanan, Aruna, et al.
Publicado: (2026)
por: Sankaranarayanan, Aruna, et al.
Publicado: (2026)
InnerThoughts: Disentangling Representations and Predictions in Large Language Models
por: Chételat, Didier, et al.
Publicado: (2025)
por: Chételat, Didier, et al.
Publicado: (2025)
Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations
por: Geiger, Atticus, et al.
Publicado: (2023)
por: Geiger, Atticus, et al.
Publicado: (2023)
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
por: Huang, Jing, et al.
Publicado: (2025)
por: Huang, Jing, et al.
Publicado: (2025)
Disentangled Representation Learning with Large Language Models for Text-Attributed Graphs
por: Qin, Yijian, et al.
Publicado: (2023)
por: Qin, Yijian, et al.
Publicado: (2023)
Don't Blame the Annotator: Bias Already Starts in the Annotation Instructions
por: Parmar, Mihir, et al.
Publicado: (2022)
por: Parmar, Mihir, et al.
Publicado: (2022)
Estimating Knowledge in Large Language Models Without Generating a Single Token
por: Gottesman, Daniela, et al.
Publicado: (2024)
por: Gottesman, Daniela, et al.
Publicado: (2024)
Interpretable Discriminative Text Representations via Agreement and Label Disentanglement
por: Wang, Tong, et al.
Publicado: (2026)
por: Wang, Tong, et al.
Publicado: (2026)
Blackbox Model Provenance via Palimpsestic Membership Inference
por: Kuditipudi, Rohith, et al.
Publicado: (2025)
por: Kuditipudi, Rohith, et al.
Publicado: (2025)
Disentangling MLP Neuron Weights in Vocabulary Space
por: Avrahamy, Asaf, et al.
Publicado: (2026)
por: Avrahamy, Asaf, et al.
Publicado: (2026)
Towards Interpreting Visual Information Processing in Vision-Language Models
por: Neo, Clement, et al.
Publicado: (2024)
por: Neo, Clement, et al.
Publicado: (2024)
PreFT: Prefill-only finetuning for efficient inference
por: Lanpouthakoun, Andrew, et al.
Publicado: (2026)
por: Lanpouthakoun, Andrew, et al.
Publicado: (2026)
Mechanistically Interpretable Neural Encoding Reveals Fine-Grained Functional Selectivity in Human Visual Cortex
por: Grosbard, Idan Daniel, et al.
Publicado: (2026)
por: Grosbard, Idan Daniel, et al.
Publicado: (2026)
Evaluating Copyright Takedown Methods for Language Models
por: Wei, Boyi, et al.
Publicado: (2024)
por: Wei, Boyi, et al.
Publicado: (2024)
RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
When Can Transformers Count to n?
por: Yehudai, Gilad, et al.
Publicado: (2024)
por: Yehudai, Gilad, et al.
Publicado: (2024)
Ejemplares similares
-
Constructing Interpretable Features from Compositional Neuron Groups
por: Shafran, Or, et al.
Publicado: (2025) -
ReFT: Representation Finetuning for Language Models
por: Wu, Zhengxuan, et al.
Publicado: (2024) -
A Reply to Makelov et al. (2023)'s "Interpretability Illusion" Arguments
por: Wu, Zhengxuan, et al.
Publicado: (2024) -
pyvene: A Library for Understanding and Improving PyTorch Models via Interventions
por: Wu, Zhengxuan, et al.
Publicado: (2024) -
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)