Linearity of Relation Decoding in Transformer Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hernandez, Evan, Sharma, Arnab Sen, Haklay, Tal, Meng, Kevin, Wattenberg, Martin, Andreas, Jacob, Belinkov, Yonatan, Bau, David |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Position-aware Automatic Circuit Discovery
par: Haklay, Tal, et autres
Publié: (2025)
par: Haklay, Tal, et autres
Publié: (2025)
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
par: Prakash, Nikhil, et autres
Publié: (2024)
par: Prakash, Nikhil, et autres
Publié: (2024)
Language Models use Lookbacks to Track Beliefs
par: Prakash, Nikhil, et autres
Publié: (2025)
par: Prakash, Nikhil, et autres
Publié: (2025)
Locating and Editing Factual Associations in Mamba
par: Sharma, Arnab Sen, et autres
Publié: (2024)
par: Sharma, Arnab Sen, et autres
Publié: (2024)
REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space
par: Ashuach, Tomer, et autres
Publié: (2024)
par: Ashuach, Tomer, et autres
Publié: (2024)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
par: Marks, Samuel, et autres
Publié: (2024)
par: Marks, Samuel, et autres
Publié: (2024)
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
par: Orgad, Hadas, et autres
Publié: (2026)
par: Orgad, Hadas, et autres
Publié: (2026)
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models
par: Yu, Zeping, et autres
Publié: (2025)
par: Yu, Zeping, et autres
Publié: (2025)
ContraSim -- Analyzing Neural Representations Based on Contrastive Learning
par: Rahamim, Adir, et autres
Publié: (2023)
par: Rahamim, Adir, et autres
Publié: (2023)
Function Vectors in Large Language Models
par: Todd, Eric, et autres
Publié: (2023)
par: Todd, Eric, et autres
Publié: (2023)
Decomposing Query-Key Feature Interactions Using Contrastive Covariances
par: Lee, Andrew, et autres
Publié: (2026)
par: Lee, Andrew, et autres
Publié: (2026)
Measuring and Controlling Instruction (In)Stability in Language Model Dialogs
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
Backward Lens: Projecting Language Model Gradients into the Vocabulary Space
par: Katz, Shahar, et autres
Publié: (2024)
par: Katz, Shahar, et autres
Publié: (2024)
Elucidating Mechanisms of Demographic Bias in LLMs for Healthcare
par: Ahsan, Hiba, et autres
Publié: (2025)
par: Ahsan, Hiba, et autres
Publié: (2025)
Pitfalls in Evaluating Interpretability Agents
par: Haklay, Tal, et autres
Publié: (2026)
par: Haklay, Tal, et autres
Publié: (2026)
Arithmetic Without Algorithms: Language Models Solve Math With a Bag of Heuristics
par: Nikankin, Yaniv, et autres
Publié: (2024)
par: Nikankin, Yaniv, et autres
Publié: (2024)
Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms
par: Hanna, Michael, et autres
Publié: (2024)
par: Hanna, Michael, et autres
Publié: (2024)
Inspecting and Editing Knowledge Representations in Language Models
par: Hernandez, Evan, et autres
Publié: (2023)
par: Hernandez, Evan, et autres
Publié: (2023)
Concept-Best-Matching: Evaluating Compositionality in Emergent Communication
par: Carmeli, Boaz, et autres
Publié: (2024)
par: Carmeli, Boaz, et autres
Publié: (2024)
Linear Relational Decoding of Morphology in Language Models
par: Xia, Eric, et autres
Publié: (2025)
par: Xia, Eric, et autres
Publié: (2025)
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022)
par: Li, Kenneth, et autres
Publié: (2022)
ReFACT: Updating Text-to-Image Models by Editing the Text Encoder
par: Arad, Dana, et autres
Publié: (2023)
par: Arad, Dana, et autres
Publié: (2023)
Are formal and functional linguistic mechanisms dissociated in language models?
par: Hanna, Michael, et autres
Publié: (2025)
par: Hanna, Michael, et autres
Publié: (2025)
Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps
par: Tutek, Martin, et autres
Publié: (2025)
par: Tutek, Martin, et autres
Publié: (2025)
SAEs Are Good for Steering -- If You Select the Right Features
par: Arad, Dana, et autres
Publié: (2025)
par: Arad, Dana, et autres
Publié: (2025)
Leveraging Prototypical Representations for Mitigating Social Bias without Demographic Information
par: Iskander, Shadi, et autres
Publié: (2024)
par: Iskander, Shadi, et autres
Publié: (2024)
Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs
par: Itzhak, Itay, et autres
Publié: (2025)
par: Itzhak, Itay, et autres
Publié: (2025)
Reasoning Models Know What's Important, and Encode It in Their Activations
par: Nikankin, Yaniv, et autres
Publié: (2026)
par: Nikankin, Yaniv, et autres
Publié: (2026)
DEPTH: Discourse Education through Pre-Training Hierarchically
par: Bamberger, Zachary, et autres
Publié: (2024)
par: Bamberger, Zachary, et autres
Publié: (2024)
Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models
par: Kaplan, Guy, et autres
Publié: (2025)
par: Kaplan, Guy, et autres
Publié: (2025)
Unified Concept Editing in Diffusion Models
par: Gandikota, Rohit, et autres
Publié: (2023)
par: Gandikota, Rohit, et autres
Publié: (2023)
Fast Forwarding Low-Rank Training
par: Rahamim, Adir, et autres
Publié: (2024)
par: Rahamim, Adir, et autres
Publié: (2024)
Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer
par: Shao, Shun, et autres
Publié: (2026)
par: Shao, Shun, et autres
Publié: (2026)
Shared Global and Local Geometry of Language Model Embeddings
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Growing a Tail: Increasing Output Diversity in Large Language Models
par: Shur-Ofry, Michal, et autres
Publié: (2024)
par: Shur-Ofry, Michal, et autres
Publié: (2024)
Confidence Regulation Neurons in Language Models
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Distinguishing Ignorance from Error in LLM Hallucinations
par: Simhi, Adi, et autres
Publié: (2024)
par: Simhi, Adi, et autres
Publié: (2024)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
par: Simhi, Adi, et autres
Publié: (2024)
par: Simhi, Adi, et autres
Publié: (2024)
Findings of the BlackboxNLP 2025 Shared Task: Localizing Circuits and Causal Variables in Language Models
par: Arad, Dana, et autres
Publié: (2025)
par: Arad, Dana, et autres
Publié: (2025)
Will it Merge? On The Causes of Model Mergeability
par: Rahamim, Adir, et autres
Publié: (2026)
par: Rahamim, Adir, et autres
Publié: (2026)
Documents similaires
-
Position-aware Automatic Circuit Discovery
par: Haklay, Tal, et autres
Publié: (2025) -
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
par: Prakash, Nikhil, et autres
Publié: (2024) -
Language Models use Lookbacks to Track Beliefs
par: Prakash, Nikhil, et autres
Publié: (2025) -
Locating and Editing Factual Associations in Mamba
par: Sharma, Arnab Sen, et autres
Publié: (2024) -
REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space
par: Ashuach, Tomer, et autres
Publié: (2024)