Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Dumas, Clément, Wendler, Chris, Veselovsky, Veniamin, Monea, Giovanni, West, Robert |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
por: Wendler, Chris, et al.
Publicado: (2024)
por: Wendler, Chris, et al.
Publicado: (2024)
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
por: Veselovsky, Veniamin, et al.
Publicado: (2025)
por: Veselovsky, Veniamin, et al.
Publicado: (2025)
Controllable Context Sensitivity and the Knob Behind It
por: Minder, Julian, et al.
Publicado: (2024)
por: Minder, Julian, et al.
Publicado: (2024)
Self-Recognition in Language Models
por: Davidson, Tim R., et al.
Publicado: (2024)
por: Davidson, Tim R., et al.
Publicado: (2024)
What is a Number, That a Large Language Model May Know It?
por: Marjieh, Raja, et al.
Publicado: (2025)
por: Marjieh, Raja, et al.
Publicado: (2025)
Evaluating Language Model Agency through Negotiations
por: Davidson, Tim R., et al.
Publicado: (2024)
por: Davidson, Tim R., et al.
Publicado: (2024)
Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
por: Minder, Julian, et al.
Publicado: (2025)
por: Minder, Julian, et al.
Publicado: (2025)
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
por: Zhang, Liyi, et al.
Publicado: (2025)
por: Zhang, Liyi, et al.
Publicado: (2025)
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
por: Monea, Giovanni, et al.
Publicado: (2023)
por: Monea, Giovanni, et al.
Publicado: (2023)
LLMs Are In-Context Bandit Reinforcement Learners
por: Monea, Giovanni, et al.
Publicado: (2024)
por: Monea, Giovanni, et al.
Publicado: (2024)
From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers
por: Su, Jingtong, et al.
Publicado: (2025)
por: Su, Jingtong, et al.
Publicado: (2025)
Activation Scaling for Steering and Interpreting Language Models
por: Stoehr, Niklas, et al.
Publicado: (2024)
por: Stoehr, Niklas, et al.
Publicado: (2024)
On the Tip of the Tongue: Analyzing Conceptual Representation in Large Language Models with Reverse-Dictionary Probe
por: Xu, Ningyu, et al.
Publicado: (2024)
por: Xu, Ningyu, et al.
Publicado: (2024)
Discovering Forbidden Topics in Language Models
por: Rager, Can, et al.
Publicado: (2025)
por: Rager, Can, et al.
Publicado: (2025)
Levels of Analysis for Large Language Models
por: Ku, Alexander Y., et al.
Publicado: (2025)
por: Ku, Alexander Y., et al.
Publicado: (2025)
Complexity Agnostic Recursive Decomposition of Thoughts
por: Qasim, Kaleem Ullah, et al.
Publicado: (2025)
por: Qasim, Kaleem Ullah, et al.
Publicado: (2025)
LLM-Agnostic Semantic Representation Attack
por: Lian, Jiawei, et al.
Publicado: (2026)
por: Lian, Jiawei, et al.
Publicado: (2026)
Can Separators Improve Chain-of-Thought Prompting?
por: Park, Yoonjeong, et al.
Publicado: (2024)
por: Park, Yoonjeong, et al.
Publicado: (2024)
Dissecting Persona-Driven Reasoning in Language Models via Activation Patching
por: Poonia, Ansh, et al.
Publicado: (2025)
por: Poonia, Ansh, et al.
Publicado: (2025)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
por: Zhang, Fred, et al.
Publicado: (2023)
por: Zhang, Fred, et al.
Publicado: (2023)
Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers
por: Karvonen, Adam, et al.
Publicado: (2025)
por: Karvonen, Adam, et al.
Publicado: (2025)
Internal states before wait modulate reasoning patterns
por: Troitskii, Dmitrii, et al.
Publicado: (2025)
por: Troitskii, Dmitrii, et al.
Publicado: (2025)
Language-Specific Representation of Emotion-Concept Knowledge Causally Supports Emotion Inference
por: Li, Ming, et al.
Publicado: (2023)
por: Li, Ming, et al.
Publicado: (2023)
Cross-model Transferability among Large Language Models on the Platonic Representations of Concepts
por: Huang, Youcheng, et al.
Publicado: (2025)
por: Huang, Youcheng, et al.
Publicado: (2025)
Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
por: Berg, Cameron, et al.
Publicado: (2026)
por: Berg, Cameron, et al.
Publicado: (2026)
Brittle Minds, Fixable Activations: Understanding Belief Representations in Language Models
por: Bortoletto, Matteo, et al.
Publicado: (2024)
por: Bortoletto, Matteo, et al.
Publicado: (2024)
General Purpose Verification for Chain of Thought Prompting
por: Vacareanu, Robert, et al.
Publicado: (2024)
por: Vacareanu, Robert, et al.
Publicado: (2024)
Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse Languages
por: Brinkmann, Jannik, et al.
Publicado: (2025)
por: Brinkmann, Jannik, et al.
Publicado: (2025)
Soft-Prompting with Graph-of-Thought for Multi-modal Representation Learning
por: Yang, Juncheng, et al.
Publicado: (2024)
por: Yang, Juncheng, et al.
Publicado: (2024)
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
por: Huang, Chenxi, et al.
Publicado: (2025)
por: Huang, Chenxi, et al.
Publicado: (2025)
Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
por: Slocum, Stewart, et al.
Publicado: (2025)
por: Slocum, Stewart, et al.
Publicado: (2025)
Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning
por: Minder, Julian, et al.
Publicado: (2025)
por: Minder, Julian, et al.
Publicado: (2025)
Autoregressive + Chain of Thought = Recurrent: Recurrence's Role in Language Models' Computability and a Revisit of Recurrent Transformer
por: Zhang, Xiang, et al.
Publicado: (2024)
por: Zhang, Xiang, et al.
Publicado: (2024)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
por: Kim, June-Woo, et al.
Publicado: (2025)
por: Kim, June-Woo, et al.
Publicado: (2025)
From Knowledge to Treatment: Large Language Model Assisted Biomedical Concept Representation for Drug Repurposing
por: Xiang, Chengrui, et al.
Publicado: (2025)
por: Xiang, Chengrui, et al.
Publicado: (2025)
Measuring the Depth of LLM Unlearning via Activation Patching
por: Lee, Jaeung, et al.
Publicado: (2026)
por: Lee, Jaeung, et al.
Publicado: (2026)
Modeling Language as a Sequence of Thoughts
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
Concept Lancet: Image Editing with Compositional Representation Transplant
por: Luo, Jinqi, et al.
Publicado: (2025)
por: Luo, Jinqi, et al.
Publicado: (2025)
CoT-BERT: Enhancing Unsupervised Sentence Representation through Chain-of-Thought
por: Zhang, Bowen, et al.
Publicado: (2023)
por: Zhang, Bowen, et al.
Publicado: (2023)
Emotion Concepts and their Function in a Large Language Model
por: Sofroniew, Nicholas, et al.
Publicado: (2026)
por: Sofroniew, Nicholas, et al.
Publicado: (2026)
Ejemplares similares
-
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
por: Wendler, Chris, et al.
Publicado: (2024) -
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
por: Veselovsky, Veniamin, et al.
Publicado: (2025) -
Controllable Context Sensitivity and the Knob Behind It
por: Minder, Julian, et al.
Publicado: (2024) -
Self-Recognition in Language Models
por: Davidson, Tim R., et al.
Publicado: (2024) -
What is a Number, That a Large Language Model May Know It?
por: Marjieh, Raja, et al.
Publicado: (2025)