From Directions to Regions: Decomposing Activations in Language Models via Local Geometry
Fuente:
arXiv
Salvato in:
| Autori principali: | Shafran, Or, Ronen, Shaked, Fahn, Omri, Ravfogel, Shauli, Geiger, Atticus, Geva, Mor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Constructing Interpretable Features from Compositional Neuron Groups
di: Shafran, Or, et al.
Pubblicazione: (2025)
di: Shafran, Or, et al.
Pubblicazione: (2025)
Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)
Intrinsic Test of Unlearning Using Parametric Knowledge Traces
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
di: Huang, Jing, et al.
Pubblicazione: (2024)
di: Huang, Jing, et al.
Pubblicazione: (2024)
Enhancing Automated Interpretability with Output-Centric Feature Descriptions
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)
Gumbel Counterfactual Generation From Language Models
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
Detecting (Un)answerability in Large Language Models with Linear Directions
di: Lavi, Maor Juliet, et al.
Pubblicazione: (2025)
di: Lavi, Maor Juliet, et al.
Pubblicazione: (2025)
BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models
di: Ben-Zaken, Elad, et al.
Pubblicazione: (2021)
di: Ben-Zaken, Elad, et al.
Pubblicazione: (2021)
Emergence of Linear Truth Encodings in Language Models
di: Ravfogel, Shauli, et al.
Pubblicazione: (2025)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2025)
Estimating Knowledge in Large Language Models Without Generating a Single Token
di: Gottesman, Daniela, et al.
Pubblicazione: (2024)
di: Gottesman, Daniela, et al.
Pubblicazione: (2024)
Log-linear Guardedness and its Implications
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
Diversity Over Quantity: A Lesson From Few Shot Relation Classification
di: Cohen, Amir DN, et al.
Pubblicazione: (2024)
di: Cohen, Amir DN, et al.
Pubblicazione: (2024)
Geometric Factual Recall in Transformers
di: Ravfogel, Shauli, et al.
Pubblicazione: (2026)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2026)
Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models
di: Yona, Itay, et al.
Pubblicazione: (2026)
di: Yona, Itay, et al.
Pubblicazione: (2026)
Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?
di: Yona, Gal, et al.
Pubblicazione: (2024)
di: Yona, Gal, et al.
Pubblicazione: (2024)
RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context
di: Petty, Jackson, et al.
Pubblicazione: (2025)
di: Petty, Jackson, et al.
Pubblicazione: (2025)
Routers Learn the Geometry of Their Experts: Geometric Coupling in Sparse Mixture-of-Experts
di: Ahrac, Sagi, et al.
Pubblicazione: (2026)
di: Ahrac, Sagi, et al.
Pubblicazione: (2026)
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
A Practical Method for Generating String Counterfactuals
di: Avitan, Matan, et al.
Pubblicazione: (2024)
di: Avitan, Matan, et al.
Pubblicazione: (2024)
From Loops to Oops: Fallback Behaviors of Language Models Under Uncertainty
di: Ivgi, Maor, et al.
Pubblicazione: (2024)
di: Ivgi, Maor, et al.
Pubblicazione: (2024)
Kernelized Concept Erasure
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
State over Tokens: Characterizing the Role of Reasoning Tokens
di: Levy, Mosh, et al.
Pubblicazione: (2025)
di: Levy, Mosh, et al.
Pubblicazione: (2025)
Linear Adversarial Concept Erasure
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
Inferring Functionality of Attention Heads from their Parameters
di: Elhelo, Amit, et al.
Pubblicazione: (2024)
di: Elhelo, Amit, et al.
Pubblicazione: (2024)
The Role of Language Imbalance in Cross-lingual Generalisation: Insights from Cloned Language Experiments
di: Schäfer, Anton, et al.
Pubblicazione: (2024)
di: Schäfer, Anton, et al.
Pubblicazione: (2024)
The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasure
di: Fan, Yu, et al.
Pubblicazione: (2025)
di: Fan, Yu, et al.
Pubblicazione: (2025)
Beyond Single Embeddings: Capturing Diverse Targets with Multi-Query Retrieval
di: Chen, Hung-Ting, et al.
Pubblicazione: (2025)
di: Chen, Hung-Ting, et al.
Pubblicazione: (2025)
Pretrained LLMs Learn Multiple Types of Uncertainty
di: Cohen, Roi, et al.
Pubblicazione: (2025)
di: Cohen, Roi, et al.
Pubblicazione: (2025)
Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models
di: Cohen, Ido, et al.
Pubblicazione: (2024)
di: Cohen, Ido, et al.
Pubblicazione: (2024)
IQ Test for LLMs: An Evaluation Framework for Uncovering Core Skills in LLMs
di: Maimon, Aviya, et al.
Pubblicazione: (2025)
di: Maimon, Aviya, et al.
Pubblicazione: (2025)
Indications of Belief-Guided Agency and Meta-Cognitive Monitoring in Large Language Models
di: Yalon, Noam Steinmetz, et al.
Pubblicazione: (2026)
di: Yalon, Noam Steinmetz, et al.
Pubblicazione: (2026)
Linguistic Binding in Diffusion Models: Enhancing Attribute Correspondence through Attention Map Alignment
di: Rassin, Royi, et al.
Pubblicazione: (2023)
di: Rassin, Royi, et al.
Pubblicazione: (2023)
Do Large Language Models Latently Perform Multi-Hop Reasoning?
di: Yang, Sohee, et al.
Pubblicazione: (2024)
di: Yang, Sohee, et al.
Pubblicazione: (2024)
Hallucinations Undermine Trust; Metacognition is a Way Forward
di: Yona, Gal, et al.
Pubblicazione: (2026)
di: Yona, Gal, et al.
Pubblicazione: (2026)
Eliciting Textual Descriptions from Representations of Continuous Prompts
di: Ramati, Dana, et al.
Pubblicazione: (2024)
di: Ramati, Dana, et al.
Pubblicazione: (2024)
Narrowing the Knowledge Evaluation Gap: Open-Domain Question Answering with Multi-Granularity Answers
di: Yona, Gal, et al.
Pubblicazione: (2024)
di: Yona, Gal, et al.
Pubblicazione: (2024)
Backward Lens: Projecting Language Model Gradients into the Vocabulary Space
di: Katz, Shahar, et al.
Pubblicazione: (2024)
di: Katz, Shahar, et al.
Pubblicazione: (2024)
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
di: Biran, Eden, et al.
Pubblicazione: (2024)
di: Biran, Eden, et al.
Pubblicazione: (2024)
Precise In-Parameter Concept Erasure in Large Language Models
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)
Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?
di: Yang, Sohee, et al.
Pubblicazione: (2024)
di: Yang, Sohee, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Constructing Interpretable Features from Compositional Neuron Groups
di: Shafran, Or, et al.
Pubblicazione: (2025) -
Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025) -
Intrinsic Test of Unlearning Using Parametric Knowledge Traces
di: Hong, Yihuai, et al.
Pubblicazione: (2024) -
RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
di: Huang, Jing, et al.
Pubblicazione: (2024) -
Enhancing Automated Interpretability with Output-Centric Feature Descriptions
di: Gur-Arieh, Yoav, et al.
Pubblicazione: (2025)