Enregistré dans:
| Auteurs principaux: | Lubana, Ekdeep Singh, Rager, Can, Hindupur, Sai Sumedh R., Costa, Valerie, Tuckute, Greta, Patel, Oam, Murthy, Sonia Krishna, Fel, Thomas, Wurgaft, Daniel, Bigelow, Eric J., Lin, Johnny, Ba, Demba, Wattenberg, Martin, Viegas, Fernanda, Weber, Melanie, Mueller, Aaron |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.01836 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Projecting Assumptions: The Duality Between Sparse Autoencoders and Concept Geometry
par: Hindupur, Sai Sumedh R., et autres
Publié: (2025)
par: Hindupur, Sai Sumedh R., et autres
Publié: (2025)
From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit
par: Costa, Valérie, et autres
Publié: (2025)
par: Costa, Valérie, et autres
Publié: (2025)
Evaluating Sparse Autoencoders: From Shallow Design to Matching Pursuit
par: Costa, Valérie, et autres
Publié: (2025)
par: Costa, Valérie, et autres
Publié: (2025)
Sparse, self-organizing ensembles of local kernels detect rare statistical anomalies
par: Grosso, Gaia, et autres
Publié: (2025)
par: Grosso, Gaia, et autres
Publié: (2025)
Archetypal SAE: Adaptive and Stable Dictionary Learning for Concept Extraction in Large Vision Models
par: Fel, Thomas, et autres
Publié: (2025)
par: Fel, Thomas, et autres
Publié: (2025)
Clustering Inductive Biases with Unrolled Networks
par: Huml, Jonathan, et autres
Publié: (2023)
par: Huml, Jonathan, et autres
Publié: (2023)
Into the Rabbit Hull: From Task-Relevant Concepts in DINO to Minkowski Geometry
par: Fel, Thomas, et autres
Publié: (2025)
par: Fel, Thomas, et autres
Publié: (2025)
Do Sparse Autoencoders Capture Concept Manifolds?
par: Bhalla, Usha, et autres
Publié: (2026)
par: Bhalla, Usha, et autres
Publié: (2026)
Arithmetic in the Wild: Llama uses Base-10 Addition to Reason About Cyclic Concepts
par: Feucht, Sheridan, et autres
Publié: (2026)
par: Feucht, Sheridan, et autres
Publié: (2026)
Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering
par: Bigelow, Eric, et autres
Publié: (2025)
par: Bigelow, Eric, et autres
Publié: (2025)
Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior
par: Wurgaft, Daniel, et autres
Publié: (2026)
par: Wurgaft, Daniel, et autres
Publié: (2026)
Are language models aware of the road not taken? Token-level uncertainty and hidden state dynamics
par: Zur, Amir, et autres
Publié: (2025)
par: Zur, Amir, et autres
Publié: (2025)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
par: Bohacek, Matyas, et autres
Publié: (2025)
par: Bohacek, Matyas, et autres
Publié: (2025)
Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space
par: Bigelow, Eric, et autres
Publié: (2026)
par: Bigelow, Eric, et autres
Publié: (2026)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023)
par: Li, Kenneth, et autres
Publié: (2023)
The Shape of Beliefs: Geometry, Dynamics, and Interventions along Representation Manifolds of Language Models' Posteriors
par: Sarfati, Raphaël, et autres
Publié: (2026)
par: Sarfati, Raphaël, et autres
Publié: (2026)
In-Context Learning Strategies Emerge Rationally
par: Wurgaft, Daniel, et autres
Publié: (2025)
par: Wurgaft, Daniel, et autres
Publié: (2025)
In-Context Learning Dynamics with Random Binary Sequences
par: Bigelow, Eric J., et autres
Publié: (2023)
par: Bigelow, Eric J., et autres
Publié: (2023)
Model Connectomes: A Generational Approach to Data-Efficient Language Models
par: Kotar, Klemen, et autres
Publié: (2025)
par: Kotar, Klemen, et autres
Publié: (2025)
Block-Recurrent Dynamics in Vision Transformers
par: Jacobs, Mozes, et autres
Publié: (2025)
par: Jacobs, Mozes, et autres
Publié: (2025)
Emergence of Hierarchical Emotion Organization in Large Language Models
par: Zhao, Bo, et autres
Publié: (2025)
par: Zhao, Bo, et autres
Publié: (2025)
How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations
par: Jaipersaud, Brandon, et autres
Publié: (2025)
par: Jaipersaud, Brandon, et autres
Publié: (2025)
Abrupt Learning in Transformers: A Case Study on Matrix Completion
par: Gopalani, Pulkit, et autres
Publié: (2024)
par: Gopalani, Pulkit, et autres
Publié: (2024)
Relational Composition in Neural Networks: A Survey and Call to Action
par: Wattenberg, Martin, et autres
Publié: (2024)
par: Wattenberg, Martin, et autres
Publié: (2024)
From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts?
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
Topoformer: brain-like topographic organization in Transformer language models through spatial querying and reweighting
par: Binhuraib, Taha, et autres
Publié: (2025)
par: Binhuraib, Taha, et autres
Publié: (2025)
ICLR: In-Context Learning of Representations
par: Park, Core Francisco, et autres
Publié: (2024)
par: Park, Core Francisco, et autres
Publié: (2024)
What Does it Mean for a Neural Network to Learn a "World Model"?
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
Tensor Product Representation Probes Reveal Shared Structure Across Linear Directions
par: Lee, Andrew, et autres
Publié: (2026)
par: Lee, Andrew, et autres
Publié: (2026)
Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention
par: Huang, Jing, et autres
Publié: (2026)
par: Huang, Jing, et autres
Publié: (2026)
Towards Reliable Evaluation of Behavior Steering Interventions in LLMs
par: Pres, Itamar, et autres
Publié: (2024)
par: Pres, Itamar, et autres
Publié: (2024)
Analyzing (In)Abilities of SAEs via Formal Languages
par: Menon, Abhinav, et autres
Publié: (2024)
par: Menon, Abhinav, et autres
Publié: (2024)
Implicit Generative Modeling by Kernel Similarity Matching
par: Choudhary, Shubham, et autres
Publié: (2025)
par: Choudhary, Shubham, et autres
Publié: (2025)
Weighed l1 on the simplex: Compressive sensing meets locality
par: Tasissa, Abiy, et autres
Publié: (2021)
par: Tasissa, Abiy, et autres
Publié: (2021)
A Percolation Model of Emergence: Analyzing Transformers Trained on a Formal Language
par: Lubana, Ekdeep Singh, et autres
Publié: (2024)
par: Lubana, Ekdeep Singh, et autres
Publié: (2024)
Competition Dynamics Shape Algorithmic Phases of In-Context Learning
par: Park, Core Francisco, et autres
Publié: (2024)
par: Park, Core Francisco, et autres
Publié: (2024)
Compositional Abilities Emerge Multiplicatively: Exploring Diffusion Models on a Synthetic Task
par: Okawa, Maya, et autres
Publié: (2023)
par: Okawa, Maya, et autres
Publié: (2023)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
Decomposing Query-Key Feature Interactions Using Contrastive Covariances
par: Lee, Andrew, et autres
Publié: (2026)
par: Lee, Andrew, et autres
Publié: (2026)
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
Documents similaires
-
Projecting Assumptions: The Duality Between Sparse Autoencoders and Concept Geometry
par: Hindupur, Sai Sumedh R., et autres
Publié: (2025) -
From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit
par: Costa, Valérie, et autres
Publié: (2025) -
Evaluating Sparse Autoencoders: From Shallow Design to Matching Pursuit
par: Costa, Valérie, et autres
Publié: (2025) -
Sparse, self-organizing ensembles of local kernels detect rare statistical anomalies
par: Grosso, Gaia, et autres
Publié: (2025) -
Archetypal SAE: Adaptive and Stable Dictionary Learning for Concept Extraction in Large Vision Models
par: Fel, Thomas, et autres
Publié: (2025)