On the Non-Identifiability of Steering Vectors in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Venkatesh, Sohan, Kurapath, Ashish Mahendran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large Language Models are Algorithmically Blind
par: Venkatesh, Sohan, et autres
Publié: (2026)
par: Venkatesh, Sohan, et autres
Publié: (2026)
Understanding Reasoning in Thinking Language Models via Steering Vectors
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
Steering Large Language Model Activations in Sparse Spaces
par: Bayat, Reza, et autres
Publié: (2025)
par: Bayat, Reza, et autres
Publié: (2025)
Dialz: A Python Toolkit for Steering Vectors
par: Siddique, Zara, et autres
Publié: (2025)
par: Siddique, Zara, et autres
Publié: (2025)
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
par: Hedström, Anna, et autres
Publié: (2025)
par: Hedström, Anna, et autres
Publié: (2025)
Generating Realistic Tabular Data with Large Language Models
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Discovering Reinforcement Learning Interfaces with Large Language Models
par: Jaswal, Akshat Singh, et autres
Publié: (2026)
par: Jaswal, Akshat Singh, et autres
Publié: (2026)
Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations
par: Braun, Joschka
Publié: (2026)
par: Braun, Joschka
Publié: (2026)
Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models
par: Ngo, Giang, et autres
Publié: (2026)
par: Ngo, Giang, et autres
Publié: (2026)
Steering Large Language Models for Machine Translation Personalization
par: Scalena, Daniel, et autres
Publié: (2025)
par: Scalena, Daniel, et autres
Publié: (2025)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
par: Wu, Jialin, et autres
Publié: (2026)
par: Wu, Jialin, et autres
Publié: (2026)
SPaCe: Unlocking Sample-Efficient Large Language Models Training With Self-Pace Curriculum Learning
par: Do, Dai, et autres
Publié: (2025)
par: Do, Dai, et autres
Publié: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
par: Sharma, Kartik, et autres
Publié: (2026)
par: Sharma, Kartik, et autres
Publié: (2026)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
par: Wang, Anyi, et autres
Publié: (2025)
par: Wang, Anyi, et autres
Publié: (2025)
MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering
par: Ding, Chenlu, et autres
Publié: (2025)
par: Ding, Chenlu, et autres
Publié: (2025)
Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
par: Wang, Mingze, et autres
Publié: (2026)
par: Wang, Mingze, et autres
Publié: (2026)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
par: Weng, Zixuan, et autres
Publié: (2026)
par: Weng, Zixuan, et autres
Publié: (2026)
Large Language Models for Imbalanced Classification: Diversity makes the difference
par: Nguyen, Dang, et autres
Publié: (2025)
par: Nguyen, Dang, et autres
Publié: (2025)
Steered LLM Activations are Non-Surjective
par: Mishra, Aayush, et autres
Publié: (2026)
par: Mishra, Aayush, et autres
Publié: (2026)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
par: Dunefsky, Jacob, et autres
Publié: (2025)
par: Dunefsky, Jacob, et autres
Publié: (2025)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
par: Han, Pengrui, et autres
Publié: (2026)
par: Han, Pengrui, et autres
Publié: (2026)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
par: Anand, Nikhil, et autres
Publié: (2026)
par: Anand, Nikhil, et autres
Publié: (2026)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
par: Scalena, Daniel, et autres
Publié: (2024)
par: Scalena, Daniel, et autres
Publié: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
par: Soo, Samuel, et autres
Publié: (2025)
par: Soo, Samuel, et autres
Publié: (2025)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models
par: Meng, Fanxu, et autres
Publié: (2024)
par: Meng, Fanxu, et autres
Publié: (2024)
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling
par: Yue, Yuxuan, et autres
Publié: (2025)
par: Yue, Yuxuan, et autres
Publié: (2025)
MidSteer: Optimal Affine Framework for Steering Generative Models
par: Gaintseva, Tatiana, et autres
Publié: (2026)
par: Gaintseva, Tatiana, et autres
Publié: (2026)
Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
par: Raza, Ali, et autres
Publié: (2026)
par: Raza, Ali, et autres
Publié: (2026)
Word Embeddings Are Steers for Language Models
par: Han, Chi, et autres
Publié: (2023)
par: Han, Chi, et autres
Publié: (2023)
Enhancing Large Language Models for Time-Series Forecasting via Vector-Injected In-Context Learning
par: Zhang, Jianqi, et autres
Publié: (2026)
par: Zhang, Jianqi, et autres
Publié: (2026)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
par: Siddique, Zara, et autres
Publié: (2025)
par: Siddique, Zara, et autres
Publié: (2025)
Endogenous Resistance to Activation Steering in Language Models
par: McKenzie, Alex, et autres
Publié: (2026)
par: McKenzie, Alex, et autres
Publié: (2026)
Pruning Large Language Models by Identifying and Preserving Functional Networks
par: Liu, Yiheng, et autres
Publié: (2025)
par: Liu, Yiheng, et autres
Publié: (2025)
Automating Steering for Safe Multimodal Large Language Models
par: Wu, Lyucheng, et autres
Publié: (2025)
par: Wu, Lyucheng, et autres
Publié: (2025)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
par: Qu, Yun, et autres
Publié: (2026)
par: Qu, Yun, et autres
Publié: (2026)
Model-Based Reinforcement Learning Under Confounding
par: Venkatesh, Nishanth, et autres
Publié: (2025)
par: Venkatesh, Nishanth, et autres
Publié: (2025)
On the Reasoning Abilities of Masked Diffusion Language Models
par: Svete, Anej, et autres
Publié: (2025)
par: Svete, Anej, et autres
Publié: (2025)
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
par: Xu, Zukang, et autres
Publié: (2026)
par: Xu, Zukang, et autres
Publié: (2026)
Documents similaires
-
Large Language Models are Algorithmically Blind
par: Venkatesh, Sohan, et autres
Publié: (2026) -
Understanding Reasoning in Thinking Language Models via Steering Vectors
par: Venhoff, Constantin, et autres
Publié: (2025) -
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026) -
Steering Large Language Model Activations in Sparse Spaces
par: Bayat, Reza, et autres
Publié: (2025) -
Dialz: A Python Toolkit for Steering Vectors
par: Siddique, Zara, et autres
Publié: (2025)