To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hedström, Anna, Amoukou, Salim I., Bewley, Tom, Mishra, Saumitra, Veloso, Manuela |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ShapShift: Explaining Model Prediction Shifts with Subgroup Conditional Shapley Values
by: Bewley, Tom, et al.
Published: (2026)
by: Bewley, Tom, et al.
Published: (2026)
Entropic Projection Alignment: Estimating, Explaining, and Improving Model Performance Under Distribution Shift
by: Amoukou, Salim I., et al.
Published: (2026)
by: Amoukou, Salim I., et al.
Published: (2026)
Counterfactual Metarules for Local and Global Recourse
by: Bewley, Tom, et al.
Published: (2024)
by: Bewley, Tom, et al.
Published: (2024)
Interpreting Language Reward Models via Contrastive Explanations
by: Jiang, Junqi, et al.
Published: (2024)
by: Jiang, Junqi, et al.
Published: (2024)
Sequential Harmful Shift Detection Without Labels
by: Amoukou, Salim I., et al.
Published: (2024)
by: Amoukou, Salim I., et al.
Published: (2024)
Progressive Inference: Explaining Decoder-Only Sequence Classification Models Using Intermediate Predictions
by: Kariyappa, Sanjay, et al.
Published: (2024)
by: Kariyappa, Sanjay, et al.
Published: (2024)
Representation Consistency for Accurate and Coherent LLM Answer Aggregation
by: Jiang, Junqi, et al.
Published: (2025)
by: Jiang, Junqi, et al.
Published: (2025)
Regional Explanations: Bridging Local and Global Variable Importance
by: Amoukou, Salim I., et al.
Published: (2026)
by: Amoukou, Salim I., et al.
Published: (2026)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
by: Cheng, Stephen, et al.
Published: (2026)
by: Cheng, Stephen, et al.
Published: (2026)
Compositional Steering of Large Language Models with Steering Tokens
by: Radevski, Gorjan, et al.
Published: (2026)
by: Radevski, Gorjan, et al.
Published: (2026)
Steered LLM Activations are Non-Surjective
by: Mishra, Aayush, et al.
Published: (2026)
by: Mishra, Aayush, et al.
Published: (2026)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
by: Zhou, Hanhan, et al.
Published: (2026)
by: Zhou, Hanhan, et al.
Published: (2026)
MidSteer: Optimal Affine Framework for Steering Generative Models
by: Gaintseva, Tatiana, et al.
Published: (2026)
by: Gaintseva, Tatiana, et al.
Published: (2026)
Steering Large Language Model Activations in Sparse Spaces
by: Bayat, Reza, et al.
Published: (2025)
by: Bayat, Reza, et al.
Published: (2025)
On the Non-Identifiability of Steering Vectors in Large Language Models
by: Venkatesh, Sohan, et al.
Published: (2026)
by: Venkatesh, Sohan, et al.
Published: (2026)
Word Embeddings Are Steers for Language Models
by: Han, Chi, et al.
Published: (2023)
by: Han, Chi, et al.
Published: (2023)
BarrierSteer: LLM Safety via Learning Barrier Steering
by: Tran, Thanh Q., et al.
Published: (2026)
by: Tran, Thanh Q., et al.
Published: (2026)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
by: Sharma, Kartik, et al.
Published: (2026)
by: Sharma, Kartik, et al.
Published: (2026)
Understanding Reasoning in Thinking Language Models via Steering Vectors
by: Venhoff, Constantin, et al.
Published: (2025)
by: Venhoff, Constantin, et al.
Published: (2025)
Endogenous Resistance to Activation Steering in Language Models
by: McKenzie, Alex, et al.
Published: (2026)
by: McKenzie, Alex, et al.
Published: (2026)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
by: Weng, Zixuan, et al.
Published: (2026)
by: Weng, Zixuan, et al.
Published: (2026)
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
by: Yang, Jiaxi, et al.
Published: (2026)
by: Yang, Jiaxi, et al.
Published: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
by: Sun, Jiuding, et al.
Published: (2025)
by: Sun, Jiuding, et al.
Published: (2025)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
by: Jiang, Xinyan, et al.
Published: (2026)
by: Jiang, Xinyan, et al.
Published: (2026)
Steer Like the LLM: Activation Steering that Mimics Prompting
by: Heyman, Geert, et al.
Published: (2026)
by: Heyman, Geert, et al.
Published: (2026)
Steering Large Language Models for Machine Translation Personalization
by: Scalena, Daniel, et al.
Published: (2025)
by: Scalena, Daniel, et al.
Published: (2025)
Dynamically Scaled Activation Steering
by: Ferrando, Alex, et al.
Published: (2025)
by: Ferrando, Alex, et al.
Published: (2025)
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
by: Lamb, Tom A., et al.
Published: (2024)
by: Lamb, Tom A., et al.
Published: (2024)
CBMAS: Cognitive Behavioral Modeling via Activation Steering
by: Ismail, Ahmed H., et al.
Published: (2026)
by: Ismail, Ahmed H., et al.
Published: (2026)
Multi-Attribute Steering of Language Models via Targeted Intervention
by: Nguyen, Duy, et al.
Published: (2025)
by: Nguyen, Duy, et al.
Published: (2025)
Improving Instruction-Following in Language Models through Activation Steering
by: Stolfo, Alessandro, et al.
Published: (2024)
by: Stolfo, Alessandro, et al.
Published: (2024)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
by: Wu, Jialin, et al.
Published: (2026)
by: Wu, Jialin, et al.
Published: (2026)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
by: Sheng, Leheng, et al.
Published: (2025)
by: Sheng, Leheng, et al.
Published: (2025)
On Optimal Steering to Achieve Exact Fairness
by: Sharma, Mohit, et al.
Published: (2025)
by: Sharma, Mohit, et al.
Published: (2025)
Activation Steering for Chain-of-Thought Compression
by: Azizi, Seyedarmin, et al.
Published: (2025)
by: Azizi, Seyedarmin, et al.
Published: (2025)
Minimizing Collateral Damage in Activation Steering
by: Nguyen, Tam, et al.
Published: (2026)
by: Nguyen, Tam, et al.
Published: (2026)
Concept Heterogeneity-aware Representation Steering
by: Abdullaev, Laziz U., et al.
Published: (2026)
by: Abdullaev, Laziz U., et al.
Published: (2026)
General and Efficient Steering of Unconditional Diffusion
by: Wang, Qingsong, et al.
Published: (2026)
by: Wang, Qingsong, et al.
Published: (2026)
Zero-Shot Reinforcement Learning Under Partial Observability
by: Jeen, Scott, et al.
Published: (2025)
by: Jeen, Scott, et al.
Published: (2025)
Zero-Shot Reinforcement Learning from Low Quality Data
by: Jeen, Scott, et al.
Published: (2023)
by: Jeen, Scott, et al.
Published: (2023)
Similar Items
-
ShapShift: Explaining Model Prediction Shifts with Subgroup Conditional Shapley Values
by: Bewley, Tom, et al.
Published: (2026) -
Entropic Projection Alignment: Estimating, Explaining, and Improving Model Performance Under Distribution Shift
by: Amoukou, Salim I., et al.
Published: (2026) -
Counterfactual Metarules for Local and Global Recourse
by: Bewley, Tom, et al.
Published: (2024) -
Interpreting Language Reward Models via Contrastive Explanations
by: Jiang, Junqi, et al.
Published: (2024) -
Sequential Harmful Shift Detection Without Labels
by: Amoukou, Salim I., et al.
Published: (2024)