Steering off Course: Reliability Challenges in Steering Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Da Silva, Patrick Queiroz, Sethuraman, Hari, Rajagopal, Dheeraj, Hajishirzi, Hannaneh, Kumar, Sachin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025)
di: Wang, Yike, et al.
Pubblicazione: (2025)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
di: Lyu, Xinxi, et al.
Pubblicazione: (2024)
di: Lyu, Xinxi, et al.
Pubblicazione: (2024)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
Set the Clock: Temporal Alignment of Pretrained Language Models
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
di: Graf, Victoria, et al.
Pubblicazione: (2026)
di: Graf, Victoria, et al.
Pubblicazione: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Improved Representation Steering for Language Models
di: Wu, Zhengxuan, et al.
Pubblicazione: (2025)
di: Wu, Zhengxuan, et al.
Pubblicazione: (2025)
Psychological Steering of Large Language Models
di: Blas, Leonardo, et al.
Pubblicazione: (2026)
di: Blas, Leonardo, et al.
Pubblicazione: (2026)
Self-Steering Language Models
di: Grand, Gabriel, et al.
Pubblicazione: (2025)
di: Grand, Gabriel, et al.
Pubblicazione: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
OLMES: A Standard for Language Model Evaluations
di: Gu, Yuling, et al.
Pubblicazione: (2024)
di: Gu, Yuling, et al.
Pubblicazione: (2024)
How Far Can We Extract Diverse Perspectives from Large Language Models?
di: Hayati, Shirley Anugrah, et al.
Pubblicazione: (2023)
di: Hayati, Shirley Anugrah, et al.
Pubblicazione: (2023)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
Activation Steering for Masked Diffusion Language Models
di: Shnaidman, Adi, et al.
Pubblicazione: (2025)
di: Shnaidman, Adi, et al.
Pubblicazione: (2025)
The Cylindrical Representation Hypothesis for Language Model Steering
di: Gao, Lang, et al.
Pubblicazione: (2026)
di: Gao, Lang, et al.
Pubblicazione: (2026)
Contextual Linear Activation Steering of Language Models
di: Hsu, Brandon, et al.
Pubblicazione: (2026)
di: Hsu, Brandon, et al.
Pubblicazione: (2026)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
di: Kim, Joongwon, et al.
Pubblicazione: (2025)
di: Kim, Joongwon, et al.
Pubblicazione: (2025)
SteerX: Disentangled Steering for LLM Personalization
di: Zhao, Xiaoyan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaoyan, et al.
Pubblicazione: (2025)
On the Limitations of Steering in Language Model Alignment
di: Niranjan, Chebrolu, et al.
Pubblicazione: (2025)
di: Niranjan, Chebrolu, et al.
Pubblicazione: (2025)
Steering Language Models with Weight Arithmetic
di: Fierro, Constanza, et al.
Pubblicazione: (2025)
di: Fierro, Constanza, et al.
Pubblicazione: (2025)
Steering Language Models With Activation Engineering
di: Turner, Alexander Matt, et al.
Pubblicazione: (2023)
di: Turner, Alexander Matt, et al.
Pubblicazione: (2023)
Fine-grained Hallucination Detection and Editing for Language Models
di: Mishra, Abhika, et al.
Pubblicazione: (2024)
di: Mishra, Abhika, et al.
Pubblicazione: (2024)
Towards Reliable Evaluation of Behavior Steering Interventions in LLMs
di: Pres, Itamar, et al.
Pubblicazione: (2024)
di: Pres, Itamar, et al.
Pubblicazione: (2024)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
Prototype-Based Dynamic Steering for Large Language Models
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025)
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025)
Decomposing and Steering Functional Metacognition in Large Language Models
di: Li, Yanshi, et al.
Pubblicazione: (2026)
di: Li, Yanshi, et al.
Pubblicazione: (2026)
Style Vectors for Steering Generative Large Language Model
di: Konen, Kai, et al.
Pubblicazione: (2024)
di: Konen, Kai, et al.
Pubblicazione: (2024)
Mechanistic Indicators of Steering Effectiveness in Large Language Models
di: Jafari, Mehdi, et al.
Pubblicazione: (2026)
di: Jafari, Mehdi, et al.
Pubblicazione: (2026)
Language Steering for Multilingual In-Context Learning
di: Kirtane, Neeraja, et al.
Pubblicazione: (2026)
di: Kirtane, Neeraja, et al.
Pubblicazione: (2026)
Self-Improving Model Steering
di: Zhu, Rongyi, et al.
Pubblicazione: (2025)
di: Zhu, Rongyi, et al.
Pubblicazione: (2025)
Scalable Influence and Fact Tracing for Large Language Model Pretraining
di: Chang, Tyler A., et al.
Pubblicazione: (2024)
di: Chang, Tyler A., et al.
Pubblicazione: (2024)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
di: Koleilat, Taha, et al.
Pubblicazione: (2026)
di: Koleilat, Taha, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024) -
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
di: Zhao, Bowen, et al.
Pubblicazione: (2024) -
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025) -
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
di: Lyu, Xinxi, et al.
Pubblicazione: (2024) -
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023)