One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dunefsky, Jacob, Cohan, Arman |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Observable Propagation: Uncovering Feature Vectors in Transformers
par: Dunefsky, Jacob, et autres
Publié: (2023)
par: Dunefsky, Jacob, et autres
Publié: (2023)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
par: Han, Pengrui, et autres
Publié: (2026)
par: Han, Pengrui, et autres
Publié: (2026)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
par: Siddique, Zara, et autres
Publié: (2025)
par: Siddique, Zara, et autres
Publié: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
par: Tran, Thanh Q., et autres
Publié: (2026)
par: Tran, Thanh Q., et autres
Publié: (2026)
Dialz: A Python Toolkit for Steering Vectors
par: Siddique, Zara, et autres
Publié: (2025)
par: Siddique, Zara, et autres
Publié: (2025)
On the Non-Identifiability of Steering Vectors in Large Language Models
par: Venkatesh, Sohan, et autres
Publié: (2026)
par: Venkatesh, Sohan, et autres
Publié: (2026)
COMAL: A Convergent Meta-Algorithm for Aligning LLMs with General Preferences
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction
par: Mozaffari, Mohammad, et autres
Publié: (2025)
par: Mozaffari, Mohammad, et autres
Publié: (2025)
Understanding Reasoning in Thinking Language Models via Steering Vectors
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
Calibrating Long-form Generations from Large Language Models
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
The Rogue Scalpel: Activation Steering Compromises LLM Safety
par: Korznikov, Anton, et autres
Publié: (2025)
par: Korznikov, Anton, et autres
Publié: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
par: Yeon, Jehyeok, et autres
Publié: (2025)
par: Yeon, Jehyeok, et autres
Publié: (2025)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
par: Wang, Anyi, et autres
Publié: (2025)
par: Wang, Anyi, et autres
Publié: (2025)
Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance
par: Zhang, Jiawen, et autres
Publié: (2026)
par: Zhang, Jiawen, et autres
Publié: (2026)
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026)
par: Zhou, Enyu, et autres
Publié: (2026)
One-Way Policy Optimization for Self-Evolving LLMs
par: Yang, Shuo, et autres
Publié: (2026)
par: Yang, Shuo, et autres
Publié: (2026)
One-shot Transfer Learning for Population Mapping
par: Shao, Erzhuo, et autres
Publié: (2021)
par: Shao, Erzhuo, et autres
Publié: (2021)
CBMAS: Cognitive Behavioral Modeling via Activation Steering
par: Ismail, Ahmed H., et autres
Publié: (2026)
par: Ismail, Ahmed H., et autres
Publié: (2026)
Bridging Kolmogorov Complexity and Deep Learning: Asymptotically Optimal Description Length Objectives for Transformers
par: Shaw, Peter, et autres
Publié: (2025)
par: Shaw, Peter, et autres
Publié: (2025)
Angular Steering: Behavior Control via Rotation in Activation Space
par: Vu, Hieu M., et autres
Publié: (2025)
par: Vu, Hieu M., et autres
Publié: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
par: Liu, Yixin, et autres
Publié: (2026)
par: Liu, Yixin, et autres
Publié: (2026)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
par: Chalnev, Sviatoslav, et autres
Publié: (2024)
Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
One-shot Federated Learning Methods: A Practical Guide
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
Exploration Behavior of Untrained Policies
par: Adamczyk, Jacob
Publié: (2025)
par: Adamczyk, Jacob
Publié: (2025)
Steering LLMs for Formal Theorem Proving
par: Kirtania, Shashank, et autres
Publié: (2025)
par: Kirtania, Shashank, et autres
Publié: (2025)
Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection
par: Kang, Minjae, et autres
Publié: (2026)
par: Kang, Minjae, et autres
Publié: (2026)
ExecTune: Effective Steering of Black-Box LLMs with Guide Models
par: Lingam, Vijay, et autres
Publié: (2026)
par: Lingam, Vijay, et autres
Publié: (2026)
Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs
par: Liu, Andy Zeyi, et autres
Publié: (2026)
par: Liu, Andy Zeyi, et autres
Publié: (2026)
References Improve LLM Alignment in Non-Verifiable Domains
par: Shi, Kejian, et autres
Publié: (2026)
par: Shi, Kejian, et autres
Publié: (2026)
Parametric Feature Transfer: One-shot Federated Learning with Foundation Models
par: Beitollahi, Mahdi, et autres
Publié: (2024)
par: Beitollahi, Mahdi, et autres
Publié: (2024)
ICPL: Few-shot In-context Preference Learning via LLMs
par: Yu, Chao, et autres
Publié: (2024)
par: Yu, Chao, et autres
Publié: (2024)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
par: Sharma, Kartik, et autres
Publié: (2026)
par: Sharma, Kartik, et autres
Publié: (2026)
GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
par: Handa, Divij, et autres
Publié: (2025)
par: Handa, Divij, et autres
Publié: (2025)
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
par: Zhang, Zeyu, et autres
Publié: (2026)
par: Zhang, Zeyu, et autres
Publié: (2026)
Support Vector Boosting Machine (SVBM): Enhancing Classification Performance with AdaBoost and Residual Connections
par: Lian, Junbo Jacob
Publié: (2024)
par: Lian, Junbo Jacob
Publié: (2024)
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
par: Lamb, Tom A., et autres
Publié: (2024)
par: Lamb, Tom A., et autres
Publié: (2024)
FedLPA: One-shot Federated Learning with Layer-Wise Posterior Aggregation
par: Liu, Xiang, et autres
Publié: (2023)
par: Liu, Xiang, et autres
Publié: (2023)
Documents similaires
-
Observable Propagation: Uncovering Feature Vectors in Transformers
par: Dunefsky, Jacob, et autres
Publié: (2023) -
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025) -
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025) -
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
par: Han, Pengrui, et autres
Publié: (2026) -
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
par: Siddique, Zara, et autres
Publié: (2025)