A Unified Understanding and Evaluation of Steering Methods
Fuente:
arXiv
Guardado en:
| Autores principales: | Im, Shawn, Li, Sharon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability
por: Im, Shawn, et al.
Publicado: (2026)
por: Im, Shawn, et al.
Publicado: (2026)
Understanding Multimodal LLMs Under Distribution Shifts: An Information-Theoretic Approach
por: Oh, Changdae, et al.
Publicado: (2025)
por: Oh, Changdae, et al.
Publicado: (2025)
Towards Understanding Steering Strength
por: Taimeskhanov, Magamed, et al.
Publicado: (2026)
por: Taimeskhanov, Magamed, et al.
Publicado: (2026)
Can DPO Learn Diverse Human Values? A Theoretical Scaling Law
por: Im, Shawn, et al.
Publicado: (2024)
por: Im, Shawn, et al.
Publicado: (2024)
How Well Can Preference Optimization Generalize Under Noisy Feedback?
por: Im, Shawn, et al.
Publicado: (2025)
por: Im, Shawn, et al.
Publicado: (2025)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
por: Weng, Zixuan, et al.
Publicado: (2026)
por: Weng, Zixuan, et al.
Publicado: (2026)
SteerConf: Steering LLMs for Confidence Elicitation
por: Zhou, Ziang, et al.
Publicado: (2025)
por: Zhou, Ziang, et al.
Publicado: (2025)
Understanding How CodeLLMs (Mis)Predict Types with Activation Steering
por: Lucchetti, Francesca, et al.
Publicado: (2024)
por: Lucchetti, Francesca, et al.
Publicado: (2024)
Beyond Multiple Choice: Evaluating Steering Vectors for Summarization
por: Braun, Joschka, et al.
Publicado: (2025)
por: Braun, Joschka, et al.
Publicado: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Understanding and Mitigating Dataset Corruption in LLM Steering
por: Anderson, Cullen, et al.
Publicado: (2026)
por: Anderson, Cullen, et al.
Publicado: (2026)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
por: Oozeer, Narmeen, et al.
Publicado: (2025)
por: Oozeer, Narmeen, et al.
Publicado: (2025)
Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning
por: Li, Wendi, et al.
Publicado: (2026)
por: Li, Wendi, et al.
Publicado: (2026)
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time
por: Zhang, Zhenyu, et al.
Publicado: (2025)
por: Zhang, Zhenyu, et al.
Publicado: (2025)
Conceptors for Semantic Steering
por: Triantafyllopoulos, Ilias, et al.
Publicado: (2026)
por: Triantafyllopoulos, Ilias, et al.
Publicado: (2026)
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
por: Jin, Zehao, et al.
Publicado: (2026)
por: Jin, Zehao, et al.
Publicado: (2026)
Understanding the Learning Dynamics of Alignment with Human Feedback
por: Im, Shawn, et al.
Publicado: (2024)
por: Im, Shawn, et al.
Publicado: (2024)
That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation
por: Bae, Jaesung, et al.
Publicado: (2025)
por: Bae, Jaesung, et al.
Publicado: (2025)
A Unified Benchmark for Evaluating Knowledge Graph Construction Methods and Graph Neural Networks
por: Kabal, Othmane, et al.
Publicado: (2026)
por: Kabal, Othmane, et al.
Publicado: (2026)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
por: Cao, Yuanpu, et al.
Publicado: (2024)
por: Cao, Yuanpu, et al.
Publicado: (2024)
A Unified Study of LoRA Variants: Taxonomy, Review, Codebase, and Empirical Evaluation
por: He, Haonan, et al.
Publicado: (2026)
por: He, Haonan, et al.
Publicado: (2026)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
por: Avrahami, Eden, et al.
Publicado: (2026)
por: Avrahami, Eden, et al.
Publicado: (2026)
Steering Language Models with Weight Arithmetic
por: Fierro, Constanza, et al.
Publicado: (2025)
por: Fierro, Constanza, et al.
Publicado: (2025)
Predicting Where Steering Vectors Succeed
por: Billa, Jayadev
Publicado: (2026)
por: Billa, Jayadev
Publicado: (2026)
Steering Language Models With Activation Engineering
por: Turner, Alexander Matt, et al.
Publicado: (2023)
por: Turner, Alexander Matt, et al.
Publicado: (2023)
Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations
por: Braun, Joschka
Publicado: (2026)
por: Braun, Joschka
Publicado: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
por: Li, Zihao, et al.
Publicado: (2025)
por: Li, Zihao, et al.
Publicado: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
por: Heyman, Geert, et al.
Publicado: (2026)
por: Heyman, Geert, et al.
Publicado: (2026)
Compositional Steering of Large Language Models with Steering Tokens
por: Radevski, Gorjan, et al.
Publicado: (2026)
por: Radevski, Gorjan, et al.
Publicado: (2026)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
por: Cheng, Stephen, et al.
Publicado: (2026)
por: Cheng, Stephen, et al.
Publicado: (2026)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning
por: Deng, Wenlong, et al.
Publicado: (2025)
por: Deng, Wenlong, et al.
Publicado: (2025)
Evaluating Copyright Takedown Methods for Language Models
por: Wei, Boyi, et al.
Publicado: (2024)
por: Wei, Boyi, et al.
Publicado: (2024)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
por: Gan, Woody Haosheng, et al.
Publicado: (2025)
por: Gan, Woody Haosheng, et al.
Publicado: (2025)
Differentially Private Steering for Large Language Model Alignment
por: Goel, Anmol, et al.
Publicado: (2025)
por: Goel, Anmol, et al.
Publicado: (2025)
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026)
por: Zhang, Xuechen, et al.
Publicado: (2026)
ROAST: Rollout-based On-distribution Activation Steering Technique
por: Su, Xuanbo, et al.
Publicado: (2026)
por: Su, Xuanbo, et al.
Publicado: (2026)
Social Caption: Evaluating Social Understanding in Multimodal Models
por: Thumu, Bhaavanaa, et al.
Publicado: (2026)
por: Thumu, Bhaavanaa, et al.
Publicado: (2026)
Steer LLM Latents for Hallucination Detection
por: Park, Seongheon, et al.
Publicado: (2025)
por: Park, Seongheon, et al.
Publicado: (2025)
Ejemplares similares
-
How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability
por: Im, Shawn, et al.
Publicado: (2026) -
Understanding Multimodal LLMs Under Distribution Shifts: An Information-Theoretic Approach
por: Oh, Changdae, et al.
Publicado: (2025) -
Towards Understanding Steering Strength
por: Taimeskhanov, Magamed, et al.
Publicado: (2026) -
Can DPO Learn Diverse Human Values? A Theoretical Scaling Law
por: Im, Shawn, et al.
Publicado: (2024) -
How Well Can Preference Optimization Generalize Under Noisy Feedback?
por: Im, Shawn, et al.
Publicado: (2025)