Saved in:
| Main Authors: | Rahn, Nate, D'Oro, Pierluca, Bellemare, Marc G. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2406.00244 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Policy Optimization in a Noisy Neighborhood: On Return Landscapes in Continuous Control
by: Rahn, Nate, et al.
Published: (2023)
by: Rahn, Nate, et al.
Published: (2023)
Controlling Multimodal LLMs via Reward-guided Decoding
by: Mañas, Oscar, et al.
Published: (2025)
by: Mañas, Oscar, et al.
Published: (2025)
ADEPTS: A Capability Framework for Human-Centered Agent Design
by: D'Oro, Pierluca, et al.
Published: (2025)
by: D'Oro, Pierluca, et al.
Published: (2025)
Mol-MoE: Training Preference-Guided Routers for Molecule Generation
by: Calanzone, Diego, et al.
Published: (2025)
by: Calanzone, Diego, et al.
Published: (2025)
MaestroMotif: Skill Design from Artificial Intelligence Feedback
by: Klissarov, Martin, et al.
Published: (2024)
by: Klissarov, Martin, et al.
Published: (2024)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
by: Yang, Jingyuan, et al.
Published: (2025)
by: Yang, Jingyuan, et al.
Published: (2025)
The Curse of Diversity in Ensemble-Based Exploration
by: Lin, Zhixuan, et al.
Published: (2024)
by: Lin, Zhixuan, et al.
Published: (2024)
Activation Steering for Masked Diffusion Language Models
by: Shnaidman, Adi, et al.
Published: (2025)
by: Shnaidman, Adi, et al.
Published: (2025)
Contextual Linear Activation Steering of Language Models
by: Hsu, Brandon, et al.
Published: (2026)
by: Hsu, Brandon, et al.
Published: (2026)
Steering Language Models With Activation Engineering
by: Turner, Alexander Matt, et al.
Published: (2023)
by: Turner, Alexander Matt, et al.
Published: (2023)
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
by: Tang, Xinyu, et al.
Published: (2025)
by: Tang, Xinyu, et al.
Published: (2025)
DigiData: Training and Evaluating General-Purpose Mobile Control Agents
by: Sun, Yuxuan, et al.
Published: (2025)
by: Sun, Yuxuan, et al.
Published: (2025)
Towards General-Purpose Model-Free Reinforcement Learning
by: Fujimoto, Scott, et al.
Published: (2025)
by: Fujimoto, Scott, et al.
Published: (2025)
Activation Scaling for Steering and Interpreting Language Models
by: Stoehr, Niklas, et al.
Published: (2024)
by: Stoehr, Niklas, et al.
Published: (2024)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
by: Guang, Jiahui, et al.
Published: (2026)
by: Guang, Jiahui, et al.
Published: (2026)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
by: Scalena, Daniel, et al.
Published: (2024)
by: Scalena, Daniel, et al.
Published: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
by: Soo, Samuel, et al.
Published: (2025)
by: Soo, Samuel, et al.
Published: (2025)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
by: Anand, Nikhil, et al.
Published: (2026)
by: Anand, Nikhil, et al.
Published: (2026)
Divergent Creativity in Humans and Large Language Models
by: Bellemare-Pepin, Antoine, et al.
Published: (2024)
by: Bellemare-Pepin, Antoine, et al.
Published: (2024)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
by: Zhuang, Haomin, et al.
Published: (2026)
by: Zhuang, Haomin, et al.
Published: (2026)
Psychological Steering of Large Language Models
by: Blas, Leonardo, et al.
Published: (2026)
by: Blas, Leonardo, et al.
Published: (2026)
Cross-Lingual Activation Steering for Multilingual Language Models
by: Pokharel, Rhitabrat, et al.
Published: (2026)
by: Pokharel, Rhitabrat, et al.
Published: (2026)
Endogenous Resistance to Activation Steering in Language Models
by: McKenzie, Alex, et al.
Published: (2026)
by: McKenzie, Alex, et al.
Published: (2026)
Do Transformer World Models Give Better Policy Gradients?
by: Ma, Michel, et al.
Published: (2024)
by: Ma, Michel, et al.
Published: (2024)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
by: Wang, Haoran, et al.
Published: (2023)
by: Wang, Haoran, et al.
Published: (2023)
Fusion Steering: Prompt-Specific Activation Control
by: Chang, Waldemar, et al.
Published: (2025)
by: Chang, Waldemar, et al.
Published: (2025)
Compositional Steering of Large Language Models with Steering Tokens
by: Radevski, Gorjan, et al.
Published: (2026)
by: Radevski, Gorjan, et al.
Published: (2026)
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
by: You, Zejia, et al.
Published: (2026)
by: You, Zejia, et al.
Published: (2026)
Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models
by: Li, Jiaqian, et al.
Published: (2026)
by: Li, Jiaqian, et al.
Published: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
by: Cheng, Zifeng, et al.
Published: (2025)
by: Cheng, Zifeng, et al.
Published: (2025)
A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering
by: Xie, Jiaqing
Published: (2025)
by: Xie, Jiaqing
Published: (2025)
REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering
by: Zhan, Li-Ming, et al.
Published: (2025)
by: Zhan, Li-Ming, et al.
Published: (2025)
Style Vectors for Steering Generative Large Language Model
by: Konen, Kai, et al.
Published: (2024)
by: Konen, Kai, et al.
Published: (2024)
Prototype-Based Dynamic Steering for Large Language Models
by: Kayan, Ceyhun Efe, et al.
Published: (2025)
by: Kayan, Ceyhun Efe, et al.
Published: (2025)
Decomposing and Steering Functional Metacognition in Large Language Models
by: Li, Yanshi, et al.
Published: (2026)
by: Li, Yanshi, et al.
Published: (2026)
Mechanistic Indicators of Steering Effectiveness in Large Language Models
by: Jafari, Mehdi, et al.
Published: (2026)
by: Jafari, Mehdi, et al.
Published: (2026)
Controlling Large Language Models Through Concept Activation Vectors
by: Zhang, Hanyu, et al.
Published: (2025)
by: Zhang, Hanyu, et al.
Published: (2025)
Improving Instruction-Following in Language Models through Activation Steering
by: Stolfo, Alessandro, et al.
Published: (2024)
by: Stolfo, Alessandro, et al.
Published: (2024)
Fine-Grained Activation Steering: Steering Less, Achieving More
by: Feng, Zijian, et al.
Published: (2026)
by: Feng, Zijian, et al.
Published: (2026)
Improved Representation Steering for Language Models
by: Wu, Zhengxuan, et al.
Published: (2025)
by: Wu, Zhengxuan, et al.
Published: (2025)
Similar Items
-
Policy Optimization in a Noisy Neighborhood: On Return Landscapes in Continuous Control
by: Rahn, Nate, et al.
Published: (2023) -
Controlling Multimodal LLMs via Reward-guided Decoding
by: Mañas, Oscar, et al.
Published: (2025) -
ADEPTS: A Capability Framework for Human-Centered Agent Design
by: D'Oro, Pierluca, et al.
Published: (2025) -
Mol-MoE: Training Preference-Guided Routers for Molecule Generation
by: Calanzone, Diego, et al.
Published: (2025) -
MaestroMotif: Skill Design from Artificial Intelligence Feedback
by: Klissarov, Martin, et al.
Published: (2024)