Steering Awareness: Detecting Activation Steering from Within
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rivera, Joshua Fonseca, Africa, David Demitri |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness
par: Ivanov, Igor, et autres
Publié: (2026)
par: Ivanov, Igor, et autres
Publié: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026)
par: Heyman, Geert, et autres
Publié: (2026)
Consistency Training while Mitigating Obfuscation via Rate Matching
par: Imran, Sohaib, et autres
Publié: (2026)
par: Imran, Sohaib, et autres
Publié: (2026)
Fusion Steering: Prompt-Specific Activation Control
par: Chang, Waldemar, et autres
Publié: (2025)
par: Chang, Waldemar, et autres
Publié: (2025)
Activation Scaling for Steering and Interpreting Language Models
par: Stoehr, Niklas, et autres
Publié: (2024)
par: Stoehr, Niklas, et autres
Publié: (2024)
Learning Dynamics of Meta-Learning in Small Model Pretraining
par: Africa, David Demitri, et autres
Publié: (2025)
par: Africa, David Demitri, et autres
Publié: (2025)
Investigating ReLoRA: Effects on the Learning Dynamics of Small Language Models
par: Weiss, Yuval, et autres
Publié: (2025)
par: Weiss, Yuval, et autres
Publié: (2025)
Self-Steering Language Models
par: Grand, Gabriel, et autres
Publié: (2025)
par: Grand, Gabriel, et autres
Publié: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
SAKE: Steering Activations for Knowledge Editing
par: Scialanga, Marco, et autres
Publié: (2025)
par: Scialanga, Marco, et autres
Publié: (2025)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
Probing and Steering Evaluation Awareness of Language Models
par: Nguyen, Jord, et autres
Publié: (2025)
par: Nguyen, Jord, et autres
Publié: (2025)
Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions
par: Kang, Diancheng, et autres
Publié: (2026)
par: Kang, Diancheng, et autres
Publié: (2026)
Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
par: Wannan, et autres
Publié: (2025)
par: Wannan, et autres
Publié: (2025)
Meta-Pretraining for Zero-Shot Cross-Lingual Named Entity Recognition in Low-Resource Philippine Languages
par: Africa, David Demitri, et autres
Publié: (2025)
par: Africa, David Demitri, et autres
Publié: (2025)
Extracting Unlearned Information from LLMs with Activation Steering
par: Seyitoğlu, Atakan, et autres
Publié: (2024)
par: Seyitoğlu, Atakan, et autres
Publié: (2024)
Endogenous Resistance to Activation Steering in Language Models
par: McKenzie, Alex, et autres
Publié: (2026)
par: McKenzie, Alex, et autres
Publié: (2026)
Investigating Bias Representations in Llama 2 Chat via Activation Steering
par: Lu, Dawn, et autres
Publié: (2024)
par: Lu, Dawn, et autres
Publié: (2024)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
par: Cheng, Zifeng, et autres
Publié: (2025)
par: Cheng, Zifeng, et autres
Publié: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
par: Hua, Tim Tian, et autres
Publié: (2025)
par: Hua, Tim Tian, et autres
Publié: (2025)
Steering Llama 2 via Contrastive Activation Addition
par: Panickssery, Nina, et autres
Publié: (2023)
par: Panickssery, Nina, et autres
Publié: (2023)
EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
par: Xu, Haolei, et autres
Publié: (2025)
par: Xu, Haolei, et autres
Publié: (2025)
CoSteer: Collaborative Decoding-Time Personalization via Local Delta Steering
par: Lv, Hang, et autres
Publié: (2025)
par: Lv, Hang, et autres
Publié: (2025)
LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss
par: Rodriguez, Pau, et autres
Publié: (2025)
par: Rodriguez, Pau, et autres
Publié: (2025)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
par: Guang, Jiahui, et autres
Publié: (2026)
par: Guang, Jiahui, et autres
Publié: (2026)
No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes
par: Cencerrado, Iván Vicente Moreno, et autres
Publié: (2025)
par: Cencerrado, Iván Vicente Moreno, et autres
Publié: (2025)
Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
par: Tan, Daniel, et autres
Publié: (2025)
par: Tan, Daniel, et autres
Publié: (2025)
Steer LLM Latents for Hallucination Detection
par: Park, Seongheon, et autres
Publié: (2025)
par: Park, Seongheon, et autres
Publié: (2025)
Pico: A Modular Framework for Hypothesis-Driven Small Language Model Research
par: Martinez, Richard Diehl, et autres
Publié: (2025)
par: Martinez, Richard Diehl, et autres
Publié: (2025)
Extending Activation Steering to Broad Skills and Multiple Behaviours
par: van der Weij, Teun, et autres
Publié: (2024)
par: van der Weij, Teun, et autres
Publié: (2024)
EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis
par: Zhou, Li, et autres
Publié: (2026)
par: Zhou, Li, et autres
Publié: (2026)
SAGE: Steering Dialog Generation with Future-Aware State-Action Augmentation
par: Zhang, Yizhe, et autres
Publié: (2025)
par: Zhang, Yizhe, et autres
Publié: (2025)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
par: Liu, Zheyuan, et autres
Publié: (2025)
par: Liu, Zheyuan, et autres
Publié: (2025)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
par: Valentino, Marco, et autres
Publié: (2025)
par: Valentino, Marco, et autres
Publié: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
par: Wang, Xintong, et autres
Publié: (2024)
par: Wang, Xintong, et autres
Publié: (2024)
Detecting and Steering LLMs' Empathy in Action
par: Cadile, Juan P.
Publié: (2025)
par: Cadile, Juan P.
Publié: (2025)
Documents similaires
-
LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness
par: Ivanov, Igor, et autres
Publié: (2026) -
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025) -
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026) -
Consistency Training while Mitigating Obfuscation via Rate Matching
par: Imran, Sohaib, et autres
Publié: (2026) -
Fusion Steering: Prompt-Specific Activation Control
par: Chang, Waldemar, et autres
Publié: (2025)