REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhan, Li-Ming, Liu, Bo, Xie, Chengqiang, Cao, Jiannong, Wu, Xiao-Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VI-OOD: A Unified Representation Learning Framework for Textual Out-of-distribution Detection
par: Zhan, Li-Ming, et autres
Publié: (2024)
par: Zhan, Li-Ming, et autres
Publié: (2024)
Diversity-grounded Channel Prototypical Learning for Out-of-Distribution Intent Detection
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
GeoEdit: Geometric Knowledge Editing for Large Language Models
par: Feng, Yujie, et autres
Publié: (2025)
par: Feng, Yujie, et autres
Publié: (2025)
How Good Are LLMs at Out-of-Distribution Detection?
par: Liu, Bo, et autres
Publié: (2023)
par: Liu, Bo, et autres
Publié: (2023)
A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering
par: Xie, Jiaqing
Publié: (2025)
par: Xie, Jiaqing
Publié: (2025)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
par: Soo, Samuel, et autres
Publié: (2025)
par: Soo, Samuel, et autres
Publié: (2025)
Activation Steering for Masked Diffusion Language Models
par: Shnaidman, Adi, et autres
Publié: (2025)
par: Shnaidman, Adi, et autres
Publié: (2025)
Contextual Linear Activation Steering of Language Models
par: Hsu, Brandon, et autres
Publié: (2026)
par: Hsu, Brandon, et autres
Publié: (2026)
Steering Language Models With Activation Engineering
par: Turner, Alexander Matt, et autres
Publié: (2023)
par: Turner, Alexander Matt, et autres
Publié: (2023)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
par: Yang, Jingyuan, et autres
Publié: (2025)
par: Yang, Jingyuan, et autres
Publié: (2025)
InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models
par: Wang, Wenjun, et autres
Publié: (2025)
par: Wang, Wenjun, et autres
Publié: (2025)
Activation Scaling for Steering and Interpreting Language Models
par: Stoehr, Niklas, et autres
Publié: (2024)
par: Stoehr, Niklas, et autres
Publié: (2024)
GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-ray Diagnosis
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
Controlling Large Language Model Agents with Entropic Activation Steering
par: Rahn, Nate, et autres
Publié: (2024)
par: Rahn, Nate, et autres
Publié: (2024)
A Survey on Out-of-Distribution Evaluation of Neural NLP Models
par: Li, Xinzhe, et autres
Publié: (2023)
par: Li, Xinzhe, et autres
Publié: (2023)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
par: Wang, Qidong, et autres
Publié: (2026)
par: Wang, Qidong, et autres
Publié: (2026)
Personalized Text Generation with Contrastive Activation Steering
par: Zhang, Jinghao, et autres
Publié: (2025)
par: Zhang, Jinghao, et autres
Publié: (2025)
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
Continual Dialogue State Tracking via Reason-of-Select Distillation
par: Feng, Yujie, et autres
Publié: (2024)
par: Feng, Yujie, et autres
Publié: (2024)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
par: Li, Yichen, et autres
Publié: (2025)
par: Li, Yichen, et autres
Publié: (2025)
Endogenous Resistance to Activation Steering in Language Models
par: McKenzie, Alex, et autres
Publié: (2026)
par: McKenzie, Alex, et autres
Publié: (2026)
Fine-Grained Activation Steering: Steering Less, Achieving More
par: Feng, Zijian, et autres
Publié: (2026)
par: Feng, Zijian, et autres
Publié: (2026)
The Anatomy of an Edit: Mechanism-Guided Activation Steering for Knowledge Editing
par: Cao, Yuan, et autres
Publié: (2026)
par: Cao, Yuan, et autres
Publié: (2026)
A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities
par: Chen, Jiaqi, et autres
Publié: (2026)
par: Chen, Jiaqi, et autres
Publié: (2026)
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
par: You, Zejia, et autres
Publié: (2026)
par: You, Zejia, et autres
Publié: (2026)
Characterizing the Expressivity of Fixed-Precision Transformer Language Models
par: Li, Jiaoda, et autres
Publié: (2025)
par: Li, Jiaoda, et autres
Publié: (2025)
TaSL: Continual Dialog State Tracking via Task Skill Localization and Consolidation
par: Feng, Yujie, et autres
Publié: (2024)
par: Feng, Yujie, et autres
Publié: (2024)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
par: Zhao, Haiyan, et autres
Publié: (2025)
par: Zhao, Haiyan, et autres
Publié: (2025)
New Intent Discovery with Pre-training and Contrastive Learning
par: Zhang, Yuwei, et autres
Publié: (2022)
par: Zhang, Yuwei, et autres
Publié: (2022)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
par: Guang, Jiahui, et autres
Publié: (2026)
par: Guang, Jiahui, et autres
Publié: (2026)
Self-assessment, Exhibition, and Recognition: a Review of Personality in Large Language Models
par: Wen, Zhiyuan, et autres
Publié: (2024)
par: Wen, Zhiyuan, et autres
Publié: (2024)
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
Improved Representation Steering for Language Models
par: Wu, Zhengxuan, et autres
Publié: (2025)
par: Wu, Zhengxuan, et autres
Publié: (2025)
SteerX: Disentangled Steering for LLM Personalization
par: Zhao, Xiaoyan, et autres
Publié: (2025)
par: Zhao, Xiaoyan, et autres
Publié: (2025)
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Decomposing and Steering Functional Metacognition in Large Language Models
par: Li, Yanshi, et autres
Publié: (2026)
par: Li, Yanshi, et autres
Publié: (2026)
FMC: Formalization of Natural Language Mathematical Competition Problems
par: Xie, Jiaxuan, et autres
Publié: (2025)
par: Xie, Jiaxuan, et autres
Publié: (2025)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
par: Cao, Yuanpu, et autres
Publié: (2024)
par: Cao, Yuanpu, et autres
Publié: (2024)
Steer2Edit: From Activation Steering to Component-Level Editing
par: Sun, Chung-En, et autres
Publié: (2026)
par: Sun, Chung-En, et autres
Publié: (2026)
Documents similaires
-
VI-OOD: A Unified Representation Learning Framework for Textual Out-of-distribution Detection
par: Zhan, Li-Ming, et autres
Publié: (2024) -
Diversity-grounded Channel Prototypical Learning for Out-of-Distribution Intent Detection
par: Liu, Bo, et autres
Publié: (2024) -
GeoEdit: Geometric Knowledge Editing for Large Language Models
par: Feng, Yujie, et autres
Publié: (2025) -
How Good Are LLMs at Out-of-Distribution Detection?
par: Liu, Bo, et autres
Publié: (2023) -
A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering
par: Xie, Jiaqing
Publié: (2025)