Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Weixuan, Yang, Jingyuan, Peng, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
por: Yang, Jingyuan, et al.
Publicado: (2025)
por: Yang, Jingyuan, et al.
Publicado: (2025)
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
por: Jin, Zehao, et al.
Publicado: (2026)
por: Jin, Zehao, et al.
Publicado: (2026)
ExpertSteer: Intervening in LLMs through Expert Knowledge
por: Wang, Weixuan, et al.
Publicado: (2025)
por: Wang, Weixuan, et al.
Publicado: (2025)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
Steering MoE LLMs via Expert (De)Activation
por: Fayyaz, Mohsen, et al.
Publicado: (2025)
por: Fayyaz, Mohsen, et al.
Publicado: (2025)
Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions
por: Kang, Diancheng, et al.
Publicado: (2026)
por: Kang, Diancheng, et al.
Publicado: (2026)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
por: Han, Pengrui, et al.
Publicado: (2026)
por: Han, Pengrui, et al.
Publicado: (2026)
Mitigating Memorization in LLMs using Activation Steering
por: Suri, Manan, et al.
Publicado: (2025)
por: Suri, Manan, et al.
Publicado: (2025)
Sharing Matters: Analysing Neurons Across Languages and Tasks in LLMs
por: Wang, Weixuan, et al.
Publicado: (2024)
por: Wang, Weixuan, et al.
Publicado: (2024)
SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors
por: Yegorova, Yekaterina, et al.
Publicado: (2026)
por: Yegorova, Yekaterina, et al.
Publicado: (2026)
Steer2Edit: From Activation Steering to Component-Level Editing
por: Sun, Chung-En, et al.
Publicado: (2026)
por: Sun, Chung-En, et al.
Publicado: (2026)
Towards Reliable Evaluation of Behavior Steering Interventions in LLMs
por: Pres, Itamar, et al.
Publicado: (2024)
por: Pres, Itamar, et al.
Publicado: (2024)
Sparse Brains are Also Adaptive Brains: Cognitive-Load-Aware Dynamic Activation for LLMs
por: Yang, Yiheng, et al.
Publicado: (2025)
por: Yang, Yiheng, et al.
Publicado: (2025)
Understanding How CodeLLMs (Mis)Predict Types with Activation Steering
por: Lucchetti, Francesca, et al.
Publicado: (2024)
por: Lucchetti, Francesca, et al.
Publicado: (2024)
Letting Tutor Personas "Speak Up" for LLMs: Learning Steering Vectors from Dialogue via Preference Optimization
por: Lee, Jaewook, et al.
Publicado: (2026)
por: Lee, Jaewook, et al.
Publicado: (2026)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
por: Zhang, Ruikang, et al.
Publicado: (2026)
por: Zhang, Ruikang, et al.
Publicado: (2026)
Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning
por: Zhou, Zhenghao Herbert, et al.
Publicado: (2026)
por: Zhou, Zhenghao Herbert, et al.
Publicado: (2026)
Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention
por: Wang, Weixuan, et al.
Publicado: (2024)
por: Wang, Weixuan, et al.
Publicado: (2024)
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
por: Hegazy, Amr, et al.
Publicado: (2025)
por: Hegazy, Amr, et al.
Publicado: (2025)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
por: Siddique, Zara, et al.
Publicado: (2025)
por: Siddique, Zara, et al.
Publicado: (2025)
Extracting Unlearned Information from LLMs with Activation Steering
por: Seyitoğlu, Atakan, et al.
Publicado: (2024)
por: Seyitoğlu, Atakan, et al.
Publicado: (2024)
Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs
por: Bhandari, Pranav, et al.
Publicado: (2025)
por: Bhandari, Pranav, et al.
Publicado: (2025)
Personalized Text Generation with Contrastive Activation Steering
por: Zhang, Jinghao, et al.
Publicado: (2025)
por: Zhang, Jinghao, et al.
Publicado: (2025)
Fine-Grained Activation Steering: Steering Less, Achieving More
por: Feng, Zijian, et al.
Publicado: (2026)
por: Feng, Zijian, et al.
Publicado: (2026)
Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
por: Yang, Jingyuan, et al.
Publicado: (2025)
por: Yang, Jingyuan, et al.
Publicado: (2025)
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
por: Lamb, Tom A., et al.
Publicado: (2024)
por: Lamb, Tom A., et al.
Publicado: (2024)
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
por: Pai, Tsung-Min, et al.
Publicado: (2025)
por: Pai, Tsung-Min, et al.
Publicado: (2025)
Activation Steering via Generative Causal Mediation
por: Sankaranarayanan, Aruna, et al.
Publicado: (2026)
por: Sankaranarayanan, Aruna, et al.
Publicado: (2026)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Activated Parameter Locating via Causal Intervention for Model Merging
por: Kong, Fanshuang, et al.
Publicado: (2024)
por: Kong, Fanshuang, et al.
Publicado: (2024)
Don't Lose Focus: Activation Steering via Key-Orthogonal Projections
por: Luo, Haoyan, et al.
Publicado: (2026)
por: Luo, Haoyan, et al.
Publicado: (2026)
Steering Awareness: Detecting Activation Steering from Within
por: Rivera, Joshua Fonseca, et al.
Publicado: (2025)
por: Rivera, Joshua Fonseca, et al.
Publicado: (2025)
Steering LLMs for Culturally Localized Generation
por: Khanuja, Simran, et al.
Publicado: (2026)
por: Khanuja, Simran, et al.
Publicado: (2026)
Faithful Bi-Directional Model Steering via Distribution Matching and Distributed Interchange Interventions
por: Bao, Yuntai, et al.
Publicado: (2026)
por: Bao, Yuntai, et al.
Publicado: (2026)
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026)
por: Zhang, Xuechen, et al.
Publicado: (2026)
Analysing the Safety Pitfalls of Steering Vectors
por: Li, Yuxiao, et al.
Publicado: (2026)
por: Li, Yuxiao, et al.
Publicado: (2026)
Predicting Where Steering Vectors Succeed
por: Billa, Jayadev
Publicado: (2026)
por: Billa, Jayadev
Publicado: (2026)
Infinite Retrieval: Attention Enhanced LLMs in Long-Context Processing
por: Ye, Xiaoju, et al.
Publicado: (2025)
por: Ye, Xiaoju, et al.
Publicado: (2025)
Style Vectors for Steering Generative Large Language Model
por: Konen, Kai, et al.
Publicado: (2024)
por: Konen, Kai, et al.
Publicado: (2024)
Conceptors for Semantic Steering
por: Triantafyllopoulos, Ilias, et al.
Publicado: (2026)
por: Triantafyllopoulos, Ilias, et al.
Publicado: (2026)
Ejemplares similares
-
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
por: Yang, Jingyuan, et al.
Publicado: (2025) -
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
por: Jin, Zehao, et al.
Publicado: (2026) -
ExpertSteer: Intervening in LLMs through Expert Knowledge
por: Wang, Weixuan, et al.
Publicado: (2025) -
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
por: Li, Yichen, et al.
Publicado: (2025) -
Steering MoE LLMs via Expert (De)Activation
por: Fayyaz, Mohsen, et al.
Publicado: (2025)