LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Jingyuan, Li, Rongjun, Wang, Weixuan, Zhou, Ziyu, Feng, Zhiyong, Peng, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors
di: Wang, Weixuan, et al.
Pubblicazione: (2024)
di: Wang, Weixuan, et al.
Pubblicazione: (2024)
Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Fine-Grained Activation Steering: Steering Less, Achieving More
di: Feng, Zijian, et al.
Pubblicazione: (2026)
di: Feng, Zijian, et al.
Pubblicazione: (2026)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
di: Soo, Samuel, et al.
Pubblicazione: (2025)
di: Soo, Samuel, et al.
Pubblicazione: (2025)
Controlling Large Language Model Agents with Entropic Activation Steering
di: Rahn, Nate, et al.
Pubblicazione: (2024)
di: Rahn, Nate, et al.
Pubblicazione: (2024)
Beyond Static Personas: Situational Personality Steering for Large Language Models
di: Wei, Zesheng, et al.
Pubblicazione: (2026)
di: Wei, Zesheng, et al.
Pubblicazione: (2026)
Steer2Edit: From Activation Steering to Component-Level Editing
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
Exploring the Personality Traits of LLMs through Latent Features Steering
di: Yang, Shu, et al.
Pubblicazione: (2024)
di: Yang, Shu, et al.
Pubblicazione: (2024)
Steering Language Models With Activation Engineering
di: Turner, Alexander Matt, et al.
Pubblicazione: (2023)
di: Turner, Alexander Matt, et al.
Pubblicazione: (2023)
Activation Steering for Masked Diffusion Language Models
di: Shnaidman, Adi, et al.
Pubblicazione: (2025)
di: Shnaidman, Adi, et al.
Pubblicazione: (2025)
Contextual Linear Activation Steering of Language Models
di: Hsu, Brandon, et al.
Pubblicazione: (2026)
di: Hsu, Brandon, et al.
Pubblicazione: (2026)
On Effects of Steering Latent Representation for Large Language Model Unlearning
di: Huu-Tien, Dang, et al.
Pubblicazione: (2024)
di: Huu-Tien, Dang, et al.
Pubblicazione: (2024)
ExpertSteer: Intervening in LLMs through Expert Knowledge
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
Evaluating the Effectiveness of Black-Box Prompt Optimization as the Scale of LLMs Continues to Grow
di: Zhou, Ziyu, et al.
Pubblicazione: (2025)
di: Zhou, Ziyu, et al.
Pubblicazione: (2025)
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
di: Laptev, Daniil, et al.
Pubblicazione: (2025)
di: Laptev, Daniil, et al.
Pubblicazione: (2025)
Psychological Steering of Large Language Models
di: Blas, Leonardo, et al.
Pubblicazione: (2026)
di: Blas, Leonardo, et al.
Pubblicazione: (2026)
Activation Scaling for Steering and Interpreting Language Models
di: Stoehr, Niklas, et al.
Pubblicazione: (2024)
di: Stoehr, Niklas, et al.
Pubblicazione: (2024)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
di: Li, Yichen, et al.
Pubblicazione: (2025)
di: Li, Yichen, et al.
Pubblicazione: (2025)
Prototype-Based Dynamic Steering for Large Language Models
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025)
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025)
WorkTeam: Constructing Workflows from Natural Language with Multi-Agents
di: Liu, Hanchao, et al.
Pubblicazione: (2025)
di: Liu, Hanchao, et al.
Pubblicazione: (2025)
Steering Awareness: Detecting Activation Steering from Within
di: Rivera, Joshua Fonseca, et al.
Pubblicazione: (2025)
di: Rivera, Joshua Fonseca, et al.
Pubblicazione: (2025)
Endogenous Resistance to Activation Steering in Language Models
di: McKenzie, Alex, et al.
Pubblicazione: (2026)
di: McKenzie, Alex, et al.
Pubblicazione: (2026)
Decomposing and Steering Functional Metacognition in Large Language Models
di: Li, Yanshi, et al.
Pubblicazione: (2026)
di: Li, Yanshi, et al.
Pubblicazione: (2026)
Cross-Lingual Activation Steering for Multilingual Language Models
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2026)
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
Steering off Course: Reliability Challenges in Steering Language Models
di: Da Silva, Patrick Queiroz, et al.
Pubblicazione: (2025)
di: Da Silva, Patrick Queiroz, et al.
Pubblicazione: (2025)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
di: Scalena, Daniel, et al.
Pubblicazione: (2024)
di: Scalena, Daniel, et al.
Pubblicazione: (2024)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
di: Anand, Nikhil, et al.
Pubblicazione: (2026)
di: Anand, Nikhil, et al.
Pubblicazione: (2026)
Corpus-Steered Query Expansion with Large Language Models
di: Lei, Yibin, et al.
Pubblicazione: (2024)
di: Lei, Yibin, et al.
Pubblicazione: (2024)
GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients
di: Kazama, Kentaro, et al.
Pubblicazione: (2026)
di: Kazama, Kentaro, et al.
Pubblicazione: (2026)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
di: Wang, Haoran, et al.
Pubblicazione: (2023)
di: Wang, Haoran, et al.
Pubblicazione: (2023)
SteerX: Disentangled Steering for LLM Personalization
di: Zhao, Xiaoyan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaoyan, et al.
Pubblicazione: (2025)
REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering
di: Zhan, Li-Ming, et al.
Pubblicazione: (2025)
di: Zhan, Li-Ming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors
di: Wang, Weixuan, et al.
Pubblicazione: (2024) -
Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
di: Yang, Jingyuan, et al.
Pubblicazione: (2025) -
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
di: Yang, Jingyuan, et al.
Pubblicazione: (2025) -
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
di: Li, Zihao, et al.
Pubblicazione: (2025) -
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
di: Tang, Xinyu, et al.
Pubblicazione: (2025)