FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Weng, Zixuan, Zhang, Jinghuai, Cai, Kunlin, Li, Ying, Wang, Peiran, Tian, Yuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
di: Avrahami, Eden, et al.
Pubblicazione: (2026)
di: Avrahami, Eden, et al.
Pubblicazione: (2026)
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
di: Valentino, Marco, et al.
Pubblicazione: (2025)
di: Valentino, Marco, et al.
Pubblicazione: (2025)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
di: Sharma, Kartik, et al.
Pubblicazione: (2026)
di: Sharma, Kartik, et al.
Pubblicazione: (2026)
Steering Large Language Models for Machine Translation Personalization
di: Scalena, Daniel, et al.
Pubblicazione: (2025)
di: Scalena, Daniel, et al.
Pubblicazione: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
Fints: Efficient Inference-Time Personalization for LLMs with Fine-Grained Instance-Tailored Steering
di: Du, Kounianhua, et al.
Pubblicazione: (2025)
di: Du, Kounianhua, et al.
Pubblicazione: (2025)
Navigating the Landscape of Large Language Models: A Comprehensive Review and Analysis of Paradigms and Fine-Tuning Strategies
di: Weng, Benjue
Pubblicazione: (2024)
di: Weng, Benjue
Pubblicazione: (2024)
Word Embeddings Are Steers for Language Models
di: Han, Chi, et al.
Pubblicazione: (2023)
di: Han, Chi, et al.
Pubblicazione: (2023)
Fine-Grained Interpretation of Political Opinions in Large Language Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
di: Xu, Haolei, et al.
Pubblicazione: (2025)
di: Xu, Haolei, et al.
Pubblicazione: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
di: Scalena, Daniel, et al.
Pubblicazione: (2024)
di: Scalena, Daniel, et al.
Pubblicazione: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
di: Soo, Samuel, et al.
Pubblicazione: (2025)
di: Soo, Samuel, et al.
Pubblicazione: (2025)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
di: Anand, Nikhil, et al.
Pubblicazione: (2026)
di: Anand, Nikhil, et al.
Pubblicazione: (2026)
Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference
di: Yang, Mengtian, et al.
Pubblicazione: (2026)
di: Yang, Mengtian, et al.
Pubblicazione: (2026)
Endogenous Resistance to Activation Steering in Language Models
di: McKenzie, Alex, et al.
Pubblicazione: (2026)
di: McKenzie, Alex, et al.
Pubblicazione: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time
di: Zhang, Zhenyu, et al.
Pubblicazione: (2025)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Automating Steering for Safe Multimodal Large Language Models
di: Wu, Lyucheng, et al.
Pubblicazione: (2025)
di: Wu, Lyucheng, et al.
Pubblicazione: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
di: Heyman, Geert, et al.
Pubblicazione: (2026)
di: Heyman, Geert, et al.
Pubblicazione: (2026)
Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions
di: Goyal, Navita, et al.
Pubblicazione: (2026)
di: Goyal, Navita, et al.
Pubblicazione: (2026)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
di: Chow, Yinlam, et al.
Pubblicazione: (2024)
di: Chow, Yinlam, et al.
Pubblicazione: (2024)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
di: Han, Pengrui, et al.
Pubblicazione: (2026)
di: Han, Pengrui, et al.
Pubblicazione: (2026)
Towards Inference-time Category-wise Safety Steering for Large Language Models
di: Bhattacharjee, Amrita, et al.
Pubblicazione: (2024)
di: Bhattacharjee, Amrita, et al.
Pubblicazione: (2024)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
di: Weng, Jiaqi, et al.
Pubblicazione: (2025)
di: Weng, Jiaqi, et al.
Pubblicazione: (2025)
Context Steering: Controllable Personalization at Inference Time
di: He, Jerry Zhi-Yang, et al.
Pubblicazione: (2024)
di: He, Jerry Zhi-Yang, et al.
Pubblicazione: (2024)
Improving Instruction-Following in Language Models through Activation Steering
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
di: Nguyen, Duy, et al.
Pubblicazione: (2025)
di: Nguyen, Duy, et al.
Pubblicazione: (2025)
Boosting Large Language Models with Mask Fine-Tuning
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Fractional Reasoning via Latent Steering Vectors Improves Inference Time Compute
di: Liu, Sheng, et al.
Pubblicazione: (2025)
di: Liu, Sheng, et al.
Pubblicazione: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models
di: Bello, Femi, et al.
Pubblicazione: (2025)
di: Bello, Femi, et al.
Pubblicazione: (2025)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
di: Cheng, Stephen, et al.
Pubblicazione: (2026)
di: Cheng, Stephen, et al.
Pubblicazione: (2026)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026) -
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
di: Avrahami, Eden, et al.
Pubblicazione: (2026) -
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
di: Valentino, Marco, et al.
Pubblicazione: (2025) -
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025) -
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
di: Sharma, Kartik, et al.
Pubblicazione: (2026)