In-Distribution Steering: Balancing Control and Coherence in Language Model Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vogels, Arthur, Wong, Benjamin, Choho, Yann, Blangero, Annabelle, Bhan, Milan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Faithful Multimodal Concept Bottleneck Models
par: Moreau, Pierre, et autres
Publié: (2026)
par: Moreau, Pierre, et autres
Publié: (2026)
Towards Achieving Concept Completeness for Textual Concept Bottleneck Models
par: Bhan, Milan, et autres
Publié: (2025)
par: Bhan, Milan, et autres
Publié: (2025)
Mitigating Text Toxicity with Counterfactual Generation
par: Bhan, Milan, et autres
Publié: (2024)
par: Bhan, Milan, et autres
Publié: (2024)
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
Self-AMPLIFY: Improving Small Language Models with Self Post Hoc Explanations
par: Bhan, Milan, et autres
Publié: (2024)
par: Bhan, Milan, et autres
Publié: (2024)
Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
par: Agnimo, Yedidia, et autres
Publié: (2026)
par: Agnimo, Yedidia, et autres
Publié: (2026)
Style Vectors for Steering Generative Large Language Model
par: Konen, Kai, et autres
Publié: (2024)
par: Konen, Kai, et autres
Publié: (2024)
Controlling Large Language Model Agents with Entropic Activation Steering
par: Rahn, Nate, et autres
Publié: (2024)
par: Rahn, Nate, et autres
Publié: (2024)
NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment
par: Bhan, Milan, et autres
Publié: (2025)
par: Bhan, Milan, et autres
Publié: (2025)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
par: Zhuang, Haomin, et autres
Publié: (2026)
par: Zhuang, Haomin, et autres
Publié: (2026)
Steering off Course: Reliability Challenges in Steering Language Models
par: Da Silva, Patrick Queiroz, et autres
Publié: (2025)
par: Da Silva, Patrick Queiroz, et autres
Publié: (2025)
Evaluating Large Language Model Biases in Persona-Steered Generation
par: Liu, Andy, et autres
Publié: (2024)
par: Liu, Andy, et autres
Publié: (2024)
Balancing Stylization and Truth via Disentangled Representation Steering
par: Shen, Chenglei, et autres
Publié: (2025)
par: Shen, Chenglei, et autres
Publié: (2025)
Improved Representation Steering for Language Models
par: Wu, Zhengxuan, et autres
Publié: (2025)
par: Wu, Zhengxuan, et autres
Publié: (2025)
Psychological Steering of Large Language Models
par: Blas, Leonardo, et autres
Publié: (2026)
par: Blas, Leonardo, et autres
Publié: (2026)
SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models
par: He, Zirui, et autres
Publié: (2025)
par: He, Zirui, et autres
Publié: (2025)
Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models
par: Li, Jiaqian, et autres
Publié: (2026)
par: Li, Jiaqian, et autres
Publié: (2026)
Self-Steering Language Models
par: Grand, Gabriel, et autres
Publié: (2025)
par: Grand, Gabriel, et autres
Publié: (2025)
Activation Steering for Masked Diffusion Language Models
par: Shnaidman, Adi, et autres
Publié: (2025)
par: Shnaidman, Adi, et autres
Publié: (2025)
The Cylindrical Representation Hypothesis for Language Model Steering
par: Gao, Lang, et autres
Publié: (2026)
par: Gao, Lang, et autres
Publié: (2026)
Contextual Linear Activation Steering of Language Models
par: Hsu, Brandon, et autres
Publié: (2026)
par: Hsu, Brandon, et autres
Publié: (2026)
Leveraging Language Models for Emotion and Behavior Analysis in Education
par: Tanaka, Kaito, et autres
Publié: (2024)
par: Tanaka, Kaito, et autres
Publié: (2024)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
par: Yang, Jingyuan, et autres
Publié: (2025)
par: Yang, Jingyuan, et autres
Publié: (2025)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
par: Cheng, Zifeng, et autres
Publié: (2025)
par: Cheng, Zifeng, et autres
Publié: (2025)
Steering Without Side Effects: Improving Post-Deployment Control of Language Models
par: Stickland, Asa Cooper, et autres
Publié: (2024)
par: Stickland, Asa Cooper, et autres
Publié: (2024)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
Prototype-Based Dynamic Steering for Large Language Models
par: Kayan, Ceyhun Efe, et autres
Publié: (2025)
par: Kayan, Ceyhun Efe, et autres
Publié: (2025)
Decomposing and Steering Functional Metacognition in Large Language Models
par: Li, Yanshi, et autres
Publié: (2026)
par: Li, Yanshi, et autres
Publié: (2026)
Mechanistic Indicators of Steering Effectiveness in Large Language Models
par: Jafari, Mehdi, et autres
Publié: (2026)
par: Jafari, Mehdi, et autres
Publié: (2026)
STU-PID: Steering Token Usage via PID Controller for Efficient Large Language Model Reasoning
par: Bharadwaj, Aryasomayajula Ram
Publié: (2025)
par: Bharadwaj, Aryasomayajula Ram
Publié: (2025)
On the Limitations of Steering in Language Model Alignment
par: Niranjan, Chebrolu, et autres
Publié: (2025)
par: Niranjan, Chebrolu, et autres
Publié: (2025)
Steering Language Models with Weight Arithmetic
par: Fierro, Constanza, et autres
Publié: (2025)
par: Fierro, Constanza, et autres
Publié: (2025)
Steering Language Models With Activation Engineering
par: Turner, Alexander Matt, et autres
Publié: (2023)
par: Turner, Alexander Matt, et autres
Publié: (2023)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
par: Oozeer, Narmeen, et autres
Publié: (2025)
par: Oozeer, Narmeen, et autres
Publié: (2025)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Improving Multilingual Language Models by Aligning Representations through Steering
par: Mahmoud, Omar, et autres
Publié: (2025)
par: Mahmoud, Omar, et autres
Publié: (2025)
Multilingual Political Views of Large Language Models: Identification and Steering
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Probing and Steering Evaluation Awareness of Language Models
par: Nguyen, Jord, et autres
Publié: (2025)
par: Nguyen, Jord, et autres
Publié: (2025)
Activation Scaling for Steering and Interpreting Language Models
par: Stoehr, Niklas, et autres
Publié: (2024)
par: Stoehr, Niklas, et autres
Publié: (2024)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
par: Wong, Sing Hieng, et autres
Publié: (2026)
par: Wong, Sing Hieng, et autres
Publié: (2026)
Documents similaires
-
Towards Faithful Multimodal Concept Bottleneck Models
par: Moreau, Pierre, et autres
Publié: (2026) -
Towards Achieving Concept Completeness for Textual Concept Bottleneck Models
par: Bhan, Milan, et autres
Publié: (2025) -
Mitigating Text Toxicity with Counterfactual Generation
par: Bhan, Milan, et autres
Publié: (2024) -
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026) -
Self-AMPLIFY: Improving Small Language Models with Self Post Hoc Explanations
par: Bhan, Milan, et autres
Publié: (2024)