Continuous Interpretive Steering for Scalar Diversity
Fuente:
arXiv
Saved in:
| Main Author: | Cho, Ye-eun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity
by: Cho, Ye-eun
Published: (2026)
by: Cho, Ye-eun
Published: (2026)
Can Vision-Language Models Infer Speaker's Ignorance? The Role of Visual and Linguistic Cues
by: Cho, Ye-eun, et al.
Published: (2025)
by: Cho, Ye-eun, et al.
Published: (2025)
Pragmatic inference of scalar implicature by LLMs
by: Cho, Ye-eun, et al.
Published: (2024)
by: Cho, Ye-eun, et al.
Published: (2024)
It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers
by: Cho, Yong-eun
Published: (2026)
by: Cho, Yong-eun
Published: (2026)
Cross-Linguistic Transcription and Phonological Representation in the Huìtóngguǎnxì Huáyíyìyǔ
by: Kim, Ji-eun
Published: (2026)
by: Kim, Ji-eun
Published: (2026)
Probing Large Language Models for Scalar Adjective Lexical Semantics and Scalar Diversity Pragmatics
by: Lin, Fangru, et al.
Published: (2024)
by: Lin, Fangru, et al.
Published: (2024)
Activation Scaling for Steering and Interpreting Language Models
by: Stoehr, Niklas, et al.
Published: (2024)
by: Stoehr, Niklas, et al.
Published: (2024)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
by: Wu, Xuansheng, et al.
Published: (2025)
by: Wu, Xuansheng, et al.
Published: (2025)
Interpretable LLM Guardrails via Sparse Representation Steering
by: He, Zeqing, et al.
Published: (2025)
by: He, Zeqing, et al.
Published: (2025)
Continuously Steering LLMs Sensitivity to Contextual Knowledge with Proxy Models
by: Wang, Yilin, et al.
Published: (2025)
by: Wang, Yilin, et al.
Published: (2025)
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
by: Laptev, Daniil, et al.
Published: (2025)
by: Laptev, Daniil, et al.
Published: (2025)
Improving LLM Reasoning through Interpretable Role-Playing Steering
by: Wang, Anyi, et al.
Published: (2025)
by: Wang, Anyi, et al.
Published: (2025)
Korean aegyo speech shows systematic F1 increase to signal childlike qualities
by: Kim, Ji-eun, et al.
Published: (2026)
by: Kim, Ji-eun, et al.
Published: (2026)
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
by: Cho, Seonglae, et al.
Published: (2026)
by: Cho, Seonglae, et al.
Published: (2026)
Conceptors for Semantic Steering
by: Triantafyllopoulos, Ilias, et al.
Published: (2026)
by: Triantafyllopoulos, Ilias, et al.
Published: (2026)
Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
by: Zhang, Hengyuan, et al.
Published: (2026)
by: Zhang, Hengyuan, et al.
Published: (2026)
SteerX: Disentangled Steering for LLM Personalization
by: Zhao, Xiaoyan, et al.
Published: (2025)
by: Zhao, Xiaoyan, et al.
Published: (2025)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
by: Sun, Mengyuan, et al.
Published: (2026)
by: Sun, Mengyuan, et al.
Published: (2026)
Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection
by: Deshpande, Vijeta, et al.
Published: (2026)
by: Deshpande, Vijeta, et al.
Published: (2026)
Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story Generation
by: Khalid, Haziq Mohammad, et al.
Published: (2026)
by: Khalid, Haziq Mohammad, et al.
Published: (2026)
Fine-Grained Activation Steering: Steering Less, Achieving More
by: Feng, Zijian, et al.
Published: (2026)
by: Feng, Zijian, et al.
Published: (2026)
Steering off Course: Reliability Challenges in Steering Language Models
by: Da Silva, Patrick Queiroz, et al.
Published: (2025)
by: Da Silva, Patrick Queiroz, et al.
Published: (2025)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
by: Soo, Samuel, et al.
Published: (2025)
by: Soo, Samuel, et al.
Published: (2025)
Steer2Edit: From Activation Steering to Component-Level Editing
by: Sun, Chung-En, et al.
Published: (2026)
by: Sun, Chung-En, et al.
Published: (2026)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
by: Li, Yichen, et al.
Published: (2025)
by: Li, Yichen, et al.
Published: (2025)
Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning
by: Zhou, Zhenghao Herbert, et al.
Published: (2026)
by: Zhou, Zhenghao Herbert, et al.
Published: (2026)
Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models
by: Roh, Youngji, et al.
Published: (2026)
by: Roh, Youngji, et al.
Published: (2026)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
by: Cho, Seonglae, et al.
Published: (2025)
by: Cho, Seonglae, et al.
Published: (2025)
GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients
by: Kazama, Kentaro, et al.
Published: (2026)
by: Kazama, Kentaro, et al.
Published: (2026)
SteerConf: Steering LLMs for Confidence Elicitation
by: Zhou, Ziang, et al.
Published: (2025)
by: Zhou, Ziang, et al.
Published: (2025)
Aligning Large Language Models with Diverse Political Viewpoints
by: Stammbach, Dominik, et al.
Published: (2024)
by: Stammbach, Dominik, et al.
Published: (2024)
Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories
by: Wang, Tianlong, et al.
Published: (2024)
by: Wang, Tianlong, et al.
Published: (2024)
Self-Improving Model Steering
by: Zhu, Rongyi, et al.
Published: (2025)
by: Zhu, Rongyi, et al.
Published: (2025)
Steering Awareness: Detecting Activation Steering from Within
by: Rivera, Joshua Fonseca, et al.
Published: (2025)
by: Rivera, Joshua Fonseca, et al.
Published: (2025)
PsyProbe: Proactive and Interpretable Dialogue through User State Modeling for Exploratory Counseling
by: Park, Sohhyung, et al.
Published: (2026)
by: Park, Sohhyung, et al.
Published: (2026)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
by: He, Zirui, et al.
Published: (2025)
by: He, Zirui, et al.
Published: (2025)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
by: Yang, Jingyuan, et al.
Published: (2025)
by: Yang, Jingyuan, et al.
Published: (2025)
Conjoined Predication and Scalar Implicature
by: Kandala, Ratna
Published: (2025)
by: Kandala, Ratna
Published: (2025)
RTSUM: Relation Triple-based Interpretable Summarization with Multi-level Salience Visualization
by: Cho, Seonglae, et al.
Published: (2023)
by: Cho, Seonglae, et al.
Published: (2023)
SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing
by: Zhang, Mingxu, et al.
Published: (2026)
by: Zhang, Mingxu, et al.
Published: (2026)
Similar Items
-
Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity
by: Cho, Ye-eun
Published: (2026) -
Can Vision-Language Models Infer Speaker's Ignorance? The Role of Visual and Linguistic Cues
by: Cho, Ye-eun, et al.
Published: (2025) -
Pragmatic inference of scalar implicature by LLMs
by: Cho, Ye-eun, et al.
Published: (2024) -
It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers
by: Cho, Yong-eun
Published: (2026) -
Cross-Linguistic Transcription and Phonological Representation in the Huìtóngguǎnxì Huáyíyìyǔ
by: Kim, Ji-eun
Published: (2026)