Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Yi, Wang, Wenjie, Xue, Mingfeng, Deng, Boyi, Xu, Fengli, Liu, Dayiheng, Feng, Fuli |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning
por: Li, Chengpeng, et al.
Publicado: (2024)
por: Li, Chengpeng, et al.
Publicado: (2024)
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
por: Yu, Zhuohao, et al.
Publicado: (2025)
por: Yu, Zhuohao, et al.
Publicado: (2025)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
por: Hua, Zhenglin, et al.
Publicado: (2025)
por: Hua, Zhenglin, et al.
Publicado: (2025)
SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
por: Deng, Boyi, et al.
Publicado: (2025)
por: Deng, Boyi, et al.
Publicado: (2025)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
por: Zhang, Ruikang, et al.
Publicado: (2026)
por: Zhang, Ruikang, et al.
Publicado: (2026)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
por: Zhao, Haiyan, et al.
Publicado: (2025)
por: Zhao, Haiyan, et al.
Publicado: (2025)
Teaching Language Models to Reason with Tools
por: Li, Chengpeng, et al.
Publicado: (2025)
por: Li, Chengpeng, et al.
Publicado: (2025)
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
por: Deng, Boyi, et al.
Publicado: (2025)
por: Deng, Boyi, et al.
Publicado: (2025)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2025)
por: Cho, Seonglae, et al.
Publicado: (2025)
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
por: Cai, Hongru, et al.
Publicado: (2026)
por: Cai, Hongru, et al.
Publicado: (2026)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
por: Chalnev, Sviatoslav, et al.
Publicado: (2024)
por: Chalnev, Sviatoslav, et al.
Publicado: (2024)
Constrain Alignment with Sparse Autoencoders
por: Yin, Qingyu, et al.
Publicado: (2024)
por: Yin, Qingyu, et al.
Publicado: (2024)
Causal Language Control in Multilingual Transformers via Sparse Feature Steering
por: Chou, Cheng-Ting, et al.
Publicado: (2025)
por: Chou, Cheng-Ting, et al.
Publicado: (2025)
CoRT: Code-integrated Reasoning within Thinking
por: Li, Chengpeng, et al.
Publicado: (2025)
por: Li, Chengpeng, et al.
Publicado: (2025)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
por: Zhu, Fengbin, et al.
Publicado: (2024)
por: Zhu, Fengbin, et al.
Publicado: (2024)
Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines
por: Jørgensen, Mikkel Godsk, et al.
Publicado: (2026)
por: Jørgensen, Mikkel Godsk, et al.
Publicado: (2026)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
por: Wang, Anyi, et al.
Publicado: (2025)
por: Wang, Anyi, et al.
Publicado: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
por: Shao, Chenyang, et al.
Publicado: (2025)
por: Shao, Chenyang, et al.
Publicado: (2025)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
por: Liu, Dengcan, et al.
Publicado: (2025)
por: Liu, Dengcan, et al.
Publicado: (2025)
Less is More: Improving LLM Alignment via Preference Data Selection
por: Deng, Xun, et al.
Publicado: (2025)
por: Deng, Xun, et al.
Publicado: (2025)
HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning
por: Yang, Jinning, et al.
Publicado: (2025)
por: Yang, Jinning, et al.
Publicado: (2025)
The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis
por: Wei, Zihao, et al.
Publicado: (2025)
por: Wei, Zihao, et al.
Publicado: (2025)
Improving LLM Reasoning through Interpretable Role-Playing Steering
por: Wang, Anyi, et al.
Publicado: (2025)
por: Wang, Anyi, et al.
Publicado: (2025)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
por: Li, Xiaoyuan, et al.
Publicado: (2024)
por: Li, Xiaoyuan, et al.
Publicado: (2024)
Effectively Steer LLM To Follow Preference via Building Confident Directions
por: Song, Bingqing, et al.
Publicado: (2025)
por: Song, Bingqing, et al.
Publicado: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
por: He, Zirui, et al.
Publicado: (2025)
por: He, Zirui, et al.
Publicado: (2025)
Inference-time Alignment via Sparse Junction Steering
por: Hu, Runyi, et al.
Publicado: (2026)
por: Hu, Runyi, et al.
Publicado: (2026)
Examining False Positives under Inference Scaling for Mathematical Reasoning
por: Wang, Yu, et al.
Publicado: (2025)
por: Wang, Yu, et al.
Publicado: (2025)
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2026)
por: Cho, Seonglae, et al.
Publicado: (2026)
A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities
por: Chen, Jiaqi, et al.
Publicado: (2026)
por: Chen, Jiaqi, et al.
Publicado: (2026)
Reasoning Like a Doctor: Improving Medical Dialogue Systems via Diagnostic Reasoning Process Alignment
por: Xu, Kaishuai, et al.
Publicado: (2024)
por: Xu, Kaishuai, et al.
Publicado: (2024)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
por: Jing, Yi, et al.
Publicado: (2026)
por: Jing, Yi, et al.
Publicado: (2026)
ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders
por: Liu, Xiangyu, et al.
Publicado: (2025)
por: Liu, Xiangyu, et al.
Publicado: (2025)
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders
por: Wu, Zhengxuan, et al.
Publicado: (2025)
por: Wu, Zhengxuan, et al.
Publicado: (2025)
Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
por: Shu, Huizhen, et al.
Publicado: (2025)
por: Shu, Huizhen, et al.
Publicado: (2025)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
por: Liu, Peijie, et al.
Publicado: (2025)
por: Liu, Peijie, et al.
Publicado: (2025)
AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment
por: Xiao, Jianfei, et al.
Publicado: (2026)
por: Xiao, Jianfei, et al.
Publicado: (2026)
Disentangling concept semantics via multilingual averaging in Sparse Autoencoders
por: O'Reilly, Cliff, et al.
Publicado: (2025)
por: O'Reilly, Cliff, et al.
Publicado: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
por: Yeon, Jehyeok, et al.
Publicado: (2025)
por: Yeon, Jehyeok, et al.
Publicado: (2025)
Directional Attractors in LLM Reasoning: How Similarity Retrieval Steers Iterative Summarization Based Reasoning
por: Tekin, Cagatay, et al.
Publicado: (2025)
por: Tekin, Cagatay, et al.
Publicado: (2025)
Ejemplares similares
-
DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning
por: Li, Chengpeng, et al.
Publicado: (2024) -
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
por: Yu, Zhuohao, et al.
Publicado: (2025) -
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
por: Hua, Zhenglin, et al.
Publicado: (2025) -
SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
por: Deng, Boyi, et al.
Publicado: (2025) -
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
por: Zhang, Ruikang, et al.
Publicado: (2026)