SteerRM: Debiasing Reward Models via Sparse Autoencoders
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Mengyuan, Yu, Zhuohao, Gu, Weizheng, Zhang, Shikun, Ye, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
di: Liu, Dengcan, et al.
Pubblicazione: (2025)
di: Liu, Dengcan, et al.
Pubblicazione: (2025)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
di: Shi, Wei, et al.
Pubblicazione: (2025)
di: Shi, Wei, et al.
Pubblicazione: (2025)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
di: Fang, Yi, et al.
Pubblicazione: (2026)
di: Fang, Yi, et al.
Pubblicazione: (2026)
Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
di: Yang, Haotong, et al.
Pubblicazione: (2026)
di: Yang, Haotong, et al.
Pubblicazione: (2026)
RM-R1: Reward Modeling as Reasoning
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
di: Hua, Zhenglin, et al.
Pubblicazione: (2025)
di: Hua, Zhenglin, et al.
Pubblicazione: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering
di: Xie, Jiaqing
Pubblicazione: (2025)
di: Xie, Jiaqing
Pubblicazione: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs
di: Härle, Ruben, et al.
Pubblicazione: (2024)
di: Härle, Ruben, et al.
Pubblicazione: (2024)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
di: Liang, Yu, et al.
Pubblicazione: (2026)
di: Liang, Yu, et al.
Pubblicazione: (2026)
Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models
di: Wu, Jiayun, et al.
Pubblicazione: (2026)
di: Wu, Jiayun, et al.
Pubblicazione: (2026)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
di: Li, Yichen, et al.
Pubblicazione: (2025)
di: Li, Yichen, et al.
Pubblicazione: (2025)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
di: Zhang, Ruikang, et al.
Pubblicazione: (2026)
di: Zhang, Ruikang, et al.
Pubblicazione: (2026)
Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection
di: Ghussin, Yusser Al, et al.
Pubblicazione: (2026)
di: Ghussin, Yusser Al, et al.
Pubblicazione: (2026)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
di: Liu, Shujun, et al.
Pubblicazione: (2024)
di: Liu, Shujun, et al.
Pubblicazione: (2024)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
di: Qin, Kai, et al.
Pubblicazione: (2026)
di: Qin, Kai, et al.
Pubblicazione: (2026)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
di: Liu, Yantao, et al.
Pubblicazione: (2024)
di: Liu, Yantao, et al.
Pubblicazione: (2024)
What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?
di: Gu, Weizheng, et al.
Pubblicazione: (2026)
di: Gu, Weizheng, et al.
Pubblicazione: (2026)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
di: Deng, Boyi, et al.
Pubblicazione: (2025)
di: Deng, Boyi, et al.
Pubblicazione: (2025)
Instruction Data Selection via Answer Divergence
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
Debiasing Reward Models via Causally Motivated Inference-Time Intervention
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2026)
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2026)
Understanding Refusal in Language Models with Sparse Autoencoders
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
di: Agarwal, Mayank, et al.
Pubblicazione: (2025)
di: Agarwal, Mayank, et al.
Pubblicazione: (2025)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
di: Cho, Seonglae, et al.
Pubblicazione: (2025)
di: Cho, Seonglae, et al.
Pubblicazione: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
di: Li, Renhao, et al.
Pubblicazione: (2025)
di: Li, Renhao, et al.
Pubblicazione: (2025)
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types
di: Mou, Yutao, et al.
Pubblicazione: (2024)
di: Mou, Yutao, et al.
Pubblicazione: (2024)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
di: Zhang, Pinyi, et al.
Pubblicazione: (2026)
di: Zhang, Pinyi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
di: Yu, Zhuohao, et al.
Pubblicazione: (2025) -
RewardAnything: Generalizable Principle-Following Reward Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2025) -
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
di: Yu, Zhuohao, et al.
Pubblicazione: (2024) -
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
di: Liu, Dengcan, et al.
Pubblicazione: (2025) -
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
di: Shi, Wei, et al.
Pubblicazione: (2025)