When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signals
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Rui, Tang, Ruixiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
par: Deng, Wenlong, et autres
Publié: (2026)
par: Deng, Wenlong, et autres
Publié: (2026)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Detecting and Suppressing Reward Hacking with Gradient Fingerprints
par: Wang, Songtao, et autres
Publié: (2026)
par: Wang, Songtao, et autres
Publié: (2026)
Feedback Loops With Language Models Drive In-Context Reward Hacking
par: Pan, Alexander, et autres
Publié: (2024)
par: Pan, Alexander, et autres
Publié: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
A Representation-Level Assessment of Bias Mitigation in Foundation Models
par: Nizhnichenkov, Svetoslav, et autres
Publié: (2026)
par: Nizhnichenkov, Svetoslav, et autres
Publié: (2026)
Read the Scene, Not the Script: Outcome-Aware Safety for LLMs
par: Wu, Rui, et autres
Publié: (2025)
par: Wu, Rui, et autres
Publié: (2025)
DBR: Divergence-Based Regularization for Debiasing Natural Language Understanding Models
par: Li, Zihao, et autres
Publié: (2025)
par: Li, Zihao, et autres
Publié: (2025)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
par: Khalifa, Muhammad, et autres
Publié: (2026)
par: Khalifa, Muhammad, et autres
Publié: (2026)
Scalable Ensembling For Mitigating Reward Overoptimisation
par: Ahmed, Ahmed M., et autres
Publié: (2024)
par: Ahmed, Ahmed M., et autres
Publié: (2024)
When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models
par: Xie, Tong, et autres
Publié: (2025)
par: Xie, Tong, et autres
Publié: (2025)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
par: Tao, Leitian, et autres
Publié: (2025)
par: Tao, Leitian, et autres
Publié: (2025)
Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs
par: Sahoo, Subramanyam
Publié: (2026)
par: Sahoo, Subramanyam
Publié: (2026)
Diagnosing and Mitigating System Bias in Self-Rewarding RL
par: Tan, Chuyi, et autres
Publié: (2025)
par: Tan, Chuyi, et autres
Publié: (2025)
Navigating the Shortcut Maze: A Comprehensive Analysis of Shortcut Learning in Text Classification by Language Models
par: Zhou, Yuqing, et autres
Publié: (2024)
par: Zhou, Yuqing, et autres
Publié: (2024)
Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment
par: Lu, Keming, et autres
Publié: (2024)
par: Lu, Keming, et autres
Publié: (2024)
RRM: Robust Reward Model Training Mitigates Reward Hacking
par: Liu, Tianqi, et autres
Publié: (2024)
par: Liu, Tianqi, et autres
Publié: (2024)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
par: Kumar, Abhijit, et autres
Publié: (2026)
par: Kumar, Abhijit, et autres
Publié: (2026)
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
par: Lian, Jiesong, et autres
Publié: (2025)
par: Lian, Jiesong, et autres
Publié: (2025)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
par: Yu, Yongcan, et autres
Publié: (2026)
par: Yu, Yongcan, et autres
Publié: (2026)
Exploration Hacking: Can LLMs Learn to Resist RL Training?
par: Jang, Eyon, et autres
Publié: (2026)
par: Jang, Eyon, et autres
Publié: (2026)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
par: Chen, Tong, et autres
Publié: (2025)
par: Chen, Tong, et autres
Publié: (2025)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
par: Ma, Qiyao, et autres
Publié: (2026)
par: Ma, Qiyao, et autres
Publié: (2026)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
par: Fan, Mingyuan, et autres
Publié: (2026)
par: Fan, Mingyuan, et autres
Publié: (2026)
On Teacher Hacking in Language Model Distillation
par: Tiapkin, Daniil, et autres
Publié: (2025)
par: Tiapkin, Daniil, et autres
Publié: (2025)
TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
par: Li, Jiaqian, et autres
Publié: (2026)
par: Li, Jiaqian, et autres
Publié: (2026)
Demystifying When Pruning Works via Representation Hierarchies
par: He, Shwai, et autres
Publié: (2026)
par: He, Shwai, et autres
Publié: (2026)
When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
par: Le, Khoi, et autres
Publié: (2026)
par: Le, Khoi, et autres
Publié: (2026)
Studying the Korean Word-Chain Game with RLVR: Mitigating Reward Conflicts via Curriculum Learning
par: Rho, Donghwan
Publié: (2025)
par: Rho, Donghwan
Publié: (2025)
Reward Hacking Mitigation using Verifiable Composite Rewards
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
par: Zhu, Banghua, et autres
Publié: (2024)
par: Zhu, Banghua, et autres
Publié: (2024)
AGR: Age Group fairness Reward for Bias Mitigation in LLMs
par: Cao, Shuirong, et autres
Publié: (2024)
par: Cao, Shuirong, et autres
Publié: (2024)
Bayesian Preference Learning for Test-Time Steerable Reward Models
par: Hong, Jiwoo, et autres
Publié: (2026)
par: Hong, Jiwoo, et autres
Publié: (2026)
Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs
par: Yan, Lecheng, et autres
Publié: (2026)
par: Yan, Lecheng, et autres
Publié: (2026)
Documents similaires
-
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025) -
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024) -
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
par: Deng, Wenlong, et autres
Publié: (2026) -
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026) -
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)