IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking
Fuente:
arXiv
Guardado en:
| Autores principales: | Beigi, Mohammad, Jin, Ming, Zhang, Junshan, Zhang, Jiaxin, Wang, Qifan, Huang, Lifu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
por: Beigi, Mohammad, et al.
Publicado: (2026)
por: Beigi, Mohammad, et al.
Publicado: (2026)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
por: Chen, Lichang, et al.
Publicado: (2024)
por: Chen, Lichang, et al.
Publicado: (2024)
Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
por: Beigi, Mohammad, et al.
Publicado: (2025)
por: Beigi, Mohammad, et al.
Publicado: (2025)
Reward Hacking Mitigation using Verifiable Composite Rewards
por: Tarek, Mirza Farhan Bin, et al.
Publicado: (2025)
por: Tarek, Mirza Farhan Bin, et al.
Publicado: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
por: Miao, Yuchun, et al.
Publicado: (2024)
por: Miao, Yuchun, et al.
Publicado: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
por: Deshpande, Darshan, et al.
Publicado: (2026)
por: Deshpande, Darshan, et al.
Publicado: (2026)
TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement Learning
por: Li, Yuxuan, et al.
Publicado: (2025)
por: Li, Yuxuan, et al.
Publicado: (2025)
Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking
por: Laidlaw, Cassidy, et al.
Publicado: (2024)
por: Laidlaw, Cassidy, et al.
Publicado: (2024)
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
por: McKee-Reid, Leo, et al.
Publicado: (2024)
por: McKee-Reid, Leo, et al.
Publicado: (2024)
Learning Rewards, Not Labels: Adversarial Inverse Reinforcement Learning for Machinery Fault Detection
por: Neupane, Dhiraj, et al.
Publicado: (2026)
por: Neupane, Dhiraj, et al.
Publicado: (2026)
Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
por: Roth, Amit, et al.
Publicado: (2026)
por: Roth, Amit, et al.
Publicado: (2026)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
por: Ono, Shinnosuke, et al.
Publicado: (2026)
por: Ono, Shinnosuke, et al.
Publicado: (2026)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking
por: Singha, Disha
Publicado: (2026)
por: Singha, Disha
Publicado: (2026)
MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking
por: Farquhar, Sebastian, et al.
Publicado: (2025)
por: Farquhar, Sebastian, et al.
Publicado: (2025)
Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach
por: Kim, Kihyun, et al.
Publicado: (2026)
por: Kim, Kihyun, et al.
Publicado: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
GARDO: Reinforcing Diffusion Models without Reward Hacking
por: He, Haoran, et al.
Publicado: (2025)
por: He, Haoran, et al.
Publicado: (2025)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
por: Xie, Sean, et al.
Publicado: (2022)
por: Xie, Sean, et al.
Publicado: (2022)
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
por: Schlaginhaufen, Andreas, et al.
Publicado: (2024)
por: Schlaginhaufen, Andreas, et al.
Publicado: (2024)
Mitigating Preference Hacking in Policy Optimization with Pessimism
por: Gupta, Dhawal, et al.
Publicado: (2025)
por: Gupta, Dhawal, et al.
Publicado: (2025)
Interpreting Language Reward Models via Contrastive Explanations
por: Jiang, Junqi, et al.
Publicado: (2024)
por: Jiang, Junqi, et al.
Publicado: (2024)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
por: Helff, Lukas, et al.
Publicado: (2026)
por: Helff, Lukas, et al.
Publicado: (2026)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
por: Lazzati, Filippo, et al.
Publicado: (2025)
por: Lazzati, Filippo, et al.
Publicado: (2025)
Inverse Reinforcement Learning with Switching Rewards and History Dependency for Characterizing Animal Behaviors
por: Ke, Jingyang, et al.
Publicado: (2025)
por: Ke, Jingyang, et al.
Publicado: (2025)
HackAtari: Atari Learning Environments for Robust and Continual Reinforcement Learning
por: Delfosse, Quentin, et al.
Publicado: (2024)
por: Delfosse, Quentin, et al.
Publicado: (2024)
Relative Counterfactual Contrastive Learning for Mitigating Pretrained Stance Bias in Stance Detection
por: Zhang, Jiarui, et al.
Publicado: (2024)
por: Zhang, Jiarui, et al.
Publicado: (2024)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Efficient Reinforcement Learning in Probabilistic Reward Machines
por: Lin, Xiaofeng, et al.
Publicado: (2024)
por: Lin, Xiaofeng, et al.
Publicado: (2024)
Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
por: Thaman, Kunvar
Publicado: (2026)
por: Thaman, Kunvar
Publicado: (2026)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
por: Cheng, Ruoxi, et al.
Publicado: (2025)
por: Cheng, Ruoxi, et al.
Publicado: (2025)
Interpretable Graph-Level Anomaly Detection via Contrast with Normal Prototypes
por: Zhao, Qiuran, et al.
Publicado: (2026)
por: Zhao, Qiuran, et al.
Publicado: (2026)
Process Rewards with Learned Reliability
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
por: Liu, Dengcan, et al.
Publicado: (2026)
por: Liu, Dengcan, et al.
Publicado: (2026)
Topology Reorganized Graph Contrastive Learning with Mitigating Semantic Drift
por: Zhang, Jiaqiang, et al.
Publicado: (2024)
por: Zhang, Jiaqiang, et al.
Publicado: (2024)
Ejemplares similares
-
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
por: Beigi, Mohammad, et al.
Publicado: (2026) -
ODIN: Disentangled Reward Mitigates Hacking in RLHF
por: Chen, Lichang, et al.
Publicado: (2024) -
Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
por: Beigi, Mohammad, et al.
Publicado: (2025) -
Reward Hacking Mitigation using Verifiable Composite Rewards
por: Tarek, Mirza Farhan Bin, et al.
Publicado: (2025) -
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)