Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Laidlaw, Cassidy, Singhal, Shivam, Dragan, Anca |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Effective Horizon Explains Deep RL Performance in Stochastic Environments
par: Laidlaw, Cassidy, et autres
Publié: (2023)
par: Laidlaw, Cassidy, et autres
Publié: (2023)
Bridging RL Theory and Practice with the Effective Horizon
par: Laidlaw, Cassidy, et autres
Publié: (2023)
par: Laidlaw, Cassidy, et autres
Publié: (2023)
Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs
par: Feng, Dylan, et autres
Publié: (2026)
par: Feng, Dylan, et autres
Publié: (2026)
AssistanceZero: Scalably Solving Assistance Games
par: Laidlaw, Cassidy, et autres
Publié: (2025)
par: Laidlaw, Cassidy, et autres
Publié: (2025)
Reward Hacking Mitigation using Verifiable Composite Rewards
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
par: Beigi, Mohammad, et autres
Publié: (2026)
par: Beigi, Mohammad, et autres
Publié: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
Robust Optimization for Mitigating Reward Hacking with Correlated Proxies
par: Liu, Zixuan, et autres
Publié: (2026)
par: Liu, Zixuan, et autres
Publié: (2026)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
par: Siththaranjan, Anand, et autres
Publié: (2023)
par: Siththaranjan, Anand, et autres
Publié: (2023)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
AI Alignment with Changing and Influenceable Reward Functions
par: Carroll, Micah, et autres
Publié: (2024)
par: Carroll, Micah, et autres
Publié: (2024)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
par: Miao, Yuchun, et autres
Publié: (2024)
par: Miao, Yuchun, et autres
Publié: (2024)
Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision
par: Ye, Yaowen, et autres
Publié: (2025)
par: Ye, Yaowen, et autres
Publié: (2025)
Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
par: Roth, Amit, et autres
Publié: (2026)
par: Roth, Amit, et autres
Publié: (2026)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking
par: Beigi, Mohammad, et autres
Publié: (2026)
par: Beigi, Mohammad, et autres
Publié: (2026)
A Generalized Acquisition Function for Preference-based Reward Learning
par: Ellis, Evan, et autres
Publié: (2024)
par: Ellis, Evan, et autres
Publié: (2024)
Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking
par: Singha, Disha
Publié: (2026)
par: Singha, Disha
Publié: (2026)
MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking
par: Farquhar, Sebastian, et autres
Publié: (2025)
par: Farquhar, Sebastian, et autres
Publié: (2025)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
par: Wang, Chaoqi, et autres
Publié: (2025)
par: Wang, Chaoqi, et autres
Publié: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
par: Gupta, Dhawal, et autres
Publié: (2025)
par: Gupta, Dhawal, et autres
Publié: (2025)
Learning to Assist Humans without Inferring Rewards
par: Myers, Vivek, et autres
Publié: (2024)
par: Myers, Vivek, et autres
Publié: (2024)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
par: Helff, Lukas, et autres
Publié: (2026)
par: Helff, Lukas, et autres
Publié: (2026)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Adversaries Can Misuse Combinations of Safe Models
par: Jones, Erik, et autres
Publié: (2024)
par: Jones, Erik, et autres
Publié: (2024)
Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
par: Thaman, Kunvar
Publié: (2026)
par: Thaman, Kunvar
Publié: (2026)
Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making
par: Myers, Vivek, et autres
Publié: (2024)
par: Myers, Vivek, et autres
Publié: (2024)
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
par: McKee-Reid, Leo, et autres
Publié: (2024)
par: McKee-Reid, Leo, et autres
Publié: (2024)
Feedback Loops With Language Models Drive In-Context Reward Hacking
par: Pan, Alexander, et autres
Publié: (2024)
par: Pan, Alexander, et autres
Publié: (2024)
Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
par: Khalifa, Muhammad, et autres
Publié: (2026)
par: Khalifa, Muhammad, et autres
Publié: (2026)
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
par: Deshpande, Darshan, et autres
Publié: (2026)
par: Deshpande, Darshan, et autres
Publié: (2026)
When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback
par: Lang, Leon, et autres
Publié: (2024)
par: Lang, Leon, et autres
Publié: (2024)
On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
par: Williams, Marcus, et autres
Publié: (2024)
par: Williams, Marcus, et autres
Publié: (2024)
Training LLM Agents to Empower Humans
par: Ellis, Evan, et autres
Publié: (2025)
par: Ellis, Evan, et autres
Publié: (2025)
GARDO: Reinforcing Diffusion Models without Reward Hacking
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Rethinking the Role of Proxy Rewards in Language Model Alignment
par: Kim, Sungdong, et autres
Publié: (2024)
par: Kim, Sungdong, et autres
Publié: (2024)
Documents similaires
-
The Effective Horizon Explains Deep RL Performance in Stochastic Environments
par: Laidlaw, Cassidy, et autres
Publié: (2023) -
Bridging RL Theory and Practice with the Effective Horizon
par: Laidlaw, Cassidy, et autres
Publié: (2023) -
Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs
par: Feng, Dylan, et autres
Publié: (2026) -
AssistanceZero: Scalably Solving Assistance Games
par: Laidlaw, Cassidy, et autres
Publié: (2025) -
Reward Hacking Mitigation using Verifiable Composite Rewards
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)