Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yifeng, Ouyang, Siqi, Revanasiddappa, Yatish Hosmane, Li, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
par: Deng, Wenlong, et autres
Publié: (2026)
par: Deng, Wenlong, et autres
Publié: (2026)
RRM: Robust Reward Model Training Mitigates Reward Hacking
par: Liu, Tianqi, et autres
Publié: (2024)
par: Liu, Tianqi, et autres
Publié: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
CMU's IWSLT 2025 Simultaneous Speech Translation System
par: Ouyang, Siqi, et autres
Publié: (2025)
par: Ouyang, Siqi, et autres
Publié: (2025)
RASST: Fast Cross-modal Retrieval-Augmented Simultaneous Speech Translation
par: Luo, Jiaxuan, et autres
Publié: (2026)
par: Luo, Jiaxuan, et autres
Publié: (2026)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations
par: Ferreira, Pedro, et autres
Publié: (2025)
par: Ferreira, Pedro, et autres
Publié: (2025)
InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Model
par: Ouyang, Siqi, et autres
Publié: (2025)
par: Ouyang, Siqi, et autres
Publié: (2025)
Translation Canvas: An Explainable Interface to Pinpoint and Analyze Translation Systems
par: Dandekar, Chinmay, et autres
Publié: (2024)
par: Dandekar, Chinmay, et autres
Publié: (2024)
When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signals
par: Wu, Rui, et autres
Publié: (2026)
par: Wu, Rui, et autres
Publié: (2026)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
FASST: Fast LLM-based Simultaneous Speech Translation
par: Ouyang, Siqi, et autres
Publié: (2024)
par: Ouyang, Siqi, et autres
Publié: (2024)
CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech Translation
par: Xu, Xi, et autres
Publié: (2024)
par: Xu, Xi, et autres
Publié: (2024)
Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement
par: Gallego, Víctor
Publié: (2025)
par: Gallego, Víctor
Publié: (2025)
Paths Not Taken: Understanding and Mending the Multilingual Factual Recall Pipeline
par: Lu, Meng, et autres
Publié: (2025)
par: Lu, Meng, et autres
Publié: (2025)
Detecting and Suppressing Reward Hacking with Gradient Fingerprints
par: Wang, Songtao, et autres
Publié: (2026)
par: Wang, Songtao, et autres
Publié: (2026)
Spontaneous Reward Hacking in Iterative Self-Refinement
par: Pan, Jane, et autres
Publié: (2024)
par: Pan, Jane, et autres
Publié: (2024)
Mitigating Language Barriers in Education: Developing Multilingual Digital Learning Materials with Machine Translation
par: Poláková, Lucie, et autres
Publié: (2025)
par: Poláková, Lucie, et autres
Publié: (2025)
Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech
par: Ouyang, Siqi, et autres
Publié: (2026)
par: Ouyang, Siqi, et autres
Publié: (2026)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
par: Turpin, Miles, et autres
Publié: (2025)
par: Turpin, Miles, et autres
Publié: (2025)
Anticipating Future with Large Language Model for Simultaneous Machine Translation
par: Ouyang, Siqi, et autres
Publié: (2024)
par: Ouyang, Siqi, et autres
Publié: (2024)
MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation
par: Lu, Zhixiang, et autres
Publié: (2026)
par: Lu, Zhixiang, et autres
Publié: (2026)
Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
par: Zang, Jianxiang
Publié: (2025)
par: Zang, Jianxiang
Publié: (2025)
Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
par: Song, Junjie, et autres
Publié: (2025)
par: Song, Junjie, et autres
Publié: (2025)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
par: Yang, Wenjie, et autres
Publié: (2025)
par: Yang, Wenjie, et autres
Publié: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
par: Li, Zhaoyan, et autres
Publié: (2026)
par: Li, Zhaoyan, et autres
Publié: (2026)
Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
par: Zhou, Jiang, et autres
Publié: (2026)
par: Zhou, Jiang, et autres
Publié: (2026)
Conditions for Catastrophic Forgetting in Multilingual Translation
par: Liu, Danni, et autres
Publié: (2025)
par: Liu, Danni, et autres
Publié: (2025)
Monitoring Emergent Reward Hacking During Generation via Internal Activations
par: Wilhelm, Patrick, et autres
Publié: (2026)
par: Wilhelm, Patrick, et autres
Publié: (2026)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
par: Zhu, Wenhao, et autres
Publié: (2023)
par: Zhu, Wenhao, et autres
Publié: (2023)
Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort
par: Wang, Xinpeng, et autres
Publié: (2025)
par: Wang, Xinpeng, et autres
Publié: (2025)
CMU's IWSLT 2024 Simultaneous Speech Translation System
par: Xu, Xi, et autres
Publié: (2024)
par: Xu, Xi, et autres
Publié: (2024)
Feedback Loops With Language Models Drive In-Context Reward Hacking
par: Pan, Alexander, et autres
Publié: (2024)
par: Pan, Alexander, et autres
Publié: (2024)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
par: Wang, Jiaan, et autres
Publié: (2025)
par: Wang, Jiaan, et autres
Publié: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
Learning When to Translate for Multilingual Reasoning
par: Kang, Deokhyung, et autres
Publié: (2026)
par: Kang, Deokhyung, et autres
Publié: (2026)
Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Documents similaires
-
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
par: Deng, Wenlong, et autres
Publié: (2026) -
RRM: Robust Reward Model Training Mitigates Reward Hacking
par: Liu, Tianqi, et autres
Publié: (2024) -
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025) -
CMU's IWSLT 2025 Simultaneous Speech Translation System
par: Ouyang, Siqi, et autres
Publié: (2025) -
RASST: Fast Cross-modal Retrieval-Augmented Simultaneous Speech Translation
par: Luo, Jiaxuan, et autres
Publié: (2026)