Binary Rewards and Reinforcement Learning: Fundamental Challenges
Fuente:
arXiv
Guardado en:
| Autor principal: | Dymetman, Marc |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exponential families from a single KL identity
por: Dymetman, Marc
Publicado: (2026)
por: Dymetman, Marc
Publicado: (2026)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
por: Xu, Yinglun, et al.
Publicado: (2024)
por: Xu, Yinglun, et al.
Publicado: (2024)
Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity
por: Kruszewski, Germán, et al.
Publicado: (2025)
por: Kruszewski, Germán, et al.
Publicado: (2025)
Compositional preference models for aligning LMs
por: Go, Dongyoung, et al.
Publicado: (2023)
por: Go, Dongyoung, et al.
Publicado: (2023)
Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation
por: Pan, Pei-Chi, et al.
Publicado: (2026)
por: Pan, Pei-Chi, et al.
Publicado: (2026)
Reward-Conditioned Reinforcement Learning
por: Nauman, Michal, et al.
Publicado: (2026)
por: Nauman, Michal, et al.
Publicado: (2026)
What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?
por: Shihab, Ibne Farabi, et al.
Publicado: (2025)
por: Shihab, Ibne Farabi, et al.
Publicado: (2025)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
por: Wang, Longwen, et al.
Publicado: (2026)
por: Wang, Longwen, et al.
Publicado: (2026)
Reinforcement Learning from Bagged Reward
por: Tang, Yuting, et al.
Publicado: (2024)
por: Tang, Yuting, et al.
Publicado: (2024)
The Value of Reward Lookahead in Reinforcement Learning
por: Merlis, Nadav, et al.
Publicado: (2024)
por: Merlis, Nadav, et al.
Publicado: (2024)
Informativeness of Reward Functions in Reinforcement Learning
por: Devidze, Rati, et al.
Publicado: (2024)
por: Devidze, Rati, et al.
Publicado: (2024)
Reward Design for Reinforcement Learning Agents
por: Devidze, Rati
Publicado: (2025)
por: Devidze, Rati
Publicado: (2025)
To the Max: Reinventing Reward in Reinforcement Learning
por: Veviurko, Grigorii, et al.
Publicado: (2024)
por: Veviurko, Grigorii, et al.
Publicado: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
por: Huang, Yu, et al.
Publicado: (2026)
por: Huang, Yu, et al.
Publicado: (2026)
The Distributional Reward Critic Framework for Reinforcement Learning Under Perturbed Rewards
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
Reward-Preserving Attacks For Robust Reinforcement Learning
por: Schott, Lucas, et al.
Publicado: (2026)
por: Schott, Lucas, et al.
Publicado: (2026)
RDA: Reward Design Agent for Reinforcement Learning
por: Lee, Hojoon, et al.
Publicado: (2026)
por: Lee, Hojoon, et al.
Publicado: (2026)
Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning
por: Zhang, Heng, et al.
Publicado: (2026)
por: Zhang, Heng, et al.
Publicado: (2026)
Code as Reward: Empowering Reinforcement Learning with VLMs
por: Venuto, David, et al.
Publicado: (2024)
por: Venuto, David, et al.
Publicado: (2024)
Effective Reward Specification in Deep Reinforcement Learning
por: Roy, Julien
Publicado: (2024)
por: Roy, Julien
Publicado: (2024)
Risk-Averse Total-Reward Reinforcement Learning
por: Su, Xihong, et al.
Publicado: (2025)
por: Su, Xihong, et al.
Publicado: (2025)
Reward-Aware Proto-Representations in Reinforcement Learning
por: Tse, Hon Tik, et al.
Publicado: (2025)
por: Tse, Hon Tik, et al.
Publicado: (2025)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
por: Tang, Yuting, et al.
Publicado: (2024)
por: Tang, Yuting, et al.
Publicado: (2024)
Reinforcement Learning with Symbolic Reward Machines
por: Krug, Thomas, et al.
Publicado: (2026)
por: Krug, Thomas, et al.
Publicado: (2026)
Reinforcement Learning with Exogenous States and Rewards
por: Trimponias, George, et al.
Publicado: (2023)
por: Trimponias, George, et al.
Publicado: (2023)
Reinforcement Learning with Stochastic Reward Machines
por: Corazza, Jan, et al.
Publicado: (2025)
por: Corazza, Jan, et al.
Publicado: (2025)
Offline Reinforcement Learning with Imputed Rewards
por: Romeo, Carlo, et al.
Publicado: (2024)
por: Romeo, Carlo, et al.
Publicado: (2024)
Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards
por: Heckel, Reinhard, et al.
Publicado: (2026)
por: Heckel, Reinhard, et al.
Publicado: (2026)
On Feasible Rewards in Multi-Agent Inverse Reinforcement Learning
por: Freihaut, Till, et al.
Publicado: (2024)
por: Freihaut, Till, et al.
Publicado: (2024)
Bayesian Inverse Reinforcement Learning for Non-Markovian Rewards
por: Topper, Noah, et al.
Publicado: (2024)
por: Topper, Noah, et al.
Publicado: (2024)
Deep Reinforcement Learning with Hybrid Intrinsic Reward Model
por: Yuan, Mingqi, et al.
Publicado: (2025)
por: Yuan, Mingqi, et al.
Publicado: (2025)
Curriculum Reinforcement Learning for Complex Reward Functions
por: Freitag, Kilian, et al.
Publicado: (2024)
por: Freitag, Kilian, et al.
Publicado: (2024)
On-Robot Reinforcement Learning with Goal-Contrastive Rewards
por: Biza, Ondrej, et al.
Publicado: (2024)
por: Biza, Ondrej, et al.
Publicado: (2024)
Challenges in Binary Classification
por: Yang, Pengbo, et al.
Publicado: (2024)
por: Yang, Pengbo, et al.
Publicado: (2024)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
por: Yin, Shuyu, et al.
Publicado: (2024)
por: Yin, Shuyu, et al.
Publicado: (2024)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
por: Ishihara, Yu, et al.
Publicado: (2025)
por: Ishihara, Yu, et al.
Publicado: (2025)
A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning
por: Chen, Ying-Tu, et al.
Publicado: (2026)
por: Chen, Ying-Tu, et al.
Publicado: (2026)
PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward
por: Zhou, Weichao, et al.
Publicado: (2023)
por: Zhou, Weichao, et al.
Publicado: (2023)
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
por: Zeng, Guanning, et al.
Publicado: (2025)
por: Zeng, Guanning, et al.
Publicado: (2025)
Reinforcement Learning From Imperfect Corrective Actions And Proxy Rewards
por: Jiang, Zhaohui, et al.
Publicado: (2024)
por: Jiang, Zhaohui, et al.
Publicado: (2024)
Ejemplares similares
-
Exponential families from a single KL identity
por: Dymetman, Marc
Publicado: (2026) -
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
por: Xu, Yinglun, et al.
Publicado: (2024) -
Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity
por: Kruszewski, Germán, et al.
Publicado: (2025) -
Compositional preference models for aligning LMs
por: Go, Dongyoung, et al.
Publicado: (2023) -
Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation
por: Pan, Pei-Chi, et al.
Publicado: (2026)