Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Yuting, Cai, Xin-Qiang, Pang, Jing-Cheng, Wu, Qiyu, Ding, Yao-Xiang, Sugiyama, Masashi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning from Bagged Reward
par: Tang, Yuting, et autres
Publié: (2024)
par: Tang, Yuting, et autres
Publié: (2024)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025)
par: Cai, Xin-Qiang, et autres
Publié: (2025)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
par: Ackermann, Johannes, et autres
Publié: (2025)
par: Ackermann, Johannes, et autres
Publié: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
Recursive Reward Aggregation
par: Tang, Yuting, et autres
Publié: (2025)
par: Tang, Yuting, et autres
Publié: (2025)
Bayesian Inverse Reinforcement Learning for Non-Markovian Rewards
par: Topper, Noah, et autres
Publié: (2024)
par: Topper, Noah, et autres
Publié: (2024)
Offline Reinforcement Learning with Domain-Unlabeled Data
par: Nishimori, Soichiro, et autres
Publié: (2024)
par: Nishimori, Soichiro, et autres
Publié: (2024)
VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
par: Cai, Xin-Qiang, et autres
Publié: (2026)
par: Cai, Xin-Qiang, et autres
Publié: (2026)
Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes
par: Trapasso, Alessandro, et autres
Publié: (2025)
par: Trapasso, Alessandro, et autres
Publié: (2025)
ReLAM: Learning Anticipation Model for Rewarding Visual Robotic Manipulation
par: Tang, Nan, et autres
Publié: (2025)
par: Tang, Nan, et autres
Publié: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
Multiplicative Rewards in Markovian Models
par: Baier, Christel, et autres
Publié: (2025)
par: Baier, Christel, et autres
Publié: (2025)
Offline Reinforcement Learning from Datasets with Structured Non-Stationarity
par: Ackermann, Johannes, et autres
Publié: (2024)
par: Ackermann, Johannes, et autres
Publié: (2024)
2048: Reinforcement Learning in a Delayed Reward Environment
par: Saligram, Prady, et autres
Publié: (2025)
par: Saligram, Prady, et autres
Publié: (2025)
UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality
par: Cheng, Zelei, et autres
Publié: (2025)
par: Cheng, Zelei, et autres
Publié: (2025)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
par: Zhang, Zhen-Yu, et autres
Publié: (2026)
par: Zhang, Zhen-Yu, et autres
Publié: (2026)
Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Learning Personalized Ad Impact via Contextual Reinforcement Learning under Delayed Rewards
par: Cheng, Yuwei, et autres
Publié: (2025)
par: Cheng, Yuwei, et autres
Publié: (2025)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
par: Luo, Yihong, et autres
Publié: (2026)
par: Luo, Yihong, et autres
Publié: (2026)
Beyond Rewards in Reinforcement Learning for Cyber Defence
par: Bates, Elizabeth, et autres
Publié: (2026)
par: Bates, Elizabeth, et autres
Publié: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
par: Bai, Yang, et autres
Publié: (2026)
par: Bai, Yang, et autres
Publié: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Diffusion Classifier-Driven Reward for Offline Preference-based Reinforcement Learning
par: Pang, Teng, et autres
Publié: (2025)
par: Pang, Teng, et autres
Publié: (2025)
Hedging with Sparse Reward Reinforcement Learning
par: Ding, Yiheng, et autres
Publié: (2025)
par: Ding, Yiheng, et autres
Publié: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Deep Reinforcement Learning with Hybrid Intrinsic Reward Model
par: Yuan, Mingqi, et autres
Publié: (2025)
par: Yuan, Mingqi, et autres
Publié: (2025)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
par: Lan, Guangchen, et autres
Publié: (2026)
par: Lan, Guangchen, et autres
Publié: (2026)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
par: Yang, Wenjie, et autres
Publié: (2025)
par: Yang, Wenjie, et autres
Publié: (2025)
Game Rewards Vulnerabilities: Software Vulnerability Detection with Zero-Sum Game and Prototype Learning
par: Wen, Xin-Cheng, et autres
Publié: (2024)
par: Wen, Xin-Cheng, et autres
Publié: (2024)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
par: Holmes, Ian, et autres
Publié: (2025)
par: Holmes, Ian, et autres
Publié: (2025)
Compensatory Mechanisms in Prefrontal and Reward Systems Reveal Delayed Brain Aging in Musicians
par: Rui Ma, et autres
Publié: (2025)
par: Rui Ma, et autres
Publié: (2025)
Deep Reinforcement Learning for Cloud Manufacturing Task Scheduling via Sparse‐Reward Optimization
par: Shanchen Pang, et autres
Publié: (2026)
par: Shanchen Pang, et autres
Publié: (2026)
Reinforcement Learning with Options and State Representation
par: Ghriss, Ayoub, et autres
Publié: (2024)
par: Ghriss, Ayoub, et autres
Publié: (2024)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Reward Model Routing in Alignment
par: Wu, Xinle, et autres
Publié: (2025)
par: Wu, Xinle, et autres
Publié: (2025)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
BCR-DRL: Behavior- and Context-aware Reward for Deep Reinforcement Learning in Human-AI Coordination
par: Hao, Xin, et autres
Publié: (2024)
par: Hao, Xin, et autres
Publié: (2024)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
Documents similaires
-
Reinforcement Learning from Bagged Reward
par: Tang, Yuting, et autres
Publié: (2024) -
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025) -
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
par: Ackermann, Johannes, et autres
Publié: (2025) -
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026) -
Recursive Reward Aggregation
par: Tang, Yuting, et autres
Publié: (2025)