Reward Models in Deep Reinforcement Learning: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Rui, Wan, Shenghua, Wang, Yucen, Gao, Chen-Xiao, Gan, Le, Zhang, Zongzhang, Zhan, De-Chuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making
di: Wang, Yucen, et al.
Pubblicazione: (2025)
di: Wang, Yucen, et al.
Pubblicazione: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
DIDA: Denoised Imitation Learning based on Domain Adaptation
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
AD3: Implicit Action is the Key for World Models to Distinguish the Diverse Visual Distractors
di: Wang, Yucen, et al.
Pubblicazione: (2024)
di: Wang, Yucen, et al.
Pubblicazione: (2024)
SENSOR: Imitate Third-Person Expert's Behaviors via Active Sensoring
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
ACT: Empowering Decision Transformer with Dynamic Programming via Advantage Conditioning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2023)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2023)
Weight Scope Alignment: A Frustratingly Easy Method for Model Merging
di: Xu, Yichu, et al.
Pubblicazione: (2024)
di: Xu, Yichu, et al.
Pubblicazione: (2024)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
di: Zhang, Shun, et al.
Pubblicazione: (2024)
di: Zhang, Shun, et al.
Pubblicazione: (2024)
SeMOPO: Learning High-quality Model and Policy from Low-quality Offline Visual Datasets
di: Wan, Shenghua, et al.
Pubblicazione: (2024)
di: Wan, Shenghua, et al.
Pubblicazione: (2024)
Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective
di: He, Shenghua, et al.
Pubblicazione: (2025)
di: He, Shenghua, et al.
Pubblicazione: (2025)
Disentangling Policy from Offline Task Representation Learning via Adversarial Data Augmentation
di: Jia, Chengxing, et al.
Pubblicazione: (2024)
di: Jia, Chengxing, et al.
Pubblicazione: (2024)
A Survey on Explainable Deep Reinforcement Learning
di: Cheng, Zelei, et al.
Pubblicazione: (2025)
di: Cheng, Zelei, et al.
Pubblicazione: (2025)
PathGPT: Reframing Path Recommendation as a Natural Language Generation Task with Retrieval-Augmented Language Models
di: Marcelyn, Steeve Cuthbert, et al.
Pubblicazione: (2025)
di: Marcelyn, Steeve Cuthbert, et al.
Pubblicazione: (2025)
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
di: Lyu, Jiafei, et al.
Pubblicazione: (2024)
di: Lyu, Jiafei, et al.
Pubblicazione: (2024)
Diffusion Models for Reinforcement Learning: A Survey
di: Zhu, Zhengbang, et al.
Pubblicazione: (2023)
di: Zhu, Zhengbang, et al.
Pubblicazione: (2023)
Debiased Offline Representation Learning for Fast Online Adaptation in Non-stationary Dynamics
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
Structure in Deep Reinforcement Learning: A Survey and Open Problems
di: Mohan, Aditya, et al.
Pubblicazione: (2023)
di: Mohan, Aditya, et al.
Pubblicazione: (2023)
Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes
di: Vora, Kevin, et al.
Pubblicazione: (2025)
di: Vora, Kevin, et al.
Pubblicazione: (2025)
Wireless Traffic Prediction with Large Language Model
di: Zhang, Chuanting, et al.
Pubblicazione: (2025)
di: Zhang, Chuanting, et al.
Pubblicazione: (2025)
Efficient Reinforcement Learning in Probabilistic Reward Machines
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
Provable Reward-Agnostic Preference-Based Reinforcement Learning
di: Zhan, Wenhao, et al.
Pubblicazione: (2023)
di: Zhan, Wenhao, et al.
Pubblicazione: (2023)
Reinforcement Learning with Conditional Expectation Reward
di: Xiao, Changyi, et al.
Pubblicazione: (2026)
di: Xiao, Changyi, et al.
Pubblicazione: (2026)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2024)
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2024)
A Survey of State Representation Learning for Deep Reinforcement Learning
di: Echchahed, Ayoub, et al.
Pubblicazione: (2025)
di: Echchahed, Ayoub, et al.
Pubblicazione: (2025)
APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport
di: Li, Zhuo, et al.
Pubblicazione: (2025)
di: Li, Zhuo, et al.
Pubblicazione: (2025)
A Survey Analyzing Generalization in Deep Reinforcement Learning
di: Korkmaz, Ezgi
Pubblicazione: (2024)
di: Korkmaz, Ezgi
Pubblicazione: (2024)
Plasticity Loss in Deep Reinforcement Learning: A Survey
di: Klein, Timo, et al.
Pubblicazione: (2024)
di: Klein, Timo, et al.
Pubblicazione: (2024)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2025)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2025)
Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards
di: Bai, Bizhe, et al.
Pubblicazione: (2026)
di: Bai, Bizhe, et al.
Pubblicazione: (2026)
Permutation Equivariant Model-based Offline Reinforcement Learning for Auto-bidding
di: Mou, Zhiyu, et al.
Pubblicazione: (2025)
di: Mou, Zhiyu, et al.
Pubblicazione: (2025)
A Review of Reinforcement Learning in Financial Applications
di: Bai, Yahui, et al.
Pubblicazione: (2024)
di: Bai, Yahui, et al.
Pubblicazione: (2024)
Exploring and Exploiting the Asymmetric Valley of Deep Neural Networks
di: Li, Xin-Chun, et al.
Pubblicazione: (2024)
di: Li, Xin-Chun, et al.
Pubblicazione: (2024)
TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement Learning
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
di: Zhu, Jin, et al.
Pubblicazione: (2023)
di: Zhu, Jin, et al.
Pubblicazione: (2023)
PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
di: Li, Mengdi, et al.
Pubblicazione: (2025)
di: Li, Mengdi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making
di: Wang, Yucen, et al.
Pubblicazione: (2025) -
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024) -
DIDA: Denoised Imitation Learning based on Domain Adaptation
di: Huang, Kaichen, et al.
Pubblicazione: (2024) -
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025) -
AD3: Implicit Action is the Key for World Models to Distinguish the Diverse Visual Distractors
di: Wang, Yucen, et al.
Pubblicazione: (2024)