Towards better dense rewards in Reinforcement Learning Applications
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Zhang, Shuyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Episodic Reinforcement Learning with Expanded State-reward Space
par: Liang, Dayang, et autres
Publié: (2024)
par: Liang, Dayang, et autres
Publié: (2024)
The impact of intrinsic rewards on exploration in Reinforcement Learning
par: Kayal, Aya, et autres
Publié: (2025)
par: Kayal, Aya, et autres
Publié: (2025)
Deep Reinforcement Learning with anticipatory reward in LSTM for Collision Avoidance of Mobile Robots
par: Poulet, Olivier, et autres
Publié: (2025)
par: Poulet, Olivier, et autres
Publié: (2025)
Incorporating Spatial Information into Goal-Conditioned Hierarchical Reinforcement Learning via Graph Representations
par: Zhang, Shuyuan, et autres
Publié: (2025)
par: Zhang, Shuyuan, et autres
Publié: (2025)
Self-rewarding correction for mathematical reasoning
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Towards better Human-Agent Alignment: Assessing Task Utility in LLM-Powered Applications
par: Arabzadeh, Negar, et autres
Publié: (2024)
par: Arabzadeh, Negar, et autres
Publié: (2024)
EVAL: EigenVector-based Average-reward Learning
par: Adamczyk, Jacob, et autres
Publié: (2025)
par: Adamczyk, Jacob, et autres
Publié: (2025)
What should be observed for optimal reward in POMDPs?
par: Konsta, Alyzia-Maria, et autres
Publié: (2024)
par: Konsta, Alyzia-Maria, et autres
Publié: (2024)
Streaming Looking Ahead with Token-level Self-reward
par: Zhang, Hongming, et autres
Publié: (2025)
par: Zhang, Hongming, et autres
Publié: (2025)
Noise-based reward-modulated learning
par: Fernández, Jesús García, et autres
Publié: (2025)
par: Fernández, Jesús García, et autres
Publié: (2025)
Active teacher selection for reward learning
par: Freedman, Rachel, et autres
Publié: (2023)
par: Freedman, Rachel, et autres
Publié: (2023)
MOSLIM:Align with diverse preferences in prompts through reward classification
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Towards Monotonic Improvement in In-Context Reinforcement Learning
par: Zhang, Wenhao, et autres
Publié: (2025)
par: Zhang, Wenhao, et autres
Publié: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
par: Liu, Shih-Yang, et autres
Publié: (2026)
par: Liu, Shih-Yang, et autres
Publié: (2026)
Information-theoretic analysis of world models in optimal reward maximizers
par: Harwood, Alfred, et autres
Publié: (2026)
par: Harwood, Alfred, et autres
Publié: (2026)
Reinforcement Learning with Partial Parametric Model Knowledge
par: Wang, Shuyuan, et autres
Publié: (2023)
par: Wang, Shuyuan, et autres
Publié: (2023)
Zero Reinforcement Learning Towards General Domains
par: Zeng, Yuyuan, et autres
Publié: (2025)
par: Zeng, Yuyuan, et autres
Publié: (2025)
Ask more, know better: Reinforce-Learned Prompt Questions for Decision Making with Large Language Models
par: Yan, Xue, et autres
Publié: (2023)
par: Yan, Xue, et autres
Publié: (2023)
Just Say What You Want: Only-prompting Self-rewarding Online Preference Optimization
par: Xu, Ruijie, et autres
Publié: (2024)
par: Xu, Ruijie, et autres
Publié: (2024)
Toward Virtuous Reinforcement Learning: A Critique and Roadmap
par: Ghasemi, Majid, et autres
Publié: (2025)
par: Ghasemi, Majid, et autres
Publié: (2025)
R-ParVI: Particle-based variational inference through lens of rewards
par: Huang, Yongchao
Publié: (2025)
par: Huang, Yongchao
Publié: (2025)
Self-supervised network distillation: an effective approach to exploration in sparse reward environments
par: Pecháč, Matej, et autres
Publié: (2023)
par: Pecháč, Matej, et autres
Publié: (2023)
Towards General-Purpose Model-Free Reinforcement Learning
par: Fujimoto, Scott, et autres
Publié: (2025)
par: Fujimoto, Scott, et autres
Publié: (2025)
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
par: Yang, Rui, et autres
Publié: (2023)
par: Yang, Rui, et autres
Publié: (2023)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
par: Xie, Sean, et autres
Publié: (2022)
par: Xie, Sean, et autres
Publié: (2022)
Unifying Causal Reinforcement Learning: Survey, Taxonomy, Algorithms and Applications
par: Cunha, Cristiano da Costa, et autres
Publié: (2025)
par: Cunha, Cristiano da Costa, et autres
Publié: (2025)
Self-Driving Car Racing: Application of Deep Reinforcement Learning
par: Yuwono, Florentiana, et autres
Publié: (2024)
par: Yuwono, Florentiana, et autres
Publié: (2024)
Risk-averse Total-reward MDPs with ERM and EVaR
par: Su, Xihong, et autres
Publié: (2024)
par: Su, Xihong, et autres
Publié: (2024)
reward-lens: A Mechanistic Interpretability Library for Reward Models
par: Nadaf, Mohammed Suhail B
Publié: (2026)
par: Nadaf, Mohammed Suhail B
Publié: (2026)
A Survey on Applications of Reinforcement Learning in Spatial Resource Allocation
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learning
par: Wang, Haiming, et autres
Publié: (2025)
par: Wang, Haiming, et autres
Publié: (2025)
Towards User-level Private Reinforcement Learning with Human Feedback
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
Federated Reinforcement Learning for Runtime Optimization of AI Applications in Smart Eyewears
par: Sedghani, Hamta, et autres
Publié: (2025)
par: Sedghani, Hamta, et autres
Publié: (2025)
Deep Reinforcement Learning Based Systems for Safety Critical Applications in Aerospace
par: Sherifi, Abedin
Publié: (2024)
par: Sherifi, Abedin
Publié: (2024)
Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges
par: Zhou, Ziyuan, et autres
Publié: (2023)
par: Zhou, Ziyuan, et autres
Publié: (2023)
A Review of Reinforcement Learning in Financial Applications
par: Bai, Yahui, et autres
Publié: (2024)
par: Bai, Yahui, et autres
Publié: (2024)
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
par: Aggarwal, Pranjal, et autres
Publié: (2026)
par: Aggarwal, Pranjal, et autres
Publié: (2026)
Content Bias in Deep Learning Image Age Approximation: A new Approach Towards better Explainability
par: Jöchl, Robert, et autres
Publié: (2023)
par: Jöchl, Robert, et autres
Publié: (2023)
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
par: Lu, Guanxing, et autres
Publié: (2025)
par: Lu, Guanxing, et autres
Publié: (2025)
SCAR: Shapley Credit Assignment for More Efficient RLHF
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
Documents similaires
-
Episodic Reinforcement Learning with Expanded State-reward Space
par: Liang, Dayang, et autres
Publié: (2024) -
The impact of intrinsic rewards on exploration in Reinforcement Learning
par: Kayal, Aya, et autres
Publié: (2025) -
Deep Reinforcement Learning with anticipatory reward in LSTM for Collision Avoidance of Mobile Robots
par: Poulet, Olivier, et autres
Publié: (2025) -
Incorporating Spatial Information into Goal-Conditioned Hierarchical Reinforcement Learning via Graph Representations
par: Zhang, Shuyuan, et autres
Publié: (2025) -
Self-rewarding correction for mathematical reasoning
par: Xiong, Wei, et autres
Publié: (2025)