ELO-Rated Sequence Rewards: Advancing Reinforcement Learning Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ju, Qi, Hei, Falin, Fang, Zhemei, Luo, Yunfeng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Accelerating Nash Equilibrium Convergence in Monte Carlo Settings Through Counterfactual Value Based Fictitious Play
by: Qi, Ju, et al.
Published: (2023)
by: Qi, Ju, et al.
Published: (2023)
From First-Order to Second-Order Rationality: Advancing Game Convergence with Dynamic Weighted Fictitious Play
by: Ju, Qi, et al.
Published: (2024)
by: Ju, Qi, et al.
Published: (2024)
Beyond Nash Equilibrium: Achieving Bayesian Perfect Equilibrium with Belief Update Fictitious Play
by: Ju, Qi, et al.
Published: (2024)
by: Ju, Qi, et al.
Published: (2024)
Preference-CFR$\:$ Beyond Nash Equilibrium for Better Game Strategies
by: Ju, Qi, et al.
Published: (2024)
by: Ju, Qi, et al.
Published: (2024)
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
by: Xu, Jiawei, et al.
Published: (2024)
by: Xu, Jiawei, et al.
Published: (2024)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
by: Wang, Qi, et al.
Published: (2025)
by: Wang, Qi, et al.
Published: (2025)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
by: Yin, Shuyu, et al.
Published: (2024)
by: Yin, Shuyu, et al.
Published: (2024)
From Rules to Rewards: Reinforcement Learning for Interest Rate Adjustment in DeFi Lending
by: Qu, Hanxiao, et al.
Published: (2025)
by: Qu, Hanxiao, et al.
Published: (2025)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
by: Li, Xin-Ye, et al.
Published: (2026)
by: Li, Xin-Ye, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling
by: Huang, Sili, et al.
Published: (2024)
by: Huang, Sili, et al.
Published: (2024)
Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications
by: Ibrahim, Sinan, et al.
Published: (2024)
by: Ibrahim, Sinan, et al.
Published: (2024)
Reward-Conditioned Reinforcement Learning
by: Nauman, Michal, et al.
Published: (2026)
by: Nauman, Michal, et al.
Published: (2026)
Deep Reinforcement Learning with Hybrid Intrinsic Reward Model
by: Yuan, Mingqi, et al.
Published: (2025)
by: Yuan, Mingqi, et al.
Published: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
by: Zhu, Jin, et al.
Published: (2023)
by: Zhu, Jin, et al.
Published: (2023)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
by: Tang, Yuting, et al.
Published: (2024)
by: Tang, Yuting, et al.
Published: (2024)
Conditional Sequence Modeling for Safe Reinforcement Learning
by: Bai, Wensong, et al.
Published: (2026)
by: Bai, Wensong, et al.
Published: (2026)
Accelerated Policy Gradient: On the Convergence Rates of the Nesterov Momentum for Reinforcement Learning
by: Chen, Yen-Ju, et al.
Published: (2023)
by: Chen, Yen-Ju, et al.
Published: (2023)
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
by: Luo, Lirui, et al.
Published: (2026)
by: Luo, Lirui, et al.
Published: (2026)
Reinforcement Learning from Bagged Reward
by: Tang, Yuting, et al.
Published: (2024)
by: Tang, Yuting, et al.
Published: (2024)
The Value of Reward Lookahead in Reinforcement Learning
by: Merlis, Nadav, et al.
Published: (2024)
by: Merlis, Nadav, et al.
Published: (2024)
Informativeness of Reward Functions in Reinforcement Learning
by: Devidze, Rati, et al.
Published: (2024)
by: Devidze, Rati, et al.
Published: (2024)
To the Max: Reinventing Reward in Reinforcement Learning
by: Veviurko, Grigorii, et al.
Published: (2024)
by: Veviurko, Grigorii, et al.
Published: (2024)
Reward Design for Reinforcement Learning Agents
by: Devidze, Rati
Published: (2025)
by: Devidze, Rati
Published: (2025)
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
by: Wu, Yongliang, et al.
Published: (2025)
by: Wu, Yongliang, et al.
Published: (2025)
The Distributional Reward Critic Framework for Reinforcement Learning Under Perturbed Rewards
by: Chen, Xi, et al.
Published: (2024)
by: Chen, Xi, et al.
Published: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
by: Huang, Yu, et al.
Published: (2026)
by: Huang, Yu, et al.
Published: (2026)
Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards
by: Rad, Ali, et al.
Published: (2026)
by: Rad, Ali, et al.
Published: (2026)
Reward Learning from Suboptimal Demonstrations with Applications in Surgical Electrocautery
by: Karimi, Zohre, et al.
Published: (2024)
by: Karimi, Zohre, et al.
Published: (2024)
Parent-Guided Semantic Reward Model (PGSRM): Embedding-Based Reward Functions for Reinforcement Learning of Transformer Language Models
by: Plashchinsky, Alexandr
Published: (2025)
by: Plashchinsky, Alexandr
Published: (2025)
Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning
by: Mathew, Sheryl, et al.
Published: (2025)
by: Mathew, Sheryl, et al.
Published: (2025)
Reward Models in Deep Reinforcement Learning: A Survey
by: Yu, Rui, et al.
Published: (2025)
by: Yu, Rui, et al.
Published: (2025)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
by: Ma, Haozhe, et al.
Published: (2024)
by: Ma, Haozhe, et al.
Published: (2024)
Code as Reward: Empowering Reinforcement Learning with VLMs
by: Venuto, David, et al.
Published: (2024)
by: Venuto, David, et al.
Published: (2024)
Effective Reward Specification in Deep Reinforcement Learning
by: Roy, Julien
Published: (2024)
by: Roy, Julien
Published: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
by: Xu, Yinglun, et al.
Published: (2024)
by: Xu, Yinglun, et al.
Published: (2024)
Risk-Averse Total-Reward Reinforcement Learning
by: Su, Xihong, et al.
Published: (2025)
by: Su, Xihong, et al.
Published: (2025)
Reward-Preserving Attacks For Robust Reinforcement Learning
by: Schott, Lucas, et al.
Published: (2026)
by: Schott, Lucas, et al.
Published: (2026)
Reward-Aware Proto-Representations in Reinforcement Learning
by: Tse, Hon Tik, et al.
Published: (2025)
by: Tse, Hon Tik, et al.
Published: (2025)
RDA: Reward Design Agent for Reinforcement Learning
by: Lee, Hojoon, et al.
Published: (2026)
by: Lee, Hojoon, et al.
Published: (2026)
Similar Items
-
Accelerating Nash Equilibrium Convergence in Monte Carlo Settings Through Counterfactual Value Based Fictitious Play
by: Qi, Ju, et al.
Published: (2023) -
From First-Order to Second-Order Rationality: Advancing Game Convergence with Dynamic Weighted Fictitious Play
by: Ju, Qi, et al.
Published: (2024) -
Beyond Nash Equilibrium: Achieving Bayesian Perfect Equilibrium with Belief Update Fictitious Play
by: Ju, Qi, et al.
Published: (2024) -
Preference-CFR$\:$ Beyond Nash Equilibrium for Better Game Strategies
by: Ju, Qi, et al.
Published: (2024) -
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
by: Xu, Jiawei, et al.
Published: (2024)