Rewarded Region Replay (R3) for Policy Learning with Discrete Action Space
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Bangzheng, Ma, Ningshan, Wang, Zifan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fusing Rewards and Preferences in Reinforcement Learning
par: Khorasani, Sadegh, et autres
Publié: (2025)
par: Khorasani, Sadegh, et autres
Publié: (2025)
OER: Offline Experience Replay for Continual Offline Reinforcement Learning
par: Gai, Sibo, et autres
Publié: (2023)
par: Gai, Sibo, et autres
Publié: (2023)
Action-Dependent Optimality-Preserving Reward Shaping
par: Forbes, Grant C., et autres
Publié: (2025)
par: Forbes, Grant C., et autres
Publié: (2025)
PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization
par: Ding, Ruiyi, et autres
Publié: (2026)
par: Ding, Ruiyi, et autres
Publié: (2026)
LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning
par: Quadros, André, et autres
Publié: (2025)
par: Quadros, André, et autres
Publié: (2025)
Difference Rewards Policy Gradients
par: Castellini, Jacopo, et autres
Publié: (2020)
par: Castellini, Jacopo, et autres
Publié: (2020)
Adaptable Hindsight Experience Replay for Search-Based Learning
par: Vazaios, Alexandros, et autres
Publié: (2025)
par: Vazaios, Alexandros, et autres
Publié: (2025)
Regret-Aware Policy Optimization: Environment-Level Memory for Replay Suppression under Delayed Harm
par: Hiremath, Prakul Sunil
Publié: (2026)
par: Hiremath, Prakul Sunil
Publié: (2026)
RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning
par: Hisaki, Yukinari, et autres
Publié: (2024)
par: Hisaki, Yukinari, et autres
Publié: (2024)
Cost and Reward Infused Metric Elicitation
par: Bhateja, Chethan, et autres
Publié: (2025)
par: Bhateja, Chethan, et autres
Publié: (2025)
Learned Relay Representations for Forward-Thinking Discrete Diffusion Models
par: Rozonoyer, Benjamin, et autres
Publié: (2026)
par: Rozonoyer, Benjamin, et autres
Publié: (2026)
Quantifying the Energy Floor: Direct Measurement and Replay Buffer Bias in SAC-Based HVAC Control on sbsim
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Potential-Based Reward Shaping For Intrinsic Motivation
par: Forbes, Grant C., et autres
Publié: (2024)
par: Forbes, Grant C., et autres
Publié: (2024)
Discrete Latent Structure in Neural Networks
par: Niculae, Vlad, et autres
Publié: (2023)
par: Niculae, Vlad, et autres
Publié: (2023)
Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards
par: Forbes, Grant C., et autres
Publié: (2024)
par: Forbes, Grant C., et autres
Publié: (2024)
ArrowFlow: Hierarchical Machine Learning in the Space of Permutations
par: Yilmaz, Ozgur
Publié: (2026)
par: Yilmaz, Ozgur
Publié: (2026)
Learning Agents With Prioritization and Parameter Noise in Continuous State and Action Space
par: Mangannavar, Rajesh, et autres
Publié: (2024)
par: Mangannavar, Rajesh, et autres
Publié: (2024)
Fractional Policy Gradients: Reinforcement Learning with Long-Term Memory
par: Pawar, Urvi, et autres
Publié: (2025)
par: Pawar, Urvi, et autres
Publié: (2025)
Evaluating and Learning Robust Bandit Policies Under Uncertain Causal Mechanisms
par: Avery, Katherine, et autres
Publié: (2025)
par: Avery, Katherine, et autres
Publié: (2025)
Identifying Policy Gradient Subspaces
par: Schneider, Jan, et autres
Publié: (2024)
par: Schneider, Jan, et autres
Publié: (2024)
Graph Neural Network Based Action Ranking for Planning
par: Mangannavar, Rajesh, et autres
Publié: (2024)
par: Mangannavar, Rajesh, et autres
Publié: (2024)
LTL-Constrained Policy Optimization with Cycle Experience Replay
par: Shah, Ameesh, et autres
Publié: (2024)
par: Shah, Ameesh, et autres
Publié: (2024)
Extrinsicaly Rewarded Soft Q Imitation Learning with Discriminator
par: Furuyama, Ryoma, et autres
Publié: (2024)
par: Furuyama, Ryoma, et autres
Publié: (2024)
Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking
par: Singha, Disha
Publié: (2026)
par: Singha, Disha
Publié: (2026)
When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning
par: Kujur, Arahan
Publié: (2026)
par: Kujur, Arahan
Publié: (2026)
Securing Reliability: A Brief Overview on Enhancing In-Context Learning for Foundation Models
par: Huang, Yunpeng, et autres
Publié: (2024)
par: Huang, Yunpeng, et autres
Publié: (2024)
AI and Machine Learning Approaches for Predicting Nanoparticles Toxicity The Critical Role of Physiochemical Properties
par: Yousaf, Iqra
Publié: (2024)
par: Yousaf, Iqra
Publié: (2024)
Individual Contributions as Intrinsic Exploration Scaffolds for Multi-agent Reinforcement Learning
par: Li, Xinran, et autres
Publié: (2024)
par: Li, Xinran, et autres
Publié: (2024)
Data-Incremental Continual Offline Reinforcement Learning
par: Gai, Sibo, et autres
Publié: (2024)
par: Gai, Sibo, et autres
Publié: (2024)
Efficient Action-Constrained Reinforcement Learning via Acceptance-Rejection Method and Augmented MDPs
par: Hung, Wei, et autres
Publié: (2025)
par: Hung, Wei, et autres
Publié: (2025)
Augmenting Replay in World Models for Continual Reinforcement Learning
par: Yang, Luke, et autres
Publié: (2024)
par: Yang, Luke, et autres
Publié: (2024)
ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning
par: Shamass, Faiq
Publié: (2026)
par: Shamass, Faiq
Publié: (2026)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
par: Tang, Wenjie, et autres
Publié: (2026)
par: Tang, Wenjie, et autres
Publié: (2026)
Deep Memory Search: A Metaheuristic Approach for Optimizing Heuristic Search
par: Hedar, Abdel-Rahman, et autres
Publié: (2024)
par: Hedar, Abdel-Rahman, et autres
Publié: (2024)
Amortized Molecular Optimization via Group Relative Policy Optimization
par: Javaid, Muhammad bin, et autres
Publié: (2026)
par: Javaid, Muhammad bin, et autres
Publié: (2026)
Manipulating 3D Molecules in a Fixed-Dimensional E(3)-Equivariant Latent Space
par: Chen, Zitao, et autres
Publié: (2025)
par: Chen, Zitao, et autres
Publié: (2025)
Explainable Graph Representation Learning via Graph Pattern Analysis
par: Wang, Xudong, et autres
Publié: (2025)
par: Wang, Xudong, et autres
Publié: (2025)
Replay-free Online Continual Learning with Self-Supervised MultiPatches
par: Cignoni, Giacomo, et autres
Publié: (2025)
par: Cignoni, Giacomo, et autres
Publié: (2025)
Human-Corrected Labels Learning: Enhancing Labels Quality via Human Correction of VLMs Discrepancies
par: Li, Zhongnian, et autres
Publié: (2025)
par: Li, Zhongnian, et autres
Publié: (2025)
Physics-Informed Policy Optimization via Analytic Dynamics Regularization
par: Chandra, Namai, et autres
Publié: (2026)
par: Chandra, Namai, et autres
Publié: (2026)
Documents similaires
-
Fusing Rewards and Preferences in Reinforcement Learning
par: Khorasani, Sadegh, et autres
Publié: (2025) -
OER: Offline Experience Replay for Continual Offline Reinforcement Learning
par: Gai, Sibo, et autres
Publié: (2023) -
Action-Dependent Optimality-Preserving Reward Shaping
par: Forbes, Grant C., et autres
Publié: (2025) -
PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization
par: Ding, Ruiyi, et autres
Publié: (2026) -
LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning
par: Quadros, André, et autres
Publié: (2025)