Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Jeonghye, Shin, Yongjae, Jung, Whiyoung, Hong, Sunghoon, Yoon, Deunsol, Sung, Youngchul, Lee, Kanghoon, Lim, Woohyung |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Online Pre-Training for Offline-to-Online Reinforcement Learning
by: Shin, Yongjae, et al.
Published: (2025)
by: Shin, Yongjae, et al.
Published: (2025)
Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents
by: Bae, Seohui, et al.
Published: (2025)
by: Bae, Seohui, et al.
Published: (2025)
Adaptive $Q$-Aid for Conditional Supervised Learning in Offline Reinforcement Learning
by: Kim, Jeonghye, et al.
Published: (2024)
by: Kim, Jeonghye, et al.
Published: (2024)
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
by: Shin, Yongjae, et al.
Published: (2026)
by: Shin, Yongjae, et al.
Published: (2026)
LESSON: Learning to Integrate Exploration Strategies for Reinforcement Learning via an Option Framework
by: Kim, Woojun, et al.
Published: (2023)
by: Kim, Woojun, et al.
Published: (2023)
Flow Actor-Critic for Offline Reinforcement Learning
by: Chae, Jongseong, et al.
Published: (2026)
by: Chae, Jongseong, et al.
Published: (2026)
CADO: From Imitation to Cost Minimization for Heatmap-based Solvers in Combinatorial Optimization
by: Song, Hyungseok, et al.
Published: (2026)
by: Song, Hyungseok, et al.
Published: (2026)
Decision ConvFormer: Local Filtering in MetaFormer is Sufficient for Decision Making
by: Kim, Jeonghye, et al.
Published: (2023)
by: Kim, Jeonghye, et al.
Published: (2023)
Adaptive Action Chunking via Multi-Chunk Q Value Estimation
by: Shin, Yongjae, et al.
Published: (2026)
by: Shin, Yongjae, et al.
Published: (2026)
Reward Dimension Reduction for Scalable Multi-Objective Reinforcement Learning
by: Park, Giseung, et al.
Published: (2025)
by: Park, Giseung, et al.
Published: (2025)
ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection
by: Kim, Jeonghye, et al.
Published: (2025)
by: Kim, Jeonghye, et al.
Published: (2025)
Offline Reinforcement Learning with Penalized Action Noise Injection
by: Oh, JunHyeok, et al.
Published: (2025)
by: Oh, JunHyeok, et al.
Published: (2025)
STAIRS-Former: Spatio-Temporal Attention with Interleaved Recursive Structure Transformer for Offline Multi-task Multi-agent Reinforcement Learning
by: Jeon, Jiwon, et al.
Published: (2026)
by: Jeon, Jiwon, et al.
Published: (2026)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
by: Yeom, Junghyuk, et al.
Published: (2024)
by: Yeom, Junghyuk, et al.
Published: (2024)
THEME: Enhancing Thematic Investing with Semantic Stock Representations and Temporal Dynamics
by: Lee, Hoyoung, et al.
Published: (2025)
by: Lee, Hoyoung, et al.
Published: (2025)
Locality-Aware Zero-Shot Human-Object Interaction Detection
by: Kim, Sanghyun, et al.
Published: (2025)
by: Kim, Sanghyun, et al.
Published: (2025)
Unsupervised Training of Diffusion Models for Feasible Solution Generation in Neural Combinatorial Optimization
by: Hong, Seong-Hyun, et al.
Published: (2024)
by: Hong, Seong-Hyun, et al.
Published: (2024)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
by: Choi, Heewoong, et al.
Published: (2024)
by: Choi, Heewoong, et al.
Published: (2024)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
by: Lim, Yooseok, et al.
Published: (2024)
by: Lim, Yooseok, et al.
Published: (2024)
Self-Guided Robust Graph Structure Refinement
by: In, Yeonjun, et al.
Published: (2024)
by: In, Yeonjun, et al.
Published: (2024)
Offline Reinforcement Learning with Imputed Rewards
by: Romeo, Carlo, et al.
Published: (2024)
by: Romeo, Carlo, et al.
Published: (2024)
ELA: Exploited Level Augmentation for Offline Learning in Zero-Sum Games
by: Lei, Shiqi, et al.
Published: (2024)
by: Lei, Shiqi, et al.
Published: (2024)
Constrained Multi-Objective Reinforcement Learning with Max-Min Criterion
by: Park, Giseung, et al.
Published: (2026)
by: Park, Giseung, et al.
Published: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
by: Yoon, Deokgyu, et al.
Published: (2026)
by: Yoon, Deokgyu, et al.
Published: (2026)
The Max-Min Formulation of Multi-Objective Reinforcement Learning: From Theory to a Model-Free Algorithm
by: Park, Giseung, et al.
Published: (2024)
by: Park, Giseung, et al.
Published: (2024)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
by: Chen, Xuyang, et al.
Published: (2025)
by: Chen, Xuyang, et al.
Published: (2025)
From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning
by: Yoa, Seungdong, et al.
Published: (2026)
by: Yoa, Seungdong, et al.
Published: (2026)
Multi-Objective Reinforcement Learning with Max-Min Criterion: A Game-Theoretic Approach
by: Byeon, Woohyeon, et al.
Published: (2025)
by: Byeon, Woohyeon, et al.
Published: (2025)
Semantic Diversity-aware Prototype-based Learning for Unbiased Scene Graph Generation
by: Jeon, Jaehyeong, et al.
Published: (2024)
by: Jeon, Jaehyeong, et al.
Published: (2024)
LexiSafe: Offline Safe Reinforcement Learning with Lexicographic Safety-Reward Hierarchy
by: Yang, Hsin-Jung, et al.
Published: (2026)
by: Yang, Hsin-Jung, et al.
Published: (2026)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
by: Lee, Younghwan, et al.
Published: (2025)
by: Lee, Younghwan, et al.
Published: (2025)
Binning as a Pretext Task: Improving Self-Supervised Learning in Tabular Domains
by: Lee, Kyungeun, et al.
Published: (2024)
by: Lee, Kyungeun, et al.
Published: (2024)
Elasmostethus rotundus Yamamoto 2003
by: Jung, Sunghoon
Published: (2017)
by: Jung, Sunghoon
Published: (2017)
Review of the genus Elasmostethus (Hemiptera: Heteroptera: Acanthosomatidae) from the Korean Peninsula
by: Jung, Sunghoon
Published: (2017)
by: Jung, Sunghoon
Published: (2017)
Scaling Motion Planning Infeasibility Proofs
by: Li, Sihui, et al.
Published: (2024)
by: Li, Sihui, et al.
Published: (2024)
Revisiting Fake News Detection: Towards Temporality-aware Evaluation by Leveraging Engagement Earliness
by: Kim, Junghoon, et al.
Published: (2024)
by: Kim, Junghoon, et al.
Published: (2024)
Debiased Graph Poisoning Attack via Contrastive Surrogate Objective
by: Yoon, Kanghoon, et al.
Published: (2024)
by: Yoon, Kanghoon, et al.
Published: (2024)
Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents
by: In, Yeonjun, et al.
Published: (2026)
by: In, Yeonjun, et al.
Published: (2026)
Reward-Relevance-Filtered Linear Offline Reinforcement Learning
by: Zhou, Angela
Published: (2024)
by: Zhou, Angela
Published: (2024)
Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm
by: Kim, Hyeonjun, et al.
Published: (2025)
by: Kim, Hyeonjun, et al.
Published: (2025)
Similar Items
-
Online Pre-Training for Offline-to-Online Reinforcement Learning
by: Shin, Yongjae, et al.
Published: (2025) -
Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents
by: Bae, Seohui, et al.
Published: (2025) -
Adaptive $Q$-Aid for Conditional Supervised Learning in Offline Reinforcement Learning
by: Kim, Jeonghye, et al.
Published: (2024) -
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
by: Shin, Yongjae, et al.
Published: (2026) -
LESSON: Learning to Integrate Exploration Strategies for Reinforcement Learning via an Option Framework
by: Kim, Woojun, et al.
Published: (2023)