CROP: Conservative Reward for Model-based Offline Policy Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Hao, Zhou, Xiao-Hu, Li, Shu-Hai, Gui, Mei-Jiang, Xie, Xiao-Liang, Liu, Shi-Qi, Wang, Shuang-Yi, Feng, Zhen-Qiu, Hou, Zeng-Guang |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MICRO: Model-Based Offline Reinforcement Learning with a Conservative Bellman Operator
by: Liu, Xiao-Yin, et al.
Published: (2023)
by: Liu, Xiao-Yin, et al.
Published: (2023)
MOSformer: Momentum encoder-based inter-slice fusion transformer for medical image segmentation
by: Huang, De-Xing, et al.
Published: (2024)
by: Huang, De-Xing, et al.
Published: (2024)
SPIRONet: Spatial-Frequency Learning and Topological Channel Interaction Network for Vessel Segmentation
by: Huang, De-Xing, et al.
Published: (2024)
by: Huang, De-Xing, et al.
Published: (2024)
CAS-GAN for Contrast-free Angiography Synthesis
by: Huang, De-Xing, et al.
Published: (2024)
by: Huang, De-Xing, et al.
Published: (2024)
DOMAIN: MilDly COnservative Model-BAsed OfflINe Reinforcement Learning
by: Liu, Xiao-Yin, et al.
Published: (2023)
by: Liu, Xiao-Yin, et al.
Published: (2023)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
by: Liu, Xiao-Yin, et al.
Published: (2024)
by: Liu, Xiao-Yin, et al.
Published: (2024)
VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cloning
by: Wang, Si-Cheng, et al.
Published: (2025)
by: Wang, Si-Cheng, et al.
Published: (2025)
Online Adaptation via Dual-Stage Alignment and Self-Supervision for Fast-Calibration Brain-Computer Interfaces
by: Duan, Sheng-Bin, et al.
Published: (2025)
by: Duan, Sheng-Bin, et al.
Published: (2025)
VasoMIM: Vascular Anatomy-Aware Masked Image Modeling for Vessel Segmentation
by: Huang, De-Xing, et al.
Published: (2025)
by: Huang, De-Xing, et al.
Published: (2025)
Activity and control of methanol metabolism in the seawaters across the estuary–coast–shelf continuum
by: Guang‐Chao Zhuang, et al.
Published: (2025)
by: Guang‐Chao Zhuang, et al.
Published: (2025)
Learning Novel Skills from Language-Generated Demonstrations
by: Jin, Ao-Qun, et al.
Published: (2024)
by: Jin, Ao-Qun, et al.
Published: (2024)
COSBO: Conservative Offline Simulation-Based Policy Optimization
by: Kargar, Eshagh, et al.
Published: (2024)
by: Kargar, Eshagh, et al.
Published: (2024)
VLA Model-Expert Collaboration for Bi-directional Manipulation Learning
by: Xiang, Tian-Yu, et al.
Published: (2025)
by: Xiang, Tian-Yu, et al.
Published: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2025)
by: Gao, Chen-Xiao, et al.
Published: (2025)
CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference
by: Dong, Zhitong, et al.
Published: (2026)
by: Dong, Zhitong, et al.
Published: (2026)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
by: Zhang, Wanpeng, et al.
Published: (2026)
by: Zhang, Wanpeng, et al.
Published: (2026)
Trajectory-Oriented Policy Optimization with Sparse Rewards
by: Wang, Guojian, et al.
Published: (2024)
by: Wang, Guojian, et al.
Published: (2024)
Task-Oriented Learning for Automatic EEG Denoising
by: Xiang, Tian-Yu, et al.
Published: (2025)
by: Xiang, Tian-Yu, et al.
Published: (2025)
REASON: Probability map-guided dual-branch fusion framework for gastric content assessment
by: Xiao, Nu-Fnag, et al.
Published: (2025)
by: Xiao, Nu-Fnag, et al.
Published: (2025)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
by: Mou, Zhiyu, et al.
Published: (2025)
by: Mou, Zhiyu, et al.
Published: (2025)
Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
by: Li, Zhikai, et al.
Published: (2026)
by: Li, Zhikai, et al.
Published: (2026)
TRIM26‐Mediated CBX6 Ubiquitination Triggers NETosis to Drive Bladder Cancer Tumor Growth via the CNPY2/NF‐κB Signaling Pathway
by: XiaoJuan Xie, et al.
Published: (2026)
by: XiaoJuan Xie, et al.
Published: (2026)
Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends
by: Xiang, Tian-Yu, et al.
Published: (2025)
by: Xiang, Tian-Yu, et al.
Published: (2025)
Deciphering viscosity‐driven mechanisms governing chaotic flow dynamics and mixing efficiency in micromixers
by: Shi‐Xiao Wei, et al.
Published: (2026)
by: Shi‐Xiao Wei, et al.
Published: (2026)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
by: Zhang, Tianle, et al.
Published: (2024)
by: Zhang, Tianle, et al.
Published: (2024)
A Weight-aware-based Multi-source Unsupervised Domain Adaptation Method for Human Motion Intention Recognition
by: Liu, Xiao-Yin, et al.
Published: (2024)
by: Liu, Xiao-Yin, et al.
Published: (2024)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
by: Zhu, Jin, et al.
Published: (2023)
by: Zhu, Jin, et al.
Published: (2023)
A Muon-Accelerated Algorithm for Low Separation Rank Tensor Generalized Linear Models
by: Liang, Xiao, et al.
Published: (2026)
by: Liang, Xiao, et al.
Published: (2026)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Offline Policy Optimization with Posterior Sampling
by: Lin, Hongqiang, et al.
Published: (2026)
by: Lin, Hongqiang, et al.
Published: (2026)
Session-Level Dynamic Ad Load Optimization using Offline Robust Reinforcement Learning
by: Liu, Tao, et al.
Published: (2025)
by: Liu, Tao, et al.
Published: (2025)
ROLeR: Effective Reward Shaping in Offline Reinforcement Learning for Recommender Systems
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
Landscape Analysis of Simultaneous Blind Deconvolution and Phase Retrieval via Structured Low-Rank Tensor Recovery
by: Liang, Xiao, et al.
Published: (2025)
by: Liang, Xiao, et al.
Published: (2025)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
by: Hong, Haitao, et al.
Published: (2025)
by: Hong, Haitao, et al.
Published: (2025)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward
by: Zhang, Yi, et al.
Published: (2025)
by: Zhang, Yi, et al.
Published: (2025)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
by: Hu, Jifeng, et al.
Published: (2025)
by: Hu, Jifeng, et al.
Published: (2025)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
by: Wang, Bo, et al.
Published: (2025)
by: Wang, Bo, et al.
Published: (2025)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
by: Li, Xiang, et al.
Published: (2026)
by: Li, Xiang, et al.
Published: (2026)
Investigation on global and local RTD , mixing, and heat transfer of a high‐throughput passive chaotic microreactor
by: Shi‐Xiao Wei, et al.
Published: (2025)
by: Shi‐Xiao Wei, et al.
Published: (2025)
Similar Items
-
MICRO: Model-Based Offline Reinforcement Learning with a Conservative Bellman Operator
by: Liu, Xiao-Yin, et al.
Published: (2023) -
MOSformer: Momentum encoder-based inter-slice fusion transformer for medical image segmentation
by: Huang, De-Xing, et al.
Published: (2024) -
SPIRONet: Spatial-Frequency Learning and Topological Channel Interaction Network for Vessel Segmentation
by: Huang, De-Xing, et al.
Published: (2024) -
CAS-GAN for Contrast-free Angiography Synthesis
by: Huang, De-Xing, et al.
Published: (2024) -
DOMAIN: MilDly COnservative Model-BAsed OfflINe Reinforcement Learning
by: Liu, Xiao-Yin, et al.
Published: (2023)