Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lee, Younghwan, Luu, Tung M., Lee, Donghoon, Yoo, Chang D. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation
von: Lee, Donghoon, et al.
Veröffentlicht: (2025)
von: Lee, Donghoon, et al.
Veröffentlicht: (2025)
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
von: Luu, Tung M., et al.
Veröffentlicht: (2025)
von: Luu, Tung M., et al.
Veröffentlicht: (2025)
Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models
von: Luu, Tung Minh, et al.
Veröffentlicht: (2025)
von: Luu, Tung Minh, et al.
Veröffentlicht: (2025)
Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses
von: Nguyen, Thanh, et al.
Veröffentlicht: (2024)
von: Nguyen, Thanh, et al.
Veröffentlicht: (2024)
Offline Policy Learning via Skill-step Abstraction for Long-horizon Goal-Conditioned Tasks
von: Kim, Donghoon, et al.
Veröffentlicht: (2024)
von: Kim, Donghoon, et al.
Veröffentlicht: (2024)
Mitigating Adversarial Perturbations for Deep Reinforcement Learning via Vector Quantization
von: Luu, Tung M., et al.
Veröffentlicht: (2024)
von: Luu, Tung M., et al.
Veröffentlicht: (2024)
Predictive Coding for Decision Transformer
von: Luu, Tung M., et al.
Veröffentlicht: (2024)
von: Luu, Tung M., et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning with Imputed Rewards
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
von: Kim, Jeonghye, et al.
Veröffentlicht: (2025)
von: Kim, Jeonghye, et al.
Veröffentlicht: (2025)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning with Universal Horizon Models
von: Chung, Hojun, et al.
Veröffentlicht: (2026)
von: Chung, Hojun, et al.
Veröffentlicht: (2026)
Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning
von: Park, Kwanyoung, et al.
Veröffentlicht: (2024)
von: Park, Kwanyoung, et al.
Veröffentlicht: (2024)
DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing
von: Lee, Vint, et al.
Veröffentlicht: (2023)
von: Lee, Vint, et al.
Veröffentlicht: (2023)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning
von: Lee, Jaewoo, et al.
Veröffentlicht: (2024)
von: Lee, Jaewoo, et al.
Veröffentlicht: (2024)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023)
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023)
FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning
von: Kim, Woosung, et al.
Veröffentlicht: (2025)
von: Kim, Woosung, et al.
Veröffentlicht: (2025)
OffSim: Offline Simulator for Model-based Offline Inverse Reinforcement Learning
von: Ahn, Woo-Jin, et al.
Veröffentlicht: (2025)
von: Ahn, Woo-Jin, et al.
Veröffentlicht: (2025)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
A Recipe for Stable Offline Multi-agent Reinforcement Learning
von: Lee, Dongsu, et al.
Veröffentlicht: (2026)
von: Lee, Dongsu, et al.
Veröffentlicht: (2026)
Offline Reinforcement Learning with Penalized Action Noise Injection
von: Oh, JunHyeok, et al.
Veröffentlicht: (2025)
von: Oh, JunHyeok, et al.
Veröffentlicht: (2025)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
von: Song, Chihyeon, et al.
Veröffentlicht: (2025)
von: Song, Chihyeon, et al.
Veröffentlicht: (2025)
Unveiling the Significance of Toddler-Inspired Reward Transition in Goal-Oriented Reinforcement Learning
von: Park, Junseok, et al.
Veröffentlicht: (2024)
von: Park, Junseok, et al.
Veröffentlicht: (2024)
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
von: Venkataraman, Sreyas, et al.
Veröffentlicht: (2024)
von: Venkataraman, Sreyas, et al.
Veröffentlicht: (2024)
Temporal Distance-aware Transition Augmentation for Offline Model-based Reinforcement Learning
von: Lee, Dongsu, et al.
Veröffentlicht: (2025)
von: Lee, Dongsu, et al.
Veröffentlicht: (2025)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
von: Yeom, Junghyuk, et al.
Veröffentlicht: (2024)
von: Yeom, Junghyuk, et al.
Veröffentlicht: (2024)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
von: Zhu, Jin, et al.
Veröffentlicht: (2023)
von: Zhu, Jin, et al.
Veröffentlicht: (2023)
The Generalization Gap in Offline Reinforcement Learning
von: Mediratta, Ishita, et al.
Veröffentlicht: (2023)
von: Mediratta, Ishita, et al.
Veröffentlicht: (2023)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
von: Bhambri, Siddhant, et al.
Veröffentlicht: (2024)
von: Bhambri, Siddhant, et al.
Veröffentlicht: (2024)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
von: Park, Jongchan, et al.
Veröffentlicht: (2025)
von: Park, Jongchan, et al.
Veröffentlicht: (2025)
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
Compositional Conservatism: A Transductive Approach in Offline Reinforcement Learning
von: Song, Yeda, et al.
Veröffentlicht: (2024)
von: Song, Yeda, et al.
Veröffentlicht: (2024)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
von: Deng, Yongxin, et al.
Veröffentlicht: (2024)
von: Deng, Yongxin, et al.
Veröffentlicht: (2024)
Revisiting the Learning Objectives of Vision-Language Reward Models
von: Roy, Simon, et al.
Veröffentlicht: (2025)
von: Roy, Simon, et al.
Veröffentlicht: (2025)
Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
von: Han, Seungyub, et al.
Veröffentlicht: (2026)
von: Han, Seungyub, et al.
Veröffentlicht: (2026)
Offline Reinforcement Learning with Generative Trajectory Policies
von: Feng, Xinsong, et al.
Veröffentlicht: (2025)
von: Feng, Xinsong, et al.
Veröffentlicht: (2025)
Doubly Mild Generalization for Offline Reinforcement Learning
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs
von: Shrestha, Aayam, et al.
Veröffentlicht: (2020)
von: Shrestha, Aayam, et al.
Veröffentlicht: (2020)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024)
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation
von: Lee, Donghoon, et al.
Veröffentlicht: (2025) -
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
von: Luu, Tung M., et al.
Veröffentlicht: (2025) -
Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models
von: Luu, Tung Minh, et al.
Veröffentlicht: (2025) -
Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses
von: Nguyen, Thanh, et al.
Veröffentlicht: (2024) -
Offline Policy Learning via Skill-step Abstraction for Long-horizon Goal-Conditioned Tasks
von: Kim, Donghoon, et al.
Veröffentlicht: (2024)