Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Rocamonde, Juan, Montesinos, Victoriano, Nava, Elvis, Perez, Ethan, Lindner, David |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
by: Pai, Jonas, et al.
Published: (2025)
by: Pai, Jonas, et al.
Published: (2025)
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
by: Frans, Kevin, et al.
Published: (2024)
by: Frans, Kevin, et al.
Published: (2024)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
by: Lee, Younghwan, et al.
Published: (2025)
by: Lee, Younghwan, et al.
Published: (2025)
On Zero-Shot Reinforcement Learning
by: Jeen, Scott
Published: (2025)
by: Jeen, Scott
Published: (2025)
Revisiting the Learning Objectives of Vision-Language Reward Models
by: Roy, Simon, et al.
Published: (2025)
by: Roy, Simon, et al.
Published: (2025)
Zero-Shot Robustification of Zero-Shot Models
by: Adila, Dyah, et al.
Published: (2023)
by: Adila, Dyah, et al.
Published: (2023)
Zero-Shot Reinforcement Learning via Function Encoders
by: Ingebrand, Tyler, et al.
Published: (2024)
by: Ingebrand, Tyler, et al.
Published: (2024)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
by: Wang, Zhiyong, et al.
Published: (2025)
by: Wang, Zhiyong, et al.
Published: (2025)
Zero-Shot Reinforcement Learning Under Partial Observability
by: Jeen, Scott, et al.
Published: (2025)
by: Jeen, Scott, et al.
Published: (2025)
Towards Robust Zero-Shot Reinforcement Learning
by: Zheng, Kexin, et al.
Published: (2025)
by: Zheng, Kexin, et al.
Published: (2025)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
by: Bhambri, Siddhant, et al.
Published: (2024)
by: Bhambri, Siddhant, et al.
Published: (2024)
Learning Safety Constraints from Demonstrations with Unknown Rewards
by: Lindner, David, et al.
Published: (2023)
by: Lindner, David, et al.
Published: (2023)
Zero-Shot Reinforcement Learning from Low Quality Data
by: Jeen, Scott, et al.
Published: (2023)
by: Jeen, Scott, et al.
Published: (2023)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
Efficient Reinforcement Learning for Zero-Shot Coordination in Evolving Games
by: Hui, Bingyu, et al.
Published: (2025)
by: Hui, Bingyu, et al.
Published: (2025)
Reward Models in Deep Reinforcement Learning: A Survey
by: Yu, Rui, et al.
Published: (2025)
by: Yu, Rui, et al.
Published: (2025)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
by: Deng, Yongxin, et al.
Published: (2024)
by: Deng, Yongxin, et al.
Published: (2024)
Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers
by: Dong, Juncheng, et al.
Published: (2026)
by: Dong, Juncheng, et al.
Published: (2026)
UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
by: Wang, Fu-Yun, et al.
Published: (2025)
by: Wang, Fu-Yun, et al.
Published: (2025)
Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards
by: Dave, Rudray, et al.
Published: (2026)
by: Dave, Rudray, et al.
Published: (2026)
An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination
by: Wei, Dixiao, et al.
Published: (2025)
by: Wei, Dixiao, et al.
Published: (2025)
Decision-Focused Model-based Reinforcement Learning for Reward Transfer
by: Sharma, Abhishek, et al.
Published: (2023)
by: Sharma, Abhishek, et al.
Published: (2023)
TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
by: Chen, Shirui, et al.
Published: (2026)
by: Chen, Shirui, et al.
Published: (2026)
ZeroShotOpt: Towards Zero-Shot Pretrained Models for Efficient Black-Box Optimization
by: Meindl, Jamison, et al.
Published: (2025)
by: Meindl, Jamison, et al.
Published: (2025)
Inferring Behavior-Specific Context Improves Zero-Shot Generalization in Reinforcement Learning
by: Ndir, Tidiane Camaret, et al.
Published: (2024)
by: Ndir, Tidiane Camaret, et al.
Published: (2024)
Residual Reward Models for Preference-based Reinforcement Learning
by: Cao, Chenyang, et al.
Published: (2025)
by: Cao, Chenyang, et al.
Published: (2025)
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
by: Venkataraman, Sreyas, et al.
Published: (2024)
by: Venkataraman, Sreyas, et al.
Published: (2024)
AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models
by: Metzen, Jan Hendrik, et al.
Published: (2023)
by: Metzen, Jan Hendrik, et al.
Published: (2023)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
by: Aggarwal, Vaneet, et al.
Published: (2024)
by: Aggarwal, Vaneet, et al.
Published: (2024)
Towards Automated Semantic Interpretability in Reinforcement Learning via Vision-Language Models
by: Li, Zhaoxin, et al.
Published: (2025)
by: Li, Zhaoxin, et al.
Published: (2025)
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
by: Wang, Haozhe, et al.
Published: (2025)
by: Wang, Haozhe, et al.
Published: (2025)
Semantic-Inductive Attribute Selection for Zero-Shot Learning
by: Herrera-Aranda, Juan Jose, et al.
Published: (2025)
by: Herrera-Aranda, Juan Jose, et al.
Published: (2025)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
by: Alsadat, Shayan Meshkat, et al.
Published: (2024)
by: Alsadat, Shayan Meshkat, et al.
Published: (2024)
Zero-Shot LLMs in Human-in-the-Loop RL: Replacing Human Feedback for Reward Shaping
by: Nazir, Mohammad Saif, et al.
Published: (2025)
by: Nazir, Mohammad Saif, et al.
Published: (2025)
DRED: Zero-Shot Transfer in Reinforcement Learning via Data-Regularised Environment Design
by: Garcin, Samuel, et al.
Published: (2024)
by: Garcin, Samuel, et al.
Published: (2024)
Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning
by: Hu, Jiajun, et al.
Published: (2026)
by: Hu, Jiajun, et al.
Published: (2026)
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
by: Wang, Yufei, et al.
Published: (2024)
by: Wang, Yufei, et al.
Published: (2024)
Multi-Modal One-Shot Federated Ensemble Learning for Medical Data with Vision Large Language Model
by: Wang, Naibo, et al.
Published: (2025)
by: Wang, Naibo, et al.
Published: (2025)
Advancing Email Spam Detection: Leveraging Zero-Shot Learning and Large Language Models
by: SHirvani, Ghazaleh, et al.
Published: (2025)
by: SHirvani, Ghazaleh, et al.
Published: (2025)
Leveraging Zero-Shot Prompting for Efficient Language Model Distillation
by: Vöge, Lukas, et al.
Published: (2024)
by: Vöge, Lukas, et al.
Published: (2024)
Similar Items
-
mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
by: Pai, Jonas, et al.
Published: (2025) -
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
by: Frans, Kevin, et al.
Published: (2024) -
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
by: Lee, Younghwan, et al.
Published: (2025) -
On Zero-Shot Reinforcement Learning
by: Jeen, Scott
Published: (2025) -
Revisiting the Learning Objectives of Vision-Language Reward Models
by: Roy, Simon, et al.
Published: (2025)