Revisiting the Learning Objectives of Vision-Language Reward Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Roy, Simon, Barbeau, Samuel, Beltrame, Giovanni, Desrosiers, Christian, Thome, Nicolas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning
von: Asri, Zakariae El, et al.
Veröffentlicht: (2024)
von: Asri, Zakariae El, et al.
Veröffentlicht: (2024)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023)
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023)
Learning Control Barrier Functions and their application in Reinforcement Learning: A Survey
von: Guerrier, Maeva, et al.
Veröffentlicht: (2024)
von: Guerrier, Maeva, et al.
Veröffentlicht: (2024)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
von: Lee, Younghwan, et al.
Veröffentlicht: (2025)
von: Lee, Younghwan, et al.
Veröffentlicht: (2025)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
von: Wang, Zhibin, et al.
Veröffentlicht: (2024)
von: Wang, Zhibin, et al.
Veröffentlicht: (2024)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
von: Pavlenko, Kirill, et al.
Veröffentlicht: (2026)
von: Pavlenko, Kirill, et al.
Veröffentlicht: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
von: Zhang, Feng, et al.
Veröffentlicht: (2026)
von: Zhang, Feng, et al.
Veröffentlicht: (2026)
Automatic Reward Shaping from Multi-Objective Human Heuristics
von: Xie, Yuqing, et al.
Veröffentlicht: (2025)
von: Xie, Yuqing, et al.
Veröffentlicht: (2025)
Reinforcement Learning with LTL and $ω$-Regular Objectives via Optimality-Preserving Translation to Average Rewards
von: Le, Xuan-Bach, et al.
Veröffentlicht: (2024)
von: Le, Xuan-Bach, et al.
Veröffentlicht: (2024)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
Reward-free Alignment for Conflicting Objectives
von: Chen, Peter, et al.
Veröffentlicht: (2026)
von: Chen, Peter, et al.
Veröffentlicht: (2026)
Consequentialist Objectives and Catastrophe
von: Marklund, Henrik, et al.
Veröffentlicht: (2026)
von: Marklund, Henrik, et al.
Veröffentlicht: (2026)
FAA-CLIP: Federated Adversarial Adaptation of CLIP
von: Wu, Yihang, et al.
Veröffentlicht: (2025)
von: Wu, Yihang, et al.
Veröffentlicht: (2025)
Simulations of Common Unsupervised Domain Adaptation Algorithms for Image Classification
von: Chaddad, Ahmad, et al.
Veröffentlicht: (2025)
von: Chaddad, Ahmad, et al.
Veröffentlicht: (2025)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
Energy Correction Model in the Feature Space for Out-of-Distribution Detection
von: Lafon, Marc, et al.
Veröffentlicht: (2024)
von: Lafon, Marc, et al.
Veröffentlicht: (2024)
Birdie: Advancing State Space Models with Reward-Driven Objectives and Curricula
von: Blouir, Sam, et al.
Veröffentlicht: (2024)
von: Blouir, Sam, et al.
Veröffentlicht: (2024)
ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning
von: Castanyer, Roger Creus, et al.
Veröffentlicht: (2025)
von: Castanyer, Roger Creus, et al.
Veröffentlicht: (2025)
On the Limitations of Markovian Rewards to Express Multi-Objective, Risk-Sensitive, and Modal Tasks
von: Skalse, Joar, et al.
Veröffentlicht: (2024)
von: Skalse, Joar, et al.
Veröffentlicht: (2024)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
von: Bhambri, Siddhant, et al.
Veröffentlicht: (2024)
von: Bhambri, Siddhant, et al.
Veröffentlicht: (2024)
RobotKeyframing: Learning Locomotion with High-Level Objectives via Mixture of Dense and Sparse Rewards
von: Zargarbashi, Fatemeh, et al.
Veröffentlicht: (2024)
von: Zargarbashi, Fatemeh, et al.
Veröffentlicht: (2024)
Beyond Scalar Rewards: Distributional Reinforcement Learning with Preordered Objectives for Safe and Reliable Autonomous Driving
von: Abouelazm, Ahmed, et al.
Veröffentlicht: (2026)
von: Abouelazm, Ahmed, et al.
Veröffentlicht: (2026)
SemiReward: A General Reward Model for Semi-supervised Learning
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
von: Xie, Guanwen, et al.
Veröffentlicht: (2024)
von: Xie, Guanwen, et al.
Veröffentlicht: (2024)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
von: Deng, Yongxin, et al.
Veröffentlicht: (2024)
von: Deng, Yongxin, et al.
Veröffentlicht: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024)
von: Lang, Hao, et al.
Veröffentlicht: (2024)
In-Context Multi-Objective Optimization
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
Interpreting Language Reward Models via Contrastive Explanations
von: Jiang, Junqi, et al.
Veröffentlicht: (2024)
von: Jiang, Junqi, et al.
Veröffentlicht: (2024)
Adapting the Behavior of Reinforcement Learning Agents to Changing Action Spaces and Reward Functions
von: de la Rosa, Raul, et al.
Veröffentlicht: (2026)
von: de la Rosa, Raul, et al.
Veröffentlicht: (2026)
Robust Multi-Objective Controlled Decoding of Large Language Models
von: Son, Seongho, et al.
Veröffentlicht: (2025)
von: Son, Seongho, et al.
Veröffentlicht: (2025)
Latent Domain Prompt Learning for Vision-Language Models
von: Li, Zhixing, et al.
Veröffentlicht: (2025)
von: Li, Zhixing, et al.
Veröffentlicht: (2025)
Debiasing Reward Models by Representation Learning with Guarantees
von: Ng, Ignavier, et al.
Veröffentlicht: (2025)
von: Ng, Ignavier, et al.
Veröffentlicht: (2025)
An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination
von: Wei, Dixiao, et al.
Veröffentlicht: (2025)
von: Wei, Dixiao, et al.
Veröffentlicht: (2025)
Revisiting In-Context Learning with Long Context Language Models
von: Baek, Jinheon, et al.
Veröffentlicht: (2024)
von: Baek, Jinheon, et al.
Veröffentlicht: (2024)
Learning Pareto-Optimal Rewards from Noisy Preferences: A Framework for Multi-Objective Inverse Reinforcement Learning
von: Cherukuri, Kalyan, et al.
Veröffentlicht: (2025)
von: Cherukuri, Kalyan, et al.
Veröffentlicht: (2025)
Reward Models in Deep Reinforcement Learning: A Survey
von: Yu, Rui, et al.
Veröffentlicht: (2025)
von: Yu, Rui, et al.
Veröffentlicht: (2025)
Polychromic Objectives for Reinforcement Learning
von: Hamid, Jubayer Ibn, et al.
Veröffentlicht: (2025)
von: Hamid, Jubayer Ibn, et al.
Veröffentlicht: (2025)
SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport
von: Roschmann, Simon, et al.
Veröffentlicht: (2026)
von: Roschmann, Simon, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning
von: Asri, Zakariae El, et al.
Veröffentlicht: (2024) -
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023) -
Learning Control Barrier Functions and their application in Reinforcement Learning: A Survey
von: Guerrier, Maeva, et al.
Veröffentlicht: (2024) -
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
von: Lee, Younghwan, et al.
Veröffentlicht: (2025) -
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)