Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ghosh, Udita, Raychaudhuri, Dripta S., Li, Jiachen, Karydis, Konstantinos, Roy-Chowdhury, Amit |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL
von: Ghosh, Udita, et al.
Veröffentlicht: (2026)
von: Ghosh, Udita, et al.
Veröffentlicht: (2026)
Robust Offline Imitation Learning from Diverse Auxiliary Data
von: Ghosh, Udita, et al.
Veröffentlicht: (2024)
von: Ghosh, Udita, et al.
Veröffentlicht: (2024)
CONTRAST: Continual Multi-source Adaptation to Dynamic Distributions
von: Ahmed, Sk Miraj, et al.
Veröffentlicht: (2024)
von: Ahmed, Sk Miraj, et al.
Veröffentlicht: (2024)
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2026)
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2026)
HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2025)
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2025)
Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
von: Liu, Ziang, et al.
Veröffentlicht: (2024)
von: Liu, Ziang, et al.
Veröffentlicht: (2024)
Towards Source-Free Machine Unlearning
von: Ahmed, Sk Miraj, et al.
Veröffentlicht: (2025)
von: Ahmed, Sk Miraj, et al.
Veröffentlicht: (2025)
Query-Policy Misalignment in Preference-Based Reinforcement Learning
von: Hu, Xiao, et al.
Veröffentlicht: (2023)
von: Hu, Xiao, et al.
Veröffentlicht: (2023)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm
von: Kim, Hyeonjun, et al.
Veröffentlicht: (2025)
von: Kim, Hyeonjun, et al.
Veröffentlicht: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Combinatorial Reinforcement Learning with Preference Feedback
von: Lee, Joongkyu, et al.
Veröffentlicht: (2025)
von: Lee, Joongkyu, et al.
Veröffentlicht: (2025)
Preference-Guided Reinforcement Learning for Efficient Exploration
von: Wang, Guojian, et al.
Veröffentlicht: (2024)
von: Wang, Guojian, et al.
Veröffentlicht: (2024)
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
von: Driss, Brahim, et al.
Veröffentlicht: (2025)
von: Driss, Brahim, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
von: Carr, Jonathan Colaço, et al.
Veröffentlicht: (2026)
von: Carr, Jonathan Colaço, et al.
Veröffentlicht: (2026)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
Boosting Robustness in Preference-Based Reinforcement Learning with Dynamic Sparsity
von: Muslimani, Calarina, et al.
Veröffentlicht: (2024)
von: Muslimani, Calarina, et al.
Veröffentlicht: (2024)
General Preference Reinforcement Learning
von: Umer, Muhammad, et al.
Veröffentlicht: (2026)
von: Umer, Muhammad, et al.
Veröffentlicht: (2026)
Efficient Preference-Based Reinforcement Learning Using Learned Dynamics Models
von: Liu, Yi, et al.
Veröffentlicht: (2023)
von: Liu, Yi, et al.
Veröffentlicht: (2023)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
von: Cheng, Jie, et al.
Veröffentlicht: (2024)
von: Cheng, Jie, et al.
Veröffentlicht: (2024)
Preference-based Multi-Objective Reinforcement Learning
von: Mu, Ni, et al.
Veröffentlicht: (2025)
von: Mu, Ni, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Diverse Human Preferences
von: Xue, Wanqi, et al.
Veröffentlicht: (2023)
von: Xue, Wanqi, et al.
Veröffentlicht: (2023)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift
von: Son, Seongho, et al.
Veröffentlicht: (2024)
von: Son, Seongho, et al.
Veröffentlicht: (2024)
Provable Reward-Agnostic Preference-Based Reinforcement Learning
von: Zhan, Wenhao, et al.
Veröffentlicht: (2023)
von: Zhan, Wenhao, et al.
Veröffentlicht: (2023)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
Deep Reinforcement Learning from Hierarchical Preference Design
von: Bukharin, Alexander, et al.
Veröffentlicht: (2023)
von: Bukharin, Alexander, et al.
Veröffentlicht: (2023)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
von: Tsuchiya, Taira, et al.
Veröffentlicht: (2025)
von: Tsuchiya, Taira, et al.
Veröffentlicht: (2025)
Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective
von: Yao, Yunzhen, et al.
Veröffentlicht: (2025)
von: Yao, Yunzhen, et al.
Veröffentlicht: (2025)
SoNIC: Safe Social Navigation with Adaptive Conformal Inference and Constrained Reinforcement Learning
von: Yao, Jianpeng, et al.
Veröffentlicht: (2024)
von: Yao, Jianpeng, et al.
Veröffentlicht: (2024)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
Fine-tuning Behavioral Cloning Policies with Preference-Based Reinforcement Learning
von: Macuglia, Maël, et al.
Veröffentlicht: (2025)
von: Macuglia, Maël, et al.
Veröffentlicht: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
RA-PbRL: Provably Efficient Risk-Aware Preference-Based Reinforcement Learning
von: Zhao, Yujie, et al.
Veröffentlicht: (2024)
von: Zhao, Yujie, et al.
Veröffentlicht: (2024)
Evaluating Feature Dependent Noise in Preference-based Reinforcement Learning
von: Li, Yuxuan, et al.
Veröffentlicht: (2026)
von: Li, Yuxuan, et al.
Veröffentlicht: (2026)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
von: Mu, Ni, et al.
Veröffentlicht: (2025)
von: Mu, Ni, et al.
Veröffentlicht: (2025)
Multi-turn Reinforcement Learning from Preference Human Feedback
von: Shani, Lior, et al.
Veröffentlicht: (2024)
von: Shani, Lior, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL
von: Ghosh, Udita, et al.
Veröffentlicht: (2026) -
Robust Offline Imitation Learning from Diverse Auxiliary Data
von: Ghosh, Udita, et al.
Veröffentlicht: (2024) -
CONTRAST: Continual Multi-source Adaptation to Dynamic Distributions
von: Ahmed, Sk Miraj, et al.
Veröffentlicht: (2024) -
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2026) -
HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2025)