Contrastive Preference Learning: Learning from Human Feedback without RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Hejna, Joey, Rafailov, Rafael, Sikchi, Harshit, Finn, Chelsea, Niekum, Scott, Knox, W. Bradley, Sadigh, Dorsa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning
di: Clark, Jaden, et al.
Pubblicazione: (2025)
di: Clark, Jaden, et al.
Pubblicazione: (2025)
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
Data Retrieval with Importance Weights for Few-Shot Imitation Learning
di: Xie, Amber, et al.
Pubblicazione: (2025)
di: Xie, Amber, et al.
Pubblicazione: (2025)
A Dual Approach to Imitation Learning from Observations with Offline Datasets
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)
FASTER: Value-Guided Sampling for Fast RL
di: Dong, Perry, et al.
Pubblicazione: (2026)
di: Dong, Perry, et al.
Pubblicazione: (2026)
An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning
di: Xu, Haoran, et al.
Pubblicazione: (2025)
di: Xu, Haoran, et al.
Pubblicazione: (2025)
Latent Diffusion Planning for Imitation Learning
di: Xie, Amber, et al.
Pubblicazione: (2025)
di: Xie, Amber, et al.
Pubblicazione: (2025)
MotIF: Motion Instruction Fine-tuning
di: Hwang, Minyoung, et al.
Pubblicazione: (2024)
di: Hwang, Minyoung, et al.
Pubblicazione: (2024)
What Matters for Batch Online Reinforcement Learning in Robotics?
di: Dong, Perry, et al.
Pubblicazione: (2025)
di: Dong, Perry, et al.
Pubblicazione: (2025)
EXPO: Stable Reinforcement Learning with Expressive Policies
di: Dong, Perry, et al.
Pubblicazione: (2025)
di: Dong, Perry, et al.
Pubblicazione: (2025)
SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
Invariance Co-training for Robot Visual Generalization
di: Yang, Jonathan, et al.
Pubblicazione: (2025)
di: Yang, Jonathan, et al.
Pubblicazione: (2025)
Batch Active Learning of Reward Functions from Human Preferences
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
di: Dong, Perry, et al.
Pubblicazione: (2026)
di: Dong, Perry, et al.
Pubblicazione: (2026)
Polychromic Objectives for Reinforcement Learning
di: Hamid, Jubayer Ibn, et al.
Pubblicazione: (2025)
di: Hamid, Jubayer Ibn, et al.
Pubblicazione: (2025)
So You Think You Can Scale Up Autonomous Robot Data Collection?
di: Mirchandani, Suvir, et al.
Pubblicazione: (2024)
di: Mirchandani, Suvir, et al.
Pubblicazione: (2024)
Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models
di: Jajoo, Pranaya, et al.
Pubblicazione: (2026)
di: Jajoo, Pranaya, et al.
Pubblicazione: (2026)
A Descriptive and Normative Theory of Human Beliefs in RLHF
di: Dandekar, Sylee, et al.
Pubblicazione: (2025)
di: Dandekar, Sylee, et al.
Pubblicazione: (2025)
Value Flows
di: Dong, Perry, et al.
Pubblicazione: (2025)
di: Dong, Perry, et al.
Pubblicazione: (2025)
Efficient Data Collection for Robotic Manipulation via Compositional Generalization
di: Gao, Jensen, et al.
Pubblicazione: (2024)
di: Gao, Jensen, et al.
Pubblicazione: (2024)
Proto Successor Measure: Representing the Behavior Space of an RL Agent
di: Agarwal, Siddhant, et al.
Pubblicazione: (2024)
di: Agarwal, Siddhant, et al.
Pubblicazione: (2024)
TQL: Scaling Q-Functions with Transformers by Preventing Attention Collapse
di: Dong, Perry, et al.
Pubblicazione: (2026)
di: Dong, Perry, et al.
Pubblicazione: (2026)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
Imitation Bootstrapped Reinforcement Learning
di: Hu, Hengyuan, et al.
Pubblicazione: (2023)
di: Hu, Hengyuan, et al.
Pubblicazione: (2023)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
di: Putta, Pranav, et al.
Pubblicazione: (2024)
di: Putta, Pranav, et al.
Pubblicazione: (2024)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
di: Xiang, Violet, et al.
Pubblicazione: (2025)
di: Xiang, Violet, et al.
Pubblicazione: (2025)
Pareto-Optimal Learning from Preferences with Hidden Context
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2024)
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2024)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
RLVF: Learning from Verbal Feedback without Overgeneralization
di: Stephan, Moritz, et al.
Pubblicazione: (2024)
di: Stephan, Moritz, et al.
Pubblicazione: (2024)
Fast Adaptation with Behavioral Foundation Models
di: Sikchi, Harshit, et al.
Pubblicazione: (2025)
di: Sikchi, Harshit, et al.
Pubblicazione: (2025)
Re-Mix: Optimizing Data Mixtures for Large Scale Imitation Learning
di: Hejna, Joey, et al.
Pubblicazione: (2024)
di: Hejna, Joey, et al.
Pubblicazione: (2024)
RLZero: Direct Policy Inference from Language Without In-Domain Supervision
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)
Motion Tracks: A Unified Representation for Human-Robot Transfer in Few-Shot Imitation Learning
di: Ren, Juntao, et al.
Pubblicazione: (2025)
di: Ren, Juntao, et al.
Pubblicazione: (2025)
Policy Learning with a Language Bottleneck
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
Evaluation-Aware Reinforcement Learning
di: Deshmukh, Shripad Vilasrao, et al.
Pubblicazione: (2025)
di: Deshmukh, Shripad Vilasrao, et al.
Pubblicazione: (2025)
Poly-EPO: Training Exploratory Reasoning Models
di: Orney, Ifdita Hasan, et al.
Pubblicazione: (2026)
di: Orney, Ifdita Hasan, et al.
Pubblicazione: (2026)
Adaptive Margin RLHF via Preference over Preferences
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024) -
Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning
di: Clark, Jaden, et al.
Pubblicazione: (2025) -
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
di: Sikchi, Harshit, et al.
Pubblicazione: (2023) -
Data Retrieval with Importance Weights for Few-Shot Imitation Learning
di: Xie, Amber, et al.
Pubblicazione: (2025) -
A Dual Approach to Imitation Learning from Observations with Offline Datasets
di: Sikchi, Harshit, et al.
Pubblicazione: (2024)