D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rafailov, Rafael, Hatch, Kyle, Singh, Anikait, Smith, Laura, Kumar, Aviral, Kostrikov, Ilya, Hansen-Estruch, Philippe, Kolev, Victor, Ball, Philip, Wu, Jiajun, Finn, Chelsea, Levine, Sergey |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Imitation Learning with Conservative World Models
par: Kolev, Victor, et autres
Publié: (2024)
par: Kolev, Victor, et autres
Publié: (2024)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
par: Rafailov, Rafael, et autres
Publié: (2024)
par: Rafailov, Rafael, et autres
Publié: (2024)
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
par: Tajwar, Fahim, et autres
Publié: (2024)
par: Tajwar, Fahim, et autres
Publié: (2024)
Training Diffusion Models with Reinforcement Learning
par: Black, Kevin, et autres
Publié: (2023)
par: Black, Kevin, et autres
Publié: (2023)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
par: Wagenmaker, Andrew, et autres
Publié: (2025)
par: Wagenmaker, Andrew, et autres
Publié: (2025)
Is Value Learning Really the Main Bottleneck in Offline RL?
par: Park, Seohong, et autres
Publié: (2024)
par: Park, Seohong, et autres
Publié: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes
par: Stachowicz, Kyle, et autres
Publié: (2024)
par: Stachowicz, Kyle, et autres
Publié: (2024)
From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function
par: Rafailov, Rafael, et autres
Publié: (2024)
par: Rafailov, Rafael, et autres
Publié: (2024)
Disentangling Length from Quality in Direct Preference Optimization
par: Park, Ryan, et autres
Publié: (2024)
par: Park, Ryan, et autres
Publié: (2024)
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
par: Bai, Hao, et autres
Publié: (2024)
par: Bai, Hao, et autres
Publié: (2024)
Contrastive Preference Learning: Learning from Human Feedback without RL
par: Hejna, Joey, et autres
Publié: (2023)
par: Hejna, Joey, et autres
Publié: (2023)
BridgeData V2: A Dataset for Robot Learning at Scale
par: Walke, Homer, et autres
Publié: (2023)
par: Walke, Homer, et autres
Publié: (2023)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
par: Singh, Anikait, et autres
Publié: (2025)
par: Singh, Anikait, et autres
Publié: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
par: Mark, Max Sobol, et autres
Publié: (2024)
par: Mark, Max Sobol, et autres
Publié: (2024)
Video Occupancy Models
par: Tomar, Manan, et autres
Publié: (2024)
par: Tomar, Manan, et autres
Publié: (2024)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
par: Chen, William, et autres
Publié: (2024)
par: Chen, William, et autres
Publié: (2024)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
par: Zhou, Yifei, et autres
Publié: (2024)
par: Zhou, Yifei, et autres
Publié: (2024)
Horizon Reduction Makes RL Scalable
par: Park, Seohong, et autres
Publié: (2025)
par: Park, Seohong, et autres
Publié: (2025)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
par: Albalak, Alon, et autres
Publié: (2025)
par: Albalak, Alon, et autres
Publié: (2025)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
par: Xiang, Violet, et autres
Publié: (2025)
par: Xiang, Violet, et autres
Publié: (2025)
Test-Time Alignment via Hypothesis Reweighting
par: Lee, Yoonho, et autres
Publié: (2024)
par: Lee, Yoonho, et autres
Publié: (2024)
Value-Based Deep RL Scales Predictably
par: Rybkin, Oleh, et autres
Publié: (2025)
par: Rybkin, Oleh, et autres
Publié: (2025)
Compute-Optimal Scaling for Value-Based Deep RL
par: Fu, Preston, et autres
Publié: (2025)
par: Fu, Preston, et autres
Publié: (2025)
PERSONA: A Reproducible Testbed for Pluralistic Alignment
par: Castricato, Louis, et autres
Publié: (2024)
par: Castricato, Louis, et autres
Publié: (2024)
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
par: Wu, Mian, et autres
Publié: (2025)
par: Wu, Mian, et autres
Publié: (2025)
Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
par: Zhou, Zhiyuan, et autres
Publié: (2024)
par: Zhou, Zhiyuan, et autres
Publié: (2024)
ViVa: Video-Trained Value Functions for Guiding Online RL from Diverse Data
par: Dashora, Nitish, et autres
Publié: (2025)
par: Dashora, Nitish, et autres
Publié: (2025)
Adapt On-the-Go: Behavior Modulation for Single-Life Robot Deployment
par: Chen, Annie S., et autres
Publié: (2023)
par: Chen, Annie S., et autres
Publié: (2023)
Tripod: Three Complementary Inductive Biases for Disentangled Representation Learning
par: Hsu, Kyle, et autres
Publié: (2024)
par: Hsu, Kyle, et autres
Publié: (2024)
FASTER: Value-Guided Sampling for Fast RL
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
par: Nakamoto, Mitsuhiko, et autres
Publié: (2024)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
par: Rafailov, Rafael, et autres
Publié: (2023)
par: Rafailov, Rafael, et autres
Publié: (2023)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
par: Lee, Tony, et autres
Publié: (2026)
par: Lee, Tony, et autres
Publié: (2026)
Robotic Control via Embodied Chain-of-Thought Reasoning
par: Zawalski, Michał, et autres
Publié: (2024)
par: Zawalski, Michał, et autres
Publié: (2024)
Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models
par: Chen, Annie S., et autres
Publié: (2024)
par: Chen, Annie S., et autres
Publié: (2024)
Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought
par: Xiang, Violet, et autres
Publié: (2025)
par: Xiang, Violet, et autres
Publié: (2025)
Documents similaires
-
Efficient Imitation Learning with Conservative World Models
par: Kolev, Victor, et autres
Publié: (2024) -
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023) -
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
par: Rafailov, Rafael, et autres
Publié: (2024) -
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
par: Tajwar, Fahim, et autres
Publié: (2024) -
Training Diffusion Models with Reinforcement Learning
par: Black, Kevin, et autres
Publié: (2023)