DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mu, Tongzhou, Liu, Minghua, Su, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model
par: Yuan, Xiu, et autres
Publié: (2024)
par: Yuan, Xiu, et autres
Publié: (2024)
Multi-Stage Manipulation with Demonstration-Augmented Reward, Policy, and World Model Learning
par: Escoriza, Adrià López, et autres
Publié: (2025)
par: Escoriza, Adrià López, et autres
Publié: (2025)
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
par: Liu, Yuyang, et autres
Publié: (2025)
par: Liu, Yuyang, et autres
Publié: (2025)
Towards Embodiment Scaling Laws in Robot Locomotion
par: Ai, Bo, et autres
Publié: (2025)
par: Ai, Bo, et autres
Publié: (2025)
When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?
par: Mu, Tongzhou, et autres
Publié: (2024)
par: Mu, Tongzhou, et autres
Publié: (2024)
RobotKeyframing: Learning Locomotion with High-Level Objectives via Mixture of Dense and Sparse Rewards
par: Zargarbashi, Fatemeh, et autres
Publié: (2024)
par: Zargarbashi, Fatemeh, et autres
Publié: (2024)
Projected Task-Specific Layers for Multi-Task Reinforcement Learning
par: Roberts, Josselin Somerville, et autres
Publié: (2023)
par: Roberts, Josselin Somerville, et autres
Publié: (2023)
Adaptive Splitting of Reusable Temporal Monitors for Rare Traffic Violations
par: Innes, Craig, et autres
Publié: (2024)
par: Innes, Craig, et autres
Publié: (2024)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
par: Ishihara, Yu, et autres
Publié: (2025)
par: Ishihara, Yu, et autres
Publié: (2025)
Efficient Multi-Task Reinforcement Learning via Task-Specific Action Correction
par: Feng, Jinyuan, et autres
Publié: (2024)
par: Feng, Jinyuan, et autres
Publié: (2024)
PWM: Policy Learning with Multi-Task World Models
par: Georgiev, Ignat, et autres
Publié: (2024)
par: Georgiev, Ignat, et autres
Publié: (2024)
Diffusion-Reward Adversarial Imitation Learning
par: Lai, Chun-Mao, et autres
Publié: (2024)
par: Lai, Chun-Mao, et autres
Publié: (2024)
Knowledge-Guided Manipulation Using Multi-Task Reinforcement Learning
par: Narendra, Aditya, et autres
Publié: (2026)
par: Narendra, Aditya, et autres
Publié: (2026)
Model-Based Reinforcement Learning with Multi-Task Offline Pretraining
par: Pan, Minting, et autres
Publié: (2023)
par: Pan, Minting, et autres
Publié: (2023)
Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms
par: Kaitha, Shyam prasad reddy, et autres
Publié: (2025)
par: Kaitha, Shyam prasad reddy, et autres
Publié: (2025)
Reward-Punishment Reinforcement Learning with Maximum Entropy
par: Wang, Jiexin, et autres
Publié: (2024)
par: Wang, Jiexin, et autres
Publié: (2024)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
par: Li, Yuanpeng, et autres
Publié: (2026)
par: Li, Yuanpeng, et autres
Publié: (2026)
Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation
par: Guo, Yihong, et autres
Publié: (2024)
par: Guo, Yihong, et autres
Publié: (2024)
Adaptive Querying for Reward Learning from Human Feedback
par: Anand, Yashwanthi, et autres
Publié: (2024)
par: Anand, Yashwanthi, et autres
Publié: (2024)
Robot Policy Learning with Temporal Optimal Transport Reward
par: Fu, Yuwei, et autres
Publié: (2024)
par: Fu, Yuwei, et autres
Publié: (2024)
Subwords as Skills: Tokenization for Sparse-Reward Reinforcement Learning
par: Yunis, David, et autres
Publié: (2023)
par: Yunis, David, et autres
Publié: (2023)
Residual Reward Models for Preference-based Reinforcement Learning
par: Cao, Chenyang, et autres
Publié: (2025)
par: Cao, Chenyang, et autres
Publié: (2025)
DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
par: Diaz-Bone, Leander, et autres
Publié: (2025)
par: Diaz-Bone, Leander, et autres
Publié: (2025)
Neural-Network-Driven Reward Prediction as a Heuristic: Advancing Q-Learning for Mobile Robot Path Planning
par: Ji, Yiming, et autres
Publié: (2024)
par: Ji, Yiming, et autres
Publié: (2024)
Batch Active Learning of Reward Functions from Human Preferences
par: Bıyık, Erdem, et autres
Publié: (2024)
par: Bıyık, Erdem, et autres
Publié: (2024)
A Generalized Acquisition Function for Preference-based Reward Learning
par: Ellis, Evan, et autres
Publié: (2024)
par: Ellis, Evan, et autres
Publié: (2024)
Reward Learning from Suboptimal Demonstrations with Applications in Surgical Electrocautery
par: Karimi, Zohre, et autres
Publié: (2024)
par: Karimi, Zohre, et autres
Publié: (2024)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
par: Romio, Gabriel, et autres
Publié: (2026)
par: Romio, Gabriel, et autres
Publié: (2026)
CaRL: Learning Scalable Planning Policies with Simple Rewards
par: Jaeger, Bernhard, et autres
Publié: (2025)
par: Jaeger, Bernhard, et autres
Publié: (2025)
SMAT: Staged Multi-Agent Training for Co-Adaptive Exoskeleton Control
par: Yuan, Yifei, et autres
Publié: (2026)
par: Yuan, Yifei, et autres
Publié: (2026)
Reverse Forward Curriculum Learning for Extreme Sample and Demonstration Efficiency in Reinforcement Learning
par: Tao, Stone, et autres
Publié: (2024)
par: Tao, Stone, et autres
Publié: (2024)
Learning Adaptive Dexterous Grasping from Single Demonstrations
par: Shi, Liangzhi, et autres
Publié: (2025)
par: Shi, Liangzhi, et autres
Publié: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving
par: Abouelazm, Ahmed, et autres
Publié: (2024)
par: Abouelazm, Ahmed, et autres
Publié: (2024)
Can We Really Learn One Representation to Optimize All Rewards?
par: Zheng, Chongyi, et autres
Publié: (2026)
par: Zheng, Chongyi, et autres
Publié: (2026)
Causally Robust Reward Learning from Reason-Augmented Preference Feedback
par: Hwang, Minjune, et autres
Publié: (2026)
par: Hwang, Minjune, et autres
Publié: (2026)
Task Assignment and Exploration Optimization for Low Altitude UAV Rescue via Generative AI Enhanced Multi-agent Reinforcement Learning
par: Tang, Xin, et autres
Publié: (2025)
par: Tang, Xin, et autres
Publié: (2025)
Continuous Control Reinforcement Learning: Distributed Distributional DrQ Algorithms
par: Zhou, Zehao
Publié: (2024)
par: Zhou, Zehao
Publié: (2024)
TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models
par: Liu, Zuxin, et autres
Publié: (2023)
par: Liu, Zuxin, et autres
Publié: (2023)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
Documents similaires
-
Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model
par: Yuan, Xiu, et autres
Publié: (2024) -
Multi-Stage Manipulation with Demonstration-Augmented Reward, Policy, and World Model Learning
par: Escoriza, Adrià López, et autres
Publié: (2025) -
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
par: Liu, Yuyang, et autres
Publié: (2025) -
Towards Embodiment Scaling Laws in Robot Locomotion
par: Ai, Bo, et autres
Publié: (2025) -
When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?
par: Mu, Tongzhou, et autres
Publié: (2024)