Salvato in:
| Autori principali: | Li, Fanxing, Sun, Fangyu, Zhang, Tianbao, Zou, Danping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2501.14513 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisFly: An Efficient and Versatile Simulator for Training Vision-based Flight
di: Li, Fanxing, et al.
Pubblicazione: (2024)
di: Li, Fanxing, et al.
Pubblicazione: (2024)
VisFly-Lab: Unified Differentiable Framework for First-Order Reinforcement Learning of Quadrotor Control
di: Li, Fanxing, et al.
Pubblicazione: (2026)
di: Li, Fanxing, et al.
Pubblicazione: (2026)
First Order Model-Based RL through Decoupled Backpropagation
di: Amigo, Joseph, et al.
Pubblicazione: (2025)
di: Amigo, Joseph, et al.
Pubblicazione: (2025)
Aligning Text-to-Image Diffusion Models with Reward Backpropagation
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
di: Gumbsch, Christian, et al.
Pubblicazione: (2026)
di: Gumbsch, Christian, et al.
Pubblicazione: (2026)
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
di: Kapoor, Aditya, et al.
Pubblicazione: (2024)
di: Kapoor, Aditya, et al.
Pubblicazione: (2024)
Diffusion-Reward Adversarial Imitation Learning
di: Lai, Chun-Mao, et al.
Pubblicazione: (2024)
di: Lai, Chun-Mao, et al.
Pubblicazione: (2024)
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
di: Kapoor, Aditya, et al.
Pubblicazione: (2025)
di: Kapoor, Aditya, et al.
Pubblicazione: (2025)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
StableTracker: Learning to Stably Track Target via Differentiable Simulation
di: Li, Fanxing, et al.
Pubblicazione: (2025)
di: Li, Fanxing, et al.
Pubblicazione: (2025)
Guided Policy Optimization under Partial Observability
di: Li, Yueheng, et al.
Pubblicazione: (2025)
di: Li, Yueheng, et al.
Pubblicazione: (2025)
Robot Policy Learning with Temporal Optimal Transport Reward
di: Fu, Yuwei, et al.
Pubblicazione: (2024)
di: Fu, Yuwei, et al.
Pubblicazione: (2024)
Confounding Robust Continuous Control via Automatic Reward Shaping
di: Juliani, Mateo, et al.
Pubblicazione: (2026)
di: Juliani, Mateo, et al.
Pubblicazione: (2026)
Simple but Stable, Fast and Safe: Achieve End-to-end Control by High-Fidelity Differentiable Simulation
di: Li, Fanxing, et al.
Pubblicazione: (2026)
di: Li, Fanxing, et al.
Pubblicazione: (2026)
Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
di: Liang, Anthony, et al.
Pubblicazione: (2026)
di: Liang, Anthony, et al.
Pubblicazione: (2026)
Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles
di: Sun, Fangyu, et al.
Pubblicazione: (2026)
di: Sun, Fangyu, et al.
Pubblicazione: (2026)
Reward-Punishment Reinforcement Learning with Maximum Entropy
di: Wang, Jiexin, et al.
Pubblicazione: (2024)
di: Wang, Jiexin, et al.
Pubblicazione: (2024)
Residual Reward Models for Preference-based Reinforcement Learning
di: Cao, Chenyang, et al.
Pubblicazione: (2025)
di: Cao, Chenyang, et al.
Pubblicazione: (2025)
DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
di: Diaz-Bone, Leander, et al.
Pubblicazione: (2025)
di: Diaz-Bone, Leander, et al.
Pubblicazione: (2025)
Subwords as Skills: Tokenization for Sparse-Reward Reinforcement Learning
di: Yunis, David, et al.
Pubblicazione: (2023)
di: Yunis, David, et al.
Pubblicazione: (2023)
Adaptive Querying for Reward Learning from Human Feedback
di: Anand, Yashwanthi, et al.
Pubblicazione: (2024)
di: Anand, Yashwanthi, et al.
Pubblicazione: (2024)
Observation Adaptation via Annealed Importance Resampling for Partially Observable Markov Decision Processes
di: Zhang, Yunuo, et al.
Pubblicazione: (2025)
di: Zhang, Yunuo, et al.
Pubblicazione: (2025)
RDAR: Reward-Driven Agent Relevance Estimation for Autonomous Driving
di: Bosio, Carlo, et al.
Pubblicazione: (2025)
di: Bosio, Carlo, et al.
Pubblicazione: (2025)
CaRL: Learning Scalable Planning Policies with Simple Rewards
di: Jaeger, Bernhard, et al.
Pubblicazione: (2025)
di: Jaeger, Bernhard, et al.
Pubblicazione: (2025)
Batch Active Learning of Reward Functions from Human Preferences
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
di: Romio, Gabriel, et al.
Pubblicazione: (2026)
di: Romio, Gabriel, et al.
Pubblicazione: (2026)
DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
di: Mu, Tongzhou, et al.
Pubblicazione: (2024)
di: Mu, Tongzhou, et al.
Pubblicazione: (2024)
TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
di: Chen, Shirui, et al.
Pubblicazione: (2026)
di: Chen, Shirui, et al.
Pubblicazione: (2026)
Not Only Rewards But Also Constraints: Applications on Legged Robot Locomotion
di: Kim, Yunho, et al.
Pubblicazione: (2023)
di: Kim, Yunho, et al.
Pubblicazione: (2023)
A Generalized Acquisition Function for Preference-based Reward Learning
di: Ellis, Evan, et al.
Pubblicazione: (2024)
di: Ellis, Evan, et al.
Pubblicazione: (2024)
Reward Learning from Suboptimal Demonstrations with Applications in Surgical Electrocautery
di: Karimi, Zohre, et al.
Pubblicazione: (2024)
di: Karimi, Zohre, et al.
Pubblicazione: (2024)
Can We Really Learn One Representation to Optimize All Rewards?
di: Zheng, Chongyi, et al.
Pubblicazione: (2026)
di: Zheng, Chongyi, et al.
Pubblicazione: (2026)
A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving
di: Abouelazm, Ahmed, et al.
Pubblicazione: (2024)
di: Abouelazm, Ahmed, et al.
Pubblicazione: (2024)
LORD: Large Models based Opposite Reward Design for Autonomous Driving
di: Ye, Xin, et al.
Pubblicazione: (2024)
di: Ye, Xin, et al.
Pubblicazione: (2024)
Causally Robust Reward Learning from Reason-Augmented Preference Feedback
di: Hwang, Minjune, et al.
Pubblicazione: (2026)
di: Hwang, Minjune, et al.
Pubblicazione: (2026)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
di: Deng, Boyuan, et al.
Pubblicazione: (2025)
di: Deng, Boyuan, et al.
Pubblicazione: (2025)
DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing
di: Lee, Vint, et al.
Pubblicazione: (2023)
di: Lee, Vint, et al.
Pubblicazione: (2023)
Documenti analoghi
-
VisFly: An Efficient and Versatile Simulator for Training Vision-based Flight
di: Li, Fanxing, et al.
Pubblicazione: (2024) -
VisFly-Lab: Unified Differentiable Framework for First-Order Reinforcement Learning of Quadrotor Control
di: Li, Fanxing, et al.
Pubblicazione: (2026) -
First Order Model-Based RL through Decoupled Backpropagation
di: Amigo, Joseph, et al.
Pubblicazione: (2025) -
Aligning Text-to-Image Diffusion Models with Reward Backpropagation
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023) -
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)