RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Jie, Xiong, Gang, Dai, Xingyuan, Miao, Qinghai, Lv, Yisheng, Wang, Fei-Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Offline Reinforcement Learning with Discrete Diffusion Skills
di: Qiao, RuiXi, et al.
Pubblicazione: (2025)
di: Qiao, RuiXi, et al.
Pubblicazione: (2025)
Residual Reward Models for Preference-based Reinforcement Learning
di: Cao, Chenyang, et al.
Pubblicazione: (2025)
di: Cao, Chenyang, et al.
Pubblicazione: (2025)
Causally Robust Reward Learning from Reason-Augmented Preference Feedback
di: Hwang, Minjune, et al.
Pubblicazione: (2026)
di: Hwang, Minjune, et al.
Pubblicazione: (2026)
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025)
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025)
A Generalized Acquisition Function for Preference-based Reward Learning
di: Ellis, Evan, et al.
Pubblicazione: (2024)
di: Ellis, Evan, et al.
Pubblicazione: (2024)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
di: Cheng, Jie, et al.
Pubblicazione: (2024)
di: Cheng, Jie, et al.
Pubblicazione: (2024)
Predictive Preference Learning from Human Interventions
di: Cai, Haoyuan, et al.
Pubblicazione: (2025)
di: Cai, Haoyuan, et al.
Pubblicazione: (2025)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
di: Poddar, Sriyash, et al.
Pubblicazione: (2024)
di: Poddar, Sriyash, et al.
Pubblicazione: (2024)
Batch Active Learning of Reward Functions from Human Preferences
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
Preference-Conditioned Language-Guided Abstraction
di: Peng, Andi, et al.
Pubblicazione: (2024)
di: Peng, Andi, et al.
Pubblicazione: (2024)
Robust Offline Reinforcement Learning with Linearly Structured f-Divergence Regularization
di: Tang, Cheng, et al.
Pubblicazione: (2024)
di: Tang, Cheng, et al.
Pubblicazione: (2024)
Aligning Robot Navigation Behaviors with Human Intentions and Preferences
di: Karnan, Haresh
Pubblicazione: (2024)
di: Karnan, Haresh
Pubblicazione: (2024)
Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm
di: Kim, Hyeonjun, et al.
Pubblicazione: (2025)
di: Kim, Hyeonjun, et al.
Pubblicazione: (2025)
VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
Latent Embedding Adaptation for Human Preference Alignment in Diffusion Planners
di: Ng, Wen Zheng Terence, et al.
Pubblicazione: (2025)
di: Ng, Wen Zheng Terence, et al.
Pubblicazione: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
WOMBET: World Model-based Experience Transfer for Robust and Sample-efficient Reinforcement Learning
di: Kim, Mintae, et al.
Pubblicazione: (2026)
di: Kim, Mintae, et al.
Pubblicazione: (2026)
Towards Robust Zero-Shot Reinforcement Learning
di: Zheng, Kexin, et al.
Pubblicazione: (2025)
di: Zheng, Kexin, et al.
Pubblicazione: (2025)
Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
di: Gu, Shangding, et al.
Pubblicazione: (2025)
di: Gu, Shangding, et al.
Pubblicazione: (2025)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
di: Cheng, Jie, et al.
Pubblicazione: (2025)
di: Cheng, Jie, et al.
Pubblicazione: (2025)
Causal Flow Q-Learning for Robust Offline Reinforcement Learning
di: Li, Mingxuan, et al.
Pubblicazione: (2026)
di: Li, Mingxuan, et al.
Pubblicazione: (2026)
Research on Autonomous Robots Navigation based on Reinforcement Learning
di: Wang, Zixiang, et al.
Pubblicazione: (2024)
di: Wang, Zixiang, et al.
Pubblicazione: (2024)
Context-Aware Probabilistic Modeling with LLM for Multimodal Time Series Forecasting
di: Yao, Yueyang, et al.
Pubblicazione: (2025)
di: Yao, Yueyang, et al.
Pubblicazione: (2025)
When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?
di: Mu, Tongzhou, et al.
Pubblicazione: (2024)
di: Mu, Tongzhou, et al.
Pubblicazione: (2024)
Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction
di: He, Yiting, et al.
Pubblicazione: (2025)
di: He, Yiting, et al.
Pubblicazione: (2025)
Rating-based Reinforcement Learning
di: White, Devin, et al.
Pubblicazione: (2023)
di: White, Devin, et al.
Pubblicazione: (2023)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
di: Li, Yuanpeng, et al.
Pubblicazione: (2026)
di: Li, Yuanpeng, et al.
Pubblicazione: (2026)
Subwords as Skills: Tokenization for Sparse-Reward Reinforcement Learning
di: Yunis, David, et al.
Pubblicazione: (2023)
di: Yunis, David, et al.
Pubblicazione: (2023)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Dual Action Policy for Robust Sim-to-Real Reinforcement Learning
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
di: Rajaram, Sara, et al.
Pubblicazione: (2025)
di: Rajaram, Sara, et al.
Pubblicazione: (2025)
GOPT: Generalizable Online 3D Bin Packing via Transformer-based Deep Reinforcement Learning
di: Xiong, Heng, et al.
Pubblicazione: (2024)
di: Xiong, Heng, et al.
Pubblicazione: (2024)
Adversarial Preference Learning for Robust LLM Alignment
di: Wang, Yuanfu, et al.
Pubblicazione: (2025)
di: Wang, Yuanfu, et al.
Pubblicazione: (2025)
Real-World Reinforcement Learning of Active Perception Behaviors
di: Hu, Edward S., et al.
Pubblicazione: (2025)
di: Hu, Edward S., et al.
Pubblicazione: (2025)
Offline Reinforcement Learning of High-Quality Behaviors Under Robust Style Alignment
di: Petitbois, Mathieu, et al.
Pubblicazione: (2026)
di: Petitbois, Mathieu, et al.
Pubblicazione: (2026)
Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses
di: Nguyen, Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thanh, et al.
Pubblicazione: (2024)
Robust Deep Reinforcement Learning in Robotics via Adaptive Gradient-Masked Adversarial Attacks
di: Zhang, Zongyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zongyuan, et al.
Pubblicazione: (2025)
Innate-Values-driven Reinforcement Learning based Cognitive Modeling
di: Yang, Qin
Pubblicazione: (2024)
di: Yang, Qin
Pubblicazione: (2024)
A Safety Modulator Actor-Critic Method in Model-Free Safe Reinforcement Learning and Application in UAV Hovering
di: Qi, Qihan, et al.
Pubblicazione: (2024)
di: Qi, Qihan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Offline Reinforcement Learning with Discrete Diffusion Skills
di: Qiao, RuiXi, et al.
Pubblicazione: (2025) -
Residual Reward Models for Preference-based Reinforcement Learning
di: Cao, Chenyang, et al.
Pubblicazione: (2025) -
Causally Robust Reward Learning from Reason-Augmented Preference Feedback
di: Hwang, Minjune, et al.
Pubblicazione: (2026) -
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025) -
A Generalized Acquisition Function for Preference-based Reward Learning
di: Ellis, Evan, et al.
Pubblicazione: (2024)