CANDERE-COACH: Reinforcement Learning from Noisy Feedback
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Yuxuan, Das, Srijita, Taylor, Matthew E. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Feature Dependent Noise in Preference-based Reinforcement Learning
by: Li, Yuxuan, et al.
Published: (2026)
by: Li, Yuxuan, et al.
Published: (2026)
A Systematic Approach to Design Real-World Human-in-the-Loop Deep Reinforcement Learning: Salient Features, Challenges and Trade-offs
by: Arabneydi, Jalal, et al.
Published: (2025)
by: Arabneydi, Jalal, et al.
Published: (2025)
Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback
by: Yang, Yutao, et al.
Published: (2025)
by: Yang, Yutao, et al.
Published: (2025)
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
by: Kharyal, Chaitanya, et al.
Published: (2024)
by: Kharyal, Chaitanya, et al.
Published: (2024)
Leveraging Sub-Optimal Data for Human-in-the-Loop Reinforcement Learning
by: Muslimani, Calarina, et al.
Published: (2024)
by: Muslimani, Calarina, et al.
Published: (2024)
Learning to Clean: Reinforcement Learning for Noisy Label Correction
by: Heidari, Marzi, et al.
Published: (2025)
by: Heidari, Marzi, et al.
Published: (2025)
Flexible Blood Glucose Control: Offline Reinforcement Learning from Human Feedback
by: Emerson, Harry, et al.
Published: (2025)
by: Emerson, Harry, et al.
Published: (2025)
RLAF: Reinforcement Learning from Automaton Feedback
by: Alinejad, Mahyar, et al.
Published: (2025)
by: Alinejad, Mahyar, et al.
Published: (2025)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
by: Hong, Ilgee, et al.
Published: (2024)
by: Hong, Ilgee, et al.
Published: (2024)
Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance
by: Santaniello, Julia, et al.
Published: (2025)
by: Santaniello, Julia, et al.
Published: (2025)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
by: Cai, Xin-Qiang, et al.
Published: (2025)
by: Cai, Xin-Qiang, et al.
Published: (2025)
Reinforcement Learning with Backtracking Feedback
by: Sel, Bilgehan, et al.
Published: (2026)
by: Sel, Bilgehan, et al.
Published: (2026)
LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
by: Li, Ang, et al.
Published: (2025)
by: Li, Ang, et al.
Published: (2025)
Towards User-level Private Reinforcement Learning with Human Feedback
by: Zhang, Jiaming, et al.
Published: (2025)
by: Zhang, Jiaming, et al.
Published: (2025)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
by: Cheng, Jie, et al.
Published: (2024)
by: Cheng, Jie, et al.
Published: (2024)
TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement Learning
by: Li, Yuxuan, et al.
Published: (2025)
by: Li, Yuxuan, et al.
Published: (2025)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
by: Kim, Gihoon, et al.
Published: (2026)
by: Kim, Gihoon, et al.
Published: (2026)
Reinforcement Learning with Intrinsically Motivated Feedback Graph for Lost-sales Inventory Control
by: Liu, Zifan, et al.
Published: (2024)
by: Liu, Zifan, et al.
Published: (2024)
Corruption Robust Offline Reinforcement Learning with Human Feedback
by: Mandal, Debmalya, et al.
Published: (2024)
by: Mandal, Debmalya, et al.
Published: (2024)
Privacy Preserving Reinforcement Learning with One-Sided Feedback
by: Cong, Lin William, et al.
Published: (2026)
by: Cong, Lin William, et al.
Published: (2026)
Inverse Reinforcement Learning With Constraint Recovery
by: Das, Nirjhar, et al.
Published: (2023)
by: Das, Nirjhar, et al.
Published: (2023)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
by: Zhang, Xikai, et al.
Published: (2026)
by: Zhang, Xikai, et al.
Published: (2026)
Parameter Efficient Reinforcement Learning from Human Feedback
by: Sidahmed, Hakim, et al.
Published: (2024)
by: Sidahmed, Hakim, et al.
Published: (2024)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
by: Ji, Jiaming, et al.
Published: (2025)
by: Ji, Jiaming, et al.
Published: (2025)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
by: Cercola, Matteo, et al.
Published: (2025)
by: Cercola, Matteo, et al.
Published: (2025)
FPGA Divide-and-Conquer Placement using Deep Reinforcement Learning
by: Wang, Shang, et al.
Published: (2024)
by: Wang, Shang, et al.
Published: (2024)
Reward Learning through Ranking Mean Squared Error
by: Kharyal, Chaitanya, et al.
Published: (2026)
by: Kharyal, Chaitanya, et al.
Published: (2026)
Noisy PDE Training Requires Bigger PINNs
by: Andre-Sloan, Sebastien, et al.
Published: (2025)
by: Andre-Sloan, Sebastien, et al.
Published: (2025)
HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback
by: Li, Ang, et al.
Published: (2024)
by: Li, Ang, et al.
Published: (2024)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
by: Xiao, Teng, et al.
Published: (2024)
by: Xiao, Teng, et al.
Published: (2024)
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback
by: Xiong, Guojun, et al.
Published: (2024)
by: Xiong, Guojun, et al.
Published: (2024)
Learning from Noisy Labels for Long-tailed Data via Optimal Transport
by: Li, Mengting, et al.
Published: (2024)
by: Li, Mengting, et al.
Published: (2024)
Long-term Safe Reinforcement Learning with Binary Feedback
by: Wachi, Akifumi, et al.
Published: (2024)
by: Wachi, Akifumi, et al.
Published: (2024)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
by: Lee, Harrison, et al.
Published: (2023)
by: Lee, Harrison, et al.
Published: (2023)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
Learning Robust Reward Machines from Noisy Labels
by: Parac, Roko, et al.
Published: (2024)
by: Parac, Roko, et al.
Published: (2024)
TMLC-Net: Transferable Meta Label Correction for Noisy Label Learning
by: Li, Mengyang
Published: (2025)
by: Li, Mengyang
Published: (2025)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
by: Chaudhari, Shreyas, et al.
Published: (2025)
by: Chaudhari, Shreyas, et al.
Published: (2025)
High-dimensional Learning with Noisy Labels
by: Firdoussi, Aymane El, et al.
Published: (2024)
by: Firdoussi, Aymane El, et al.
Published: (2024)
Similar Items
-
Evaluating Feature Dependent Noise in Preference-based Reinforcement Learning
by: Li, Yuxuan, et al.
Published: (2026) -
A Systematic Approach to Design Real-World Human-in-the-Loop Deep Reinforcement Learning: Salient Features, Challenges and Trade-offs
by: Arabneydi, Jalal, et al.
Published: (2025) -
Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback
by: Yang, Yutao, et al.
Published: (2025) -
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
by: Kharyal, Chaitanya, et al.
Published: (2024) -
Leveraging Sub-Optimal Data for Human-in-the-Loop Reinforcement Learning
by: Muslimani, Calarina, et al.
Published: (2024)