Guardado en:
| Autores principales: | Zhang, Qining, Wei, Honghao, Ying, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2406.07455 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
por: Zhang, Qining, et al.
Publicado: (2024)
por: Zhang, Qining, et al.
Publicado: (2024)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
por: Zhang, Qining, et al.
Publicado: (2025)
por: Zhang, Qining, et al.
Publicado: (2025)
Fast and Regret Optimal Best Arm Identification: Fundamental Limits and Low-Complexity Algorithms
por: Zhang, Qining, et al.
Publicado: (2023)
por: Zhang, Qining, et al.
Publicado: (2023)
Dense Reward for Free in Reinforcement Learning from Human Feedback
por: Chan, Alex J., et al.
Publicado: (2024)
por: Chan, Alex J., et al.
Publicado: (2024)
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
por: Zhou, Zihan, et al.
Publicado: (2023)
por: Zhou, Zihan, et al.
Publicado: (2023)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
por: Cho, Young Hyun, et al.
Publicado: (2026)
por: Cho, Young Hyun, et al.
Publicado: (2026)
Cost Aware Best Arm Identification
por: Kanarios, Kellen, et al.
Publicado: (2024)
por: Kanarios, Kellen, et al.
Publicado: (2024)
Efficient Federated RLHF via Zeroth-Order Policy Optimization
por: Wang, Deyi, et al.
Publicado: (2026)
por: Wang, Deyi, et al.
Publicado: (2026)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
por: Peng, Xiyue, et al.
Publicado: (2024)
por: Peng, Xiyue, et al.
Publicado: (2024)
A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning
por: Chen, Ying-Tu, et al.
Publicado: (2026)
por: Chen, Ying-Tu, et al.
Publicado: (2026)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025)
por: Ackermann, Johannes, et al.
Publicado: (2025)
Scaling Reward Modeling without Human Supervision
por: Fan, Jingxuan, et al.
Publicado: (2026)
por: Fan, Jingxuan, et al.
Publicado: (2026)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
por: Ye, Chenlu, et al.
Publicado: (2024)
por: Ye, Chenlu, et al.
Publicado: (2024)
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
por: Luu, Tung M., et al.
Publicado: (2025)
por: Luu, Tung M., et al.
Publicado: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
por: Chakraborty, Souradip, et al.
Publicado: (2023)
por: Chakraborty, Souradip, et al.
Publicado: (2023)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
por: Liu, Pangpang, et al.
Publicado: (2025)
por: Liu, Pangpang, et al.
Publicado: (2025)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
por: Aggarwal, Vaneet, et al.
Publicado: (2024)
por: Aggarwal, Vaneet, et al.
Publicado: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
por: Liu, Pangpang, et al.
Publicado: (2024)
por: Liu, Pangpang, et al.
Publicado: (2024)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
por: Chaudhari, Shreyas, et al.
Publicado: (2025)
por: Chaudhari, Shreyas, et al.
Publicado: (2025)
Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
Reinforcement Learning from Human Feedback
por: Lambert, Nathan
Publicado: (2025)
por: Lambert, Nathan
Publicado: (2025)
Reinforcement Learning from Human Feedback: A Statistical Perspective
por: Liu, Pangpang, et al.
Publicado: (2026)
por: Liu, Pangpang, et al.
Publicado: (2026)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
por: Ishihara, Yu, et al.
Publicado: (2025)
por: Ishihara, Yu, et al.
Publicado: (2025)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
por: Solway, Alec
Publicado: (2024)
por: Solway, Alec
Publicado: (2024)
Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
por: Yang, Kai, et al.
Publicado: (2023)
por: Yang, Kai, et al.
Publicado: (2023)
Robust Reinforcement Learning from Corrupted Human Feedback
por: Bukharin, Alexander, et al.
Publicado: (2024)
por: Bukharin, Alexander, et al.
Publicado: (2024)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
por: Cercola, Matteo, et al.
Publicado: (2025)
por: Cercola, Matteo, et al.
Publicado: (2025)
TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
por: Pang, Lei, et al.
Publicado: (2025)
por: Pang, Lei, et al.
Publicado: (2025)
Adaptive Querying for Reward Learning from Human Feedback
por: Anand, Yashwanthi, et al.
Publicado: (2024)
por: Anand, Yashwanthi, et al.
Publicado: (2024)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
por: Lee, Seong Jin, et al.
Publicado: (2024)
por: Lee, Seong Jin, et al.
Publicado: (2024)
Strategyproof Reinforcement Learning from Human Feedback
por: Buening, Thomas Kleine, et al.
Publicado: (2025)
por: Buening, Thomas Kleine, et al.
Publicado: (2025)
Towards User-level Private Reinforcement Learning with Human Feedback
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
por: Wei, Honghao, et al.
Publicado: (2024)
por: Wei, Honghao, et al.
Publicado: (2024)
Federated Learning with Instance-Dependent Noisy Label
por: Wang, Lei, et al.
Publicado: (2023)
por: Wang, Lei, et al.
Publicado: (2023)
A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning
por: Sun, Shengjie, et al.
Publicado: (2024)
por: Sun, Shengjie, et al.
Publicado: (2024)
Free Process Rewards without Process Labels
por: Yuan, Lifan, et al.
Publicado: (2024)
por: Yuan, Lifan, et al.
Publicado: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
por: Zhang, Zhen-Yu, et al.
Publicado: (2026)
por: Zhang, Zhen-Yu, et al.
Publicado: (2026)
Ejemplares similares
-
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
por: Zhang, Qining, et al.
Publicado: (2024) -
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
por: Zhang, Qining, et al.
Publicado: (2025) -
Fast and Regret Optimal Best Arm Identification: Fundamental Limits and Low-Complexity Algorithms
por: Zhang, Qining, et al.
Publicado: (2023) -
Dense Reward for Free in Reinforcement Learning from Human Feedback
por: Chan, Alex J., et al.
Publicado: (2024) -
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
por: Zhou, Zihan, et al.
Publicado: (2023)