Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cho, Young Hyun, Sun, Will Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Privacy-Preserving Dynamic Assortment Selection
par: Cho, Young Hyun, et autres
Publié: (2024)
par: Cho, Young Hyun, et autres
Publié: (2024)
Dense Reward for Free in Reinforcement Learning from Human Feedback
par: Chan, Alex J., et autres
Publié: (2024)
par: Chan, Alex J., et autres
Publié: (2024)
Privacy Preserving Reinforcement Learning with One-Sided Feedback
par: Cong, Lin William, et autres
Publié: (2026)
par: Cong, Lin William, et autres
Publié: (2026)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
par: Zhang, Shun, et autres
Publié: (2024)
par: Zhang, Shun, et autres
Publié: (2024)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
par: Liu, Pangpang, et autres
Publié: (2025)
par: Liu, Pangpang, et autres
Publié: (2025)
Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis
par: Zhang, Qining, et autres
Publié: (2024)
par: Zhang, Qining, et autres
Publié: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
par: Liu, Pangpang, et autres
Publié: (2024)
par: Liu, Pangpang, et autres
Publié: (2024)
Reinforcement Learning from Human Feedback: A Statistical Perspective
par: Liu, Pangpang, et autres
Publié: (2026)
par: Liu, Pangpang, et autres
Publié: (2026)
Beyond Data Splitting: Full-Data Conformal Prediction by Differential Privacy
par: Cho, Young Hyun, et autres
Publié: (2026)
par: Cho, Young Hyun, et autres
Publié: (2026)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
par: Ackermann, Johannes, et autres
Publié: (2025)
par: Ackermann, Johannes, et autres
Publié: (2025)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
par: Lee, Seong Jin, et autres
Publié: (2024)
par: Lee, Seong Jin, et autres
Publié: (2024)
A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning
par: Sun, Shengjie, et autres
Publié: (2024)
par: Sun, Shengjie, et autres
Publié: (2024)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
par: Chakraborty, Souradip, et autres
Publié: (2023)
par: Chakraborty, Souradip, et autres
Publié: (2023)
Reward-Preserving Attacks For Robust Reinforcement Learning
par: Schott, Lucas, et autres
Publié: (2026)
par: Schott, Lucas, et autres
Publié: (2026)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
par: Zhai, Yuanzhao, et autres
Publié: (2023)
par: Zhai, Yuanzhao, et autres
Publié: (2023)
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
par: Zhang, Qining, et autres
Publié: (2024)
par: Zhang, Qining, et autres
Publié: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
When Should an AI Workflow Release? Always-Valid Inference for Black-Box Generate-Verify Systems
par: Cho, Young Hyun, et autres
Publié: (2026)
par: Cho, Young Hyun, et autres
Publié: (2026)
Reinforcement Learning from Human Feedback
par: Lambert, Nathan
Publié: (2025)
par: Lambert, Nathan
Publié: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
par: Ye, Chenlu, et autres
Publié: (2024)
par: Ye, Chenlu, et autres
Publié: (2024)
Privacy-Preserving Personalized Federated Prompt Learning for Multimodal Large Language Models
par: Tran, Linh, et autres
Publié: (2025)
par: Tran, Linh, et autres
Publié: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
Strategyproof Reinforcement Learning from Human Feedback
par: Buening, Thomas Kleine, et autres
Publié: (2025)
par: Buening, Thomas Kleine, et autres
Publié: (2025)
Adaptive Querying for Reward Learning from Human Feedback
par: Anand, Yashwanthi, et autres
Publié: (2024)
par: Anand, Yashwanthi, et autres
Publié: (2024)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
par: Chaudhari, Shreyas, et autres
Publié: (2025)
par: Chaudhari, Shreyas, et autres
Publié: (2025)
Privacy Preserving Reinforcement Learning for Population Processes
par: Yang-Zhao, Samuel, et autres
Publié: (2024)
par: Yang-Zhao, Samuel, et autres
Publié: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
par: Bukharin, Alexander, et autres
Publié: (2024)
par: Bukharin, Alexander, et autres
Publié: (2024)
Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback
par: Liu, Qiang, et autres
Publié: (2026)
par: Liu, Qiang, et autres
Publié: (2026)
DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay
par: Li, Long, et autres
Publié: (2026)
par: Li, Long, et autres
Publié: (2026)
Reinforcing Human Behavior Simulation via Verbal Feedback
par: Sun, Weiwei, et autres
Publié: (2026)
par: Sun, Weiwei, et autres
Publié: (2026)
Preserving Expert-Level Privacy in Offline Reinforcement Learning
par: Sharma, Navodita, et autres
Publié: (2024)
par: Sharma, Navodita, et autres
Publié: (2024)
Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling
par: Qi, Han, et autres
Publié: (2025)
par: Qi, Han, et autres
Publié: (2025)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Decoupling Task and Behavior: A Two-Stage Reward Curriculum in Reinforcement Learning for Robotics
par: Freitag, Kilian, et autres
Publié: (2026)
par: Freitag, Kilian, et autres
Publié: (2026)
Reinforcement Learning from Multi-level and Episodic Human Feedback
par: Elahi, Muhammad Qasim, et autres
Publié: (2025)
par: Elahi, Muhammad Qasim, et autres
Publié: (2025)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
par: Swamy, Gokul, et autres
Publié: (2024)
par: Swamy, Gokul, et autres
Publié: (2024)
Multi-turn Reinforcement Learning from Preference Human Feedback
par: Shani, Lior, et autres
Publié: (2024)
par: Shani, Lior, et autres
Publié: (2024)
Reinforcement Learning with LTL and $ω$-Regular Objectives via Optimality-Preserving Translation to Average Rewards
par: Le, Xuan-Bach, et autres
Publié: (2024)
par: Le, Xuan-Bach, et autres
Publié: (2024)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
par: Cercola, Matteo, et autres
Publié: (2025)
par: Cercola, Matteo, et autres
Publié: (2025)
Privacy-Preserving Federated Learning via Differential Privacy and Homomorphic Encryption for Cardiovascular Disease Risk Modeling
par: Sharma, Gaurang, et autres
Publié: (2026)
par: Sharma, Gaurang, et autres
Publié: (2026)
Documents similaires
-
Privacy-Preserving Dynamic Assortment Selection
par: Cho, Young Hyun, et autres
Publié: (2024) -
Dense Reward for Free in Reinforcement Learning from Human Feedback
par: Chan, Alex J., et autres
Publié: (2024) -
Privacy Preserving Reinforcement Learning with One-Sided Feedback
par: Cong, Lin William, et autres
Publié: (2026) -
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
par: Zhang, Shun, et autres
Publié: (2024) -
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
par: Liu, Pangpang, et autres
Publié: (2025)