Strategyproof Reinforcement Learning from Human Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Buening, Thomas Kleine, Gan, Jiarui, Mandal, Debmalya, Kwiatkowska, Marta |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding
von: Shao, Daqian, et al.
Veröffentlicht: (2025)
von: Shao, Daqian, et al.
Veröffentlicht: (2025)
Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
von: Pásztor, Barna, et al.
Veröffentlicht: (2025)
von: Pásztor, Barna, et al.
Veröffentlicht: (2025)
Environment Design for Inverse Reinforcement Learning
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2022)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2022)
Distributionally Robust Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
Corruption-robust Offline Multi-agent Reinforcement Learning From Human Feedback
von: Nika, Andi, et al.
Veröffentlicht: (2026)
von: Nika, Andi, et al.
Veröffentlicht: (2026)
MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference
von: Baur, Raphaël, et al.
Veröffentlicht: (2026)
von: Baur, Raphaël, et al.
Veröffentlicht: (2026)
Stochastic Principal-Agent Problems: Efficient Computation and Learning
von: Gan, Jiarui, et al.
Veröffentlicht: (2023)
von: Gan, Jiarui, et al.
Veröffentlicht: (2023)
On Corruption-Robustness in Performative Reinforcement Learning
von: Pollatos, Vasilis, et al.
Veröffentlicht: (2025)
von: Pollatos, Vasilis, et al.
Veröffentlicht: (2025)
Strategic Linear Contextual Bandits
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2024)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2024)
Performative Reinforcement Learning with Linear Markov Decision Process
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
Reinforcement Learning via Self-Distillation
von: Hübotter, Jonas, et al.
Veröffentlicht: (2026)
von: Hübotter, Jonas, et al.
Veröffentlicht: (2026)
Performative Reinforcement Learning in Gradually Shifting Environments
von: Rank, Ben, et al.
Veröffentlicht: (2024)
von: Rank, Ben, et al.
Veröffentlicht: (2024)
Aligning Language Models from User Interactions
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2026)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2026)
Sparse Offline Reinforcement Learning with Corruption Robustness
von: Tran, Nam Phuong, et al.
Veröffentlicht: (2025)
von: Tran, Nam Phuong, et al.
Veröffentlicht: (2025)
Policy Teaching via Data Poisoning in Learning from Human Preferences
von: Nika, Andi, et al.
Veröffentlicht: (2025)
von: Nika, Andi, et al.
Veröffentlicht: (2025)
Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences
von: Nika, Andi, et al.
Veröffentlicht: (2024)
von: Nika, Andi, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Human Feedback
von: Lambert, Nathan
Veröffentlicht: (2025)
von: Lambert, Nathan
Veröffentlicht: (2025)
Learning Decision Policies with Instrumental Variables through Double Machine Learning
von: Shao, Daqian, et al.
Veröffentlicht: (2024)
von: Shao, Daqian, et al.
Veröffentlicht: (2024)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
Double Machine Learning for Conditional Moment Restrictions: IV Regression, Proximal Causal Learning and Beyond
von: Shao, Daqian, et al.
Veröffentlicht: (2025)
von: Shao, Daqian, et al.
Veröffentlicht: (2025)
Independent Learning in Performative Markov Potential Games
von: Sahitaj, Rilind, et al.
Veröffentlicht: (2025)
von: Sahitaj, Rilind, et al.
Veröffentlicht: (2025)
STR-Cert: Robustness Certification for Deep Text Recognition on Deep Learning Pipelines and Vision Transformers
von: Shao, Daqian, et al.
Veröffentlicht: (2023)
von: Shao, Daqian, et al.
Veröffentlicht: (2023)
Reinforcement Learning from Multi-level and Episodic Human Feedback
von: Elahi, Muhammad Qasim, et al.
Veröffentlicht: (2025)
von: Elahi, Muhammad Qasim, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback: A Statistical Perspective
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
von: Swamy, Gokul, et al.
Veröffentlicht: (2024)
von: Swamy, Gokul, et al.
Veröffentlicht: (2024)
Dense Reward for Free in Reinforcement Learning from Human Feedback
von: Chan, Alex J., et al.
Veröffentlicht: (2024)
von: Chan, Alex J., et al.
Veröffentlicht: (2024)
Multi-turn Reinforcement Learning from Preference Human Feedback
von: Shani, Lior, et al.
Veröffentlicht: (2024)
von: Shani, Lior, et al.
Veröffentlicht: (2024)
GRAPHLCP: Structure-Aware Localized Conformal Prediction on Graphs
von: Baghershahi, Peyman, et al.
Veröffentlicht: (2026)
von: Baghershahi, Peyman, et al.
Veröffentlicht: (2026)
Privacy Preserving Reinforcement Learning with One-Sided Feedback
von: Cong, Lin William, et al.
Veröffentlicht: (2026)
von: Cong, Lin William, et al.
Veröffentlicht: (2026)
MIBP-Cert: Certified Training against Data Perturbations with Mixed-Integer Bilinear Programs
von: Lorenz, Tobias, et al.
Veröffentlicht: (2024)
von: Lorenz, Tobias, et al.
Veröffentlicht: (2024)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
von: Chen, Ruitao, et al.
Veröffentlicht: (2024)
von: Chen, Ruitao, et al.
Veröffentlicht: (2024)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
von: Lee, Seong Jin, et al.
Veröffentlicht: (2024)
von: Lee, Seong Jin, et al.
Veröffentlicht: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
von: Lambert, Nathan, et al.
Veröffentlicht: (2023)
von: Lambert, Nathan, et al.
Veröffentlicht: (2023)
Language Generation in the Limit: Noise, Loss, and Feedback
von: Bai, Yannan, et al.
Veröffentlicht: (2025)
von: Bai, Yannan, et al.
Veröffentlicht: (2025)
Reinforcing Human Behavior Simulation via Verbal Feedback
von: Sun, Weiwei, et al.
Veröffentlicht: (2026)
von: Sun, Weiwei, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding
von: Shao, Daqian, et al.
Veröffentlicht: (2025) -
Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
von: Pásztor, Barna, et al.
Veröffentlicht: (2025) -
Environment Design for Inverse Reinforcement Learning
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2022) -
Distributionally Robust Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025) -
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)