A Minimaximalist Approach to Reinforcement Learning from Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Swamy, Gokul, Dann, Christoph, Kidambi, Rahul, Wu, Zhiwei Steven, Agarwal, Alekh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Inverse Reinforcement Learning without Reinforcement Learning
di: Swamy, Gokul, et al.
Pubblicazione: (2023)
di: Swamy, Gokul, et al.
Pubblicazione: (2023)
Design Considerations in Offline Preference-based RL
di: Agarwal, Alekh, et al.
Pubblicazione: (2025)
di: Agarwal, Alekh, et al.
Pubblicazione: (2025)
The Virtues of Pessimism in Inverse Reinforcement Learning
di: Wu, David, et al.
Pubblicazione: (2024)
di: Wu, David, et al.
Pubblicazione: (2024)
Mitigating Preference Hacking in Policy Optimization with Pessimism
di: Gupta, Dhawal, et al.
Pubblicazione: (2025)
di: Gupta, Dhawal, et al.
Pubblicazione: (2025)
Hybrid Inverse Reinforcement Learning
di: Ren, Juntao, et al.
Pubblicazione: (2024)
di: Ren, Juntao, et al.
Pubblicazione: (2024)
Preserving Expert-Level Privacy in Offline Reinforcement Learning
di: Sharma, Navodita, et al.
Pubblicazione: (2024)
di: Sharma, Navodita, et al.
Pubblicazione: (2024)
All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning
di: Swamy, Gokul, et al.
Pubblicazione: (2025)
di: Swamy, Gokul, et al.
Pubblicazione: (2025)
Multi-Agent Imitation Learning: Value is Easy, Regret is Hard
di: Tang, Jingwu, et al.
Pubblicazione: (2024)
di: Tang, Jingwu, et al.
Pubblicazione: (2024)
Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling
di: Agarwal, Alekh, et al.
Pubblicazione: (2022)
di: Agarwal, Alekh, et al.
Pubblicazione: (2022)
Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
di: Sutawika, Lintang, et al.
Pubblicazione: (2026)
di: Sutawika, Lintang, et al.
Pubblicazione: (2026)
A Model Selection Approach for Corruption Robust Reinforcement Learning
di: Wei, Chen-Yu, et al.
Pubblicazione: (2021)
di: Wei, Chen-Yu, et al.
Pubblicazione: (2021)
Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
di: Zhong, Huiying, et al.
Pubblicazione: (2024)
di: Zhong, Huiying, et al.
Pubblicazione: (2024)
More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
Diffusing States and Matching Scores: A New Framework for Imitation Learning
di: Wu, Runzhe, et al.
Pubblicazione: (2024)
di: Wu, Runzhe, et al.
Pubblicazione: (2024)
Offline Imitation Learning from Multiple Baselines with Applications to Compiler Optimization
di: Marinov, Teodor V., et al.
Pubblicazione: (2024)
di: Marinov, Teodor V., et al.
Pubblicazione: (2024)
A Human-Centric Approach to Explainable AI for Personalized Education
di: Swamy, Vinitra
Pubblicazione: (2025)
di: Swamy, Vinitra
Pubblicazione: (2025)
From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment
di: Wu, Yilin, et al.
Pubblicazione: (2025)
di: Wu, Yilin, et al.
Pubblicazione: (2025)
Reinforcement Learning from Human Feedback
di: Lambert, Nathan
Pubblicazione: (2025)
di: Lambert, Nathan
Pubblicazione: (2025)
Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning
di: Dann, Christoph, et al.
Pubblicazione: (2026)
di: Dann, Christoph, et al.
Pubblicazione: (2026)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
Strategyproof Reinforcement Learning from Human Feedback
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2025)
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2025)
Differentially Private SGD Without Clipping Bias: An Error-Feedback Approach
di: Zhang, Xinwei, et al.
Pubblicazione: (2023)
di: Zhang, Xinwei, et al.
Pubblicazione: (2023)
Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
Reinforcement Learning from Human Feedback: A Statistical Perspective
di: Liu, Pangpang, et al.
Pubblicazione: (2026)
di: Liu, Pangpang, et al.
Pubblicazione: (2026)
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
di: Liu, Pangpang, et al.
Pubblicazione: (2024)
Your Learned Constraint is Secretly a Backward Reachable Tube
di: Qadri, Mohamad, et al.
Pubblicazione: (2025)
di: Qadri, Mohamad, et al.
Pubblicazione: (2025)
Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models
di: Belenki, Lior, et al.
Pubblicazione: (2025)
di: Belenki, Lior, et al.
Pubblicazione: (2025)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
Dense Reward for Free in Reinforcement Learning from Human Feedback
di: Chan, Alex J., et al.
Pubblicazione: (2024)
di: Chan, Alex J., et al.
Pubblicazione: (2024)
Multi-turn Reinforcement Learning from Preference Human Feedback
di: Shani, Lior, et al.
Pubblicazione: (2024)
di: Shani, Lior, et al.
Pubblicazione: (2024)
Reinforcement Learning from Multi-level and Episodic Human Feedback
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
A Survey of Reinforcement Learning from Human Feedback
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
Efficient Imitation under Misspecification
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
di: Chen, Ruitao, et al.
Pubblicazione: (2024)
di: Chen, Ruitao, et al.
Pubblicazione: (2024)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
di: Lee, Seong Jin, et al.
Pubblicazione: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2026)
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
di: Lambert, Nathan, et al.
Pubblicazione: (2023)
di: Lambert, Nathan, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Inverse Reinforcement Learning without Reinforcement Learning
di: Swamy, Gokul, et al.
Pubblicazione: (2023) -
Design Considerations in Offline Preference-based RL
di: Agarwal, Alekh, et al.
Pubblicazione: (2025) -
The Virtues of Pessimism in Inverse Reinforcement Learning
di: Wu, David, et al.
Pubblicazione: (2024) -
Mitigating Preference Hacking in Policy Optimization with Pessimism
di: Gupta, Dhawal, et al.
Pubblicazione: (2025) -
Hybrid Inverse Reinforcement Learning
di: Ren, Juntao, et al.
Pubblicazione: (2024)