Distributionally Robust Reinforcement Learning with Human Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mandal, Debmalya, Sasnauskas, Paulius, Radanovic, Goran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
Independent Learning in Performative Markov Potential Games
von: Sahitaj, Rilind, et al.
Veröffentlicht: (2025)
von: Sahitaj, Rilind, et al.
Veröffentlicht: (2025)
Can In-Context Reinforcement Learning Recover From Reward Poisoning Attacks?
von: Sasnauskas, Paulius, et al.
Veröffentlicht: (2025)
von: Sasnauskas, Paulius, et al.
Veröffentlicht: (2025)
Performative Reinforcement Learning with Linear Markov Decision Process
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
On Corruption-Robustness in Performative Reinforcement Learning
von: Pollatos, Vasilis, et al.
Veröffentlicht: (2025)
von: Pollatos, Vasilis, et al.
Veröffentlicht: (2025)
Corruption-robust Offline Multi-agent Reinforcement Learning From Human Feedback
von: Nika, Andi, et al.
Veröffentlicht: (2026)
von: Nika, Andi, et al.
Veröffentlicht: (2026)
Parameter Efficient Reinforcement Learning from Human Feedback
von: Sidahmed, Hakim, et al.
Veröffentlicht: (2024)
von: Sidahmed, Hakim, et al.
Veröffentlicht: (2024)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
von: Lee, Harrison, et al.
Veröffentlicht: (2023)
von: Lee, Harrison, et al.
Veröffentlicht: (2023)
Performative Reinforcement Learning in Gradually Shifting Environments
von: Rank, Ben, et al.
Veröffentlicht: (2024)
von: Rank, Ben, et al.
Veröffentlicht: (2024)
Corruption-Robust Offline Two-Player Zero-Sum Markov Games
von: Nika, Andi, et al.
Veröffentlicht: (2024)
von: Nika, Andi, et al.
Veröffentlicht: (2024)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
von: Ackermann, Johannes, et al.
Veröffentlicht: (2025)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2025)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
Reinforcement Learning with Backtracking Feedback
von: Sel, Bilgehan, et al.
Veröffentlicht: (2026)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2026)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
von: Chittepu, Yaswanth, et al.
Veröffentlicht: (2025)
von: Chittepu, Yaswanth, et al.
Veröffentlicht: (2025)
Sparse Offline Reinforcement Learning with Corruption Robustness
von: Tran, Nam Phuong, et al.
Veröffentlicht: (2025)
von: Tran, Nam Phuong, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback with Active Queries
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
von: Hahm, Dongyoon, et al.
Veröffentlicht: (2026)
von: Hahm, Dongyoon, et al.
Veröffentlicht: (2026)
Reward Design for Justifiable Sequential Decision-Making
von: Sukovic, Aleksa, et al.
Veröffentlicht: (2024)
von: Sukovic, Aleksa, et al.
Veröffentlicht: (2024)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
von: Panaganti, Kishan, et al.
Veröffentlicht: (2026)
von: Panaganti, Kishan, et al.
Veröffentlicht: (2026)
Stochastic Principal-Agent Problems: Efficient Computation and Learning
von: Gan, Jiarui, et al.
Veröffentlicht: (2023)
von: Gan, Jiarui, et al.
Veröffentlicht: (2023)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
von: Li, Gen, et al.
Veröffentlicht: (2025)
von: Li, Gen, et al.
Veröffentlicht: (2025)
Learning Personalized Agents from Human Feedback
von: Liang, Kaiqu, et al.
Veröffentlicht: (2026)
von: Liang, Kaiqu, et al.
Veröffentlicht: (2026)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
von: Wu, Jiaxing, et al.
Veröffentlicht: (2024)
von: Wu, Jiaxing, et al.
Veröffentlicht: (2024)
Reinforcement Learning for Durable Algorithmic Recourse
von: Ceccon, Marina, et al.
Veröffentlicht: (2025)
von: Ceccon, Marina, et al.
Veröffentlicht: (2025)
AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback
von: Dubois, Yann, et al.
Veröffentlicht: (2023)
von: Dubois, Yann, et al.
Veröffentlicht: (2023)
Dr Genre: Reinforcement Learning from Decoupled LLM Feedback for Generic Text Rewriting
von: Li, Yufei, et al.
Veröffentlicht: (2025)
von: Li, Yufei, et al.
Veröffentlicht: (2025)
RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
von: Park, Jungsoo, et al.
Veröffentlicht: (2026)
von: Park, Jungsoo, et al.
Veröffentlicht: (2026)
Agent-Specific Effects: A Causal Effect Propagation Analysis in Multi-Agent MDPs
von: Triantafyllou, Stelios, et al.
Veröffentlicht: (2023)
von: Triantafyllou, Stelios, et al.
Veröffentlicht: (2023)
RLTHF: Targeted Human Feedback for LLM Alignment
von: Xu, Yifei, et al.
Veröffentlicht: (2025)
von: Xu, Yifei, et al.
Veröffentlicht: (2025)
Learning Embeddings for Sequential Tasks Using Population of Agents
von: Mahajan, Mridul, et al.
Veröffentlicht: (2023)
von: Mahajan, Mridul, et al.
Veröffentlicht: (2023)
Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback
von: Yang, Diji, et al.
Veröffentlicht: (2024)
von: Yang, Diji, et al.
Veröffentlicht: (2024)
Personalized Language Modeling from Personalized Human Feedback
von: Li, Xinyu, et al.
Veröffentlicht: (2024)
von: Li, Xinyu, et al.
Veröffentlicht: (2024)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
von: Zhang, Wenbo, et al.
Veröffentlicht: (2024)
von: Zhang, Wenbo, et al.
Veröffentlicht: (2024)
Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling
von: Hao, Bingguang, et al.
Veröffentlicht: (2025)
von: Hao, Bingguang, et al.
Veröffentlicht: (2025)
VickreyFeedback: Cost-efficient Data Construction for Reinforcement Learning from Human Feedback
von: Zhang, Guoxi, et al.
Veröffentlicht: (2024)
von: Zhang, Guoxi, et al.
Veröffentlicht: (2024)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024) -
Independent Learning in Performative Markov Potential Games
von: Sahitaj, Rilind, et al.
Veröffentlicht: (2025) -
Can In-Context Reinforcement Learning Recover From Reward Poisoning Attacks?
von: Sasnauskas, Paulius, et al.
Veröffentlicht: (2025) -
Performative Reinforcement Learning with Linear Markov Decision Process
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024) -
On Corruption-Robustness in Performative Reinforcement Learning
von: Pollatos, Vasilis, et al.
Veröffentlicht: (2025)