Reinforcement Learning from User Feedback
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Eric, Chen, Jun, Sankararaman, Karthik Abinav, Peng, Xiaoliang, Xu, Tengyu, Helenowski, Eryk, Peng, Kaiyan, Kumar, Mrinal, Wang, Sinong, Fang, Han, Talebzadeh, Arya |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Generalized Parallel Scaling with Interdependent Generations
by: Dong, Harry, et al.
Published: (2025)
by: Dong, Harry, et al.
Published: (2025)
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
by: Yu, Zishun, et al.
Published: (2025)
by: Yu, Zishun, et al.
Published: (2025)
Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation
by: Qin, Chengwei, et al.
Published: (2025)
by: Qin, Chengwei, et al.
Published: (2025)
The Perfect Blend: Redefining RLHF with Mixture of Judges
by: Xu, Tengyu, et al.
Published: (2024)
by: Xu, Tengyu, et al.
Published: (2024)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
by: He, Yun, et al.
Published: (2024)
by: He, Yun, et al.
Published: (2024)
Controllable Discovery of Intents: Incremental Deep Clustering Using Semi-Supervised Contrastive Learning
by: Rawat, Mrinal, et al.
Published: (2024)
by: Rawat, Mrinal, et al.
Published: (2024)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
by: Wu, Bo, et al.
Published: (2025)
by: Wu, Bo, et al.
Published: (2025)
Contextual Bandits with Packing and Covering Constraints: A Modular Lagrangian Approach via Regression
by: Slivkins, Aleksandrs, et al.
Published: (2022)
by: Slivkins, Aleksandrs, et al.
Published: (2022)
Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback
by: Lin, Yen-Ting, et al.
Published: (2025)
by: Lin, Yen-Ting, et al.
Published: (2025)
On the Equivalence of Graph Convolution and Mixup
by: Han, Xiaotian, et al.
Published: (2023)
by: Han, Xiaotian, et al.
Published: (2023)
Towards User-level Private Reinforcement Learning with Human Feedback
by: Zhang, Jiaming, et al.
Published: (2025)
by: Zhang, Jiaming, et al.
Published: (2025)
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
by: Wu, Qingyuan, et al.
Published: (2024)
by: Wu, Qingyuan, et al.
Published: (2024)
Preference Optimization with Multi-Sample Comparisons
by: Wang, Chaoqi, et al.
Published: (2024)
by: Wang, Chaoqi, et al.
Published: (2024)
LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models
by: Han, Chi, et al.
Published: (2023)
by: Han, Chi, et al.
Published: (2023)
Boosting LLM Reasoning via Spontaneous Self-Correction
by: Zhao, Xutong, et al.
Published: (2025)
by: Zhao, Xutong, et al.
Published: (2025)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
by: Wu, Jiaxing, et al.
Published: (2024)
by: Wu, Jiaxing, et al.
Published: (2024)
Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models
by: Rao, Abinav, et al.
Published: (2026)
by: Rao, Abinav, et al.
Published: (2026)
LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation
by: Xia, Chongjun, et al.
Published: (2026)
by: Xia, Chongjun, et al.
Published: (2026)
Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
by: Yuan, Wenzhen, et al.
Published: (2025)
by: Yuan, Wenzhen, et al.
Published: (2025)
Fine-Tuning Hybrid Physics-Informed Neural Networks for Vehicle Dynamics Model Estimation
by: Fang, Shiming, et al.
Published: (2024)
by: Fang, Shiming, et al.
Published: (2024)
BQSched: A Non-intrusive Scheduler for Batch Concurrent Queries via Reinforcement Learning
by: Xu, Chenhao, et al.
Published: (2025)
by: Xu, Chenhao, et al.
Published: (2025)
ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning
by: Chen, Zhirong, et al.
Published: (2025)
by: Chen, Zhirong, et al.
Published: (2025)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
by: Zhang, Xikai, et al.
Published: (2026)
by: Zhang, Xikai, et al.
Published: (2026)
LearningFlow: Automated Policy Learning Workflow for Urban Driving with Large Language Models
by: Peng, Zengqi, et al.
Published: (2025)
by: Peng, Zengqi, et al.
Published: (2025)
RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
by: Meena, Yogesh Kumar, et al.
Published: (2026)
by: Meena, Yogesh Kumar, et al.
Published: (2026)
NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
by: Miao, Zhongtao, et al.
Published: (2026)
by: Miao, Zhongtao, et al.
Published: (2026)
Improving Arithmetic Reasoning Ability of Large Language Models through Relation Tuples, Verification and Dynamic Feedback
by: Miao, Zhongtao, et al.
Published: (2024)
by: Miao, Zhongtao, et al.
Published: (2024)
Graph Hopfield Networks: Energy-Based Node Classification with Associative Memory
by: Rao, Abinav, et al.
Published: (2026)
by: Rao, Abinav, et al.
Published: (2026)
Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control
by: Chen, Donghe, et al.
Published: (2025)
by: Chen, Donghe, et al.
Published: (2025)
Closing the Loop: Coordinating Inventory and Recommendation via Deep Reinforcement Learning on Multiple Timescales
by: Jiang, Jinyang, et al.
Published: (2025)
by: Jiang, Jinyang, et al.
Published: (2025)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
by: Ji, Jiaming, et al.
Published: (2025)
by: Ji, Jiaming, et al.
Published: (2025)
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
by: Zhao, Kaiyan, et al.
Published: (2024)
by: Zhao, Kaiyan, et al.
Published: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
by: Su, Huikang, et al.
Published: (2025)
by: Su, Huikang, et al.
Published: (2025)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
by: Li, Wendi, et al.
Published: (2024)
by: Li, Wendi, et al.
Published: (2024)
HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback
by: Li, Ang, et al.
Published: (2024)
by: Li, Ang, et al.
Published: (2024)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
by: Jiang, Zhizheng, et al.
Published: (2026)
by: Jiang, Zhizheng, et al.
Published: (2026)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
by: Zhan, Simon Sinong, et al.
Published: (2024)
by: Zhan, Simon Sinong, et al.
Published: (2024)
TeLL-Drive: Enhancing Autonomous Driving with Teacher LLM-Guided Deep Reinforcement Learning
by: Xu, Chengkai, et al.
Published: (2025)
by: Xu, Chengkai, et al.
Published: (2025)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
by: Peng, Xiyue, et al.
Published: (2024)
by: Peng, Xiyue, et al.
Published: (2024)
Similar Items
-
Generalized Parallel Scaling with Interdependent Generations
by: Dong, Harry, et al.
Published: (2025) -
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
by: Yu, Zishun, et al.
Published: (2025) -
Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation
by: Qin, Chengwei, et al.
Published: (2025) -
The Perfect Blend: Redefining RLHF with Mixture of Judges
by: Xu, Tengyu, et al.
Published: (2024) -
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
by: He, Yun, et al.
Published: (2024)